https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
Gemini 3.6 Flash 现已发布并全平台可用。
该模型相较于前代小幅提升了性能,并改进了 token 效率。
与此同时,3.5 Pro 正在测试并将「尽快开放」,Gemini 4 系列也已经开始预训练。
via AI Copilot - Telegram Channel
科技圈🎗在花频道📮:
🤖 谷歌宣布推出 Gemini 3.5 Flash 模型,Gemini 3.5 Pro 将于下个月推出 Google 正式发布 Gemini 3.5 系列模型,首款推出的 Gemini 3.5 Flash 现已在全球上线。该模型主打“智能体(Agentic)”能力,在编程、多步骤工作流和长程任务处理方面表现突出。相比同类模型,其输出速度提升了 4 倍,且成本大幅降低。性能更强的 Gemini 3.5 Pro 预计于下个月推出。 Google 🌸 在花频道 · 备用频道 · 投稿通道
谷歌发布 Gemini 3.6 Flash,并透露 Gemini 4 已启动预训练
谷歌发布 Gemini 3.6 Flash,称新模型较 3.5 Flash 减少 17% 输出 Token,并通过更少的推理步骤和工具调用完成多步任务。其代码生成、知识工作和计算机操作能力均有提升,知识截止日期更新至 2026 年 3 月;API 定价为每百万输入 Token 1.5 美元、输出 Token 7.5 美元。
谷歌同时推出面向高吞吐、低延迟场景的 Gemini 3.5 Flash-Lite,以及用于发现和修复代码漏洞的 3.5 Flash Cyber。前两款模型已上线 Gemini 应用和开发平台;谷歌还表示 Gemini 3.5 Pro 正在与合作伙伴测试,DeepMind 已启动 Gemini 4 的大规模预训练。
9to5Google
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
美国财政部长斯科特·贝森特于周二表示,特朗普政府将对中国的人工智能模型是否通过蒸馏技术从美国模型中获取成果展开调查,并强调美国政府绝不支持知识产权盗窃行为。
当前,中国开源模型在性能上正逐步追赶OpenAI和Anthropic等美国领先企业的核心产品,这引发了美国技术高管及政府官员对于美国在人工智能全球竞赛中领先地位能否持久的担忧。本月初,中国初创公司月之暗面发布了名为Kimi K3的新模型,该模型在部分行业基准测试中的表现已超越了上述美国公司的产品。
贝森特在接受福克斯商业频道采访时指出,如果发现海外模型在窃取美国优秀企业的成果,美方完全有能力针对这种盗窃行为实施制裁。
贝森特解释称,这种行为在技术上被称为“模型蒸馏”,即利用现有更强模型的输出结果来训练构建一个体积更小、能力稍逊的模型。上个月,Anthropic曾向美国参议院银行、住房和城市事务委员会致信,指控中国科技企业阿里巴巴实施了迄今为止规模最大的蒸馏攻击。
根据路透社周二的报道,美中两国计划于今年9月就人工智能议题举行相关会谈,届时贝森特将代表美方出席讨论。
贝森特在采访中表示,美方在许多中国模型中发现了美国大型语言模型的数字水印,这是令人无法接受的,美方将在未来几天或几周内对此进行深入调查。
不过,Anthropic与OpenAI近年来自身也面临过类似的版权侵权指控。去年9月,Anthropic同意支付15亿美元,以和解一群作家提起的集体诉讼,这些作家指控该公司非法下载并使用盗版数据库中的书籍进行训练。《纽约时报》也曾在2023年起诉OpenAI及微软,指控其未经授权使用该报的知识产权来训练AI模型。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:cnBeta.COM)
↩️ DeepSeek-V4 正式版启动灰度测试,预计 7 月底发布
DeepSeek-V4 正式版启动灰度测试,预计 7 月底发布
DeepSeek-V4 正式版近日启动小规模灰度测试,包含 Pro 与 Flash 两个版本,预计 7 月底发布,较原定计划有所推迟。新版本综合能力对标 Anthropic Opus 4.8,代码生成接近 OpenAI GPT-5.6 Sol,重点优化推理效率与智能体能力,可依靠单条指令生成 3D 射击游戏、HTML 网页游戏等。
V4 完成去 CUDA 化突破,上线首日兼容华为昇腾、寒武纪等八类国产 AI 芯片。正式版上线后,API 将新增峰谷分时定价,每日 9:00-12:00 与 14:00-18:00 高峰时段资费为平峰两倍。有开发者指出,其处理同类任务需更多迭代次数,综合能力略逊于月之暗面上周发布的 Kimi K3,但服务定价更具优势。
腾讯新闻
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
科技圈🎗在花频道📮:
🤖 DeepSeek V4 正式版计划 7 月中旬上线,引入峰谷定价机制 DeepSeek V4 正式版计划 7 月中旬上线,并将在发布后同步调整 API 定价,引入峰谷定价机制。高峰时段为北京时间每日 9:00 至 12:00、14:00 至 18:00,调价前 24 小时会通过邮件告知用户。 deepseek-v4-pro 每百万 tokens 输入缓存命中为平时 0.025 元、高峰 0.05 元,缓存未命中为 3 元和 6 元,输出为 6 元和 12 元;deepseek-v4-flash 对应为…
DeepSeek-V4 正式版启动灰度测试,预计 7 月底发布
DeepSeek-V4 正式版近日启动小规模灰度测试,包含 Pro 与 Flash 两个版本,预计 7 月底发布,较原定计划有所推迟。新版本综合能力对标 Anthropic Opus 4.8,代码生成接近 OpenAI GPT-5.6 Sol,重点优化推理效率与智能体能力,可依靠单条指令生成 3D 射击游戏、HTML 网页游戏等。
V4 完成去 CUDA 化突破,上线首日兼容华为昇腾、寒武纪等八类国产 AI 芯片。正式版上线后,API 将新增峰谷分时定价,每日 9:00-12:00 与 14:00-18:00 高峰时段资费为平峰两倍。有开发者指出,其处理同类任务需更多迭代次数,综合能力略逊于月之暗面上周发布的 Kimi K3,但服务定价更具优势。
腾讯新闻
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
Elevated errors on Haiku 4.5
Jul 21, 13:04 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Jul 21, 13:04 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Elevated errors across Fable 5
Jul 21, 11:24 UTC
Update - We are continuing to investigate this issue.
Jul 21, 11:19 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Jul 21, 11:24 UTC
Update - We are continuing to investigate this issue.
Jul 21, 11:19 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Image generation unavailable for some ChatGPT users
Status: Identified
We have identified that users are experiencing elevated errors for the impacted services. We are working on implementing a mitigation.
Affected components
● Image Generation (Degraded performance)
via OpenAI status
Status: Identified
We have identified that users are experiencing elevated errors for the impacted services. We are working on implementing a mitigation.
Affected components
● Image Generation (Degraded performance)
via OpenAI status
Elevated errors across models
Jul 21, 10:11 UTC
Investigating - We are currently investigating issues with Claude Haiku 4.5 and Opus 4.8.
via Claude Status - Incident History
Jul 21, 10:11 UTC
Investigating - We are currently investigating issues with Claude Haiku 4.5 and Opus 4.8.
via Claude Status - Incident History
美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需
OpenAI前首席技术官穆拉蒂离开老东家后交出的第一份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布首款模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺第一。
单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。
真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。
一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室,首款模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现最强的模型,无论开放模型还是闭源模型。
把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。
当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的第一梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。
之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。
穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。
但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。
Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。
真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有顶尖团队、充足资金和英伟达最新训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。
按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准第一。
公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准第一并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。
美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%,最高一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测最强的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分顶级闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。
与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。
这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。
从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。
via AI新闻资讯 (author: AI Base)
OpenAI前首席技术官穆拉蒂离开老东家后交出的第一份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布首款模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺第一。
单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。
真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。
一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室,首款模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现最强的模型,无论开放模型还是闭源模型。
把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。
当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的第一梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。
之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。
穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。
但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。
Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。
真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有顶尖团队、充足资金和英伟达最新训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。
按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准第一。
公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准第一并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。
美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%,最高一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测最强的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分顶级闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。
与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。
这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。
从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。
via AI新闻资讯 (author: AI Base)
网络安全这道防线,正在被一种新的作战单元重新定义。7月21日,日本人工智能初创企业Sakana AI发布专为应对现代网络防御复杂性而打造的Fugu Cyber模型,它在业界最具挑战性的安全基准测试里交出了足以压过头部闭源对手的成绩。
具体来看,Fugu Cyber在CyberGym测试中达到86.9%的成功率,在CTI-REALM测试中达到72.1%的成功率,表现甚至优于OpenAI的GPT-5.5-Cyber与Anthropic的Claude Mythos-Preview。这意味着,面对真实而刁钻的攻防场景,这家初创公司的专用模型已经跑到了通用旗舰的前面。
Fugu Cyber的能力来源于它的系统形态。与标准版Fugu一脉相承,它是一个被封装成单一API的多智能体系统,针对用户的每一次请求,系统会动态编排不同的专业智能体,协作处理复杂的多步骤任务,而不是靠单个模型硬扛。除了这套简洁的API,Sakana AI还提供由企业应用团队支持的网络安全解决方案实地部署服务,把模型能力直接搬进客户的生产环境。
via AI新闻资讯 (author: AI Base)
在最近的一次分析中,Wojciech Gryc 探讨了 Anthropic 的 Fable 5 与两款中国新模型的市场竞争情况。Moonshot 于 7 月 16 日推出的 Kimi K3 和阿里巴巴于 7 月 19 日发布的 Qwen 3.8 都达到了与 Fable 5 相似的性能,并且这两款模型将开源其权重。
Gryc 指出,训练前沿 AI 模型的主要成本来自研究人员和算力,但在模型训练完成后,推理成本才是真正的开销。每当用户调用 API 时,都会消耗大量的 GPU 资源和电力。他认为,如何支付推理成本将直接影响公司的商业模式。
他将 AI 公司分为三类:第一类是租用数据中心并支付电费的公司,如 Anthropic、Moonshot 和智谱(GLM 5.2);第二类是自建数据中心的公司,如 Meta 和阿里巴巴;第三类是拥有自发电能力和自建数据中心的公司,如 SpaceX。Gryc 强调,拥有基础设施的公司即使在模型性能上不是最优,依然能通过出租服务器获得盈利。
此外,Gryc 指出 Anthropic 的 Fable 5 在单个任务的推理成本上几乎是 OpenAI 和开源模型的三倍。这样的高成本在竞争激烈的市场中是否能被用户接受,是一个值得关注的问题。他认为,当前市场上的基准测试已趋于饱和,用户对于模型的感知差异远低于成本差异,可能导致 Anthropic 面临被市场抛弃的风险。
与之相比,OpenAI 则凭借其全面的产品线和数据中心的布局展现出更强的市场竞争力。Gryc 预计,当前这一波竞争将持续发展,多家实验室可能会在未来不断超越传统的美国科技巨头。
划重点:
🌟 Fable 5 的推理成本是 OpenAI 和开源模型的三倍,面临市场压力。
🔍 Gryc 将 AI 公司分为三类,指出基础设施的重要性。
📈 竞争持续加剧,多家中国实验室正在快速追赶甚至超越美国公司。
via AI新闻资讯 (author: AI Base)
OpenAI宣布扩大ChatGPT家长通知功能,当青少年用户因违反暴力威胁或网络暴力政策被封号时,已关联账号的父母和监护人将收到提醒。
此前,OpenAI推出家长控制功能,支持家长关联未成年子女账号,设置使用限制、减少敏感内容,并在发现自残风险时发送警示。此次升级后,系统将进一步覆盖可能伤害他人的风险行为。
该功能由OpenAI与网络暴力监测机构Moonshot共同开发。Moonshot表示,在严重风险出现时及时通知家长,有助于家庭尽早介入并采取措施。
OpenAI此次强化安全机制,也与AI使用风险争议有关。2025年加拿大枪击事件调查发现,嫌疑人曾使用ChatGPT,OpenAI随后承诺加强安全措施。
此外,OpenAI还在家长控制页面加入“学习模式”,通过提示引导学生思考,而非直接提供答案;针对青少年长时间使用ChatGPT的情况,系统也将增加休息提醒。
随着AI助手进入教育等场景,未成年人安全使用成为行业重点议题,OpenAI正在通过监管工具和交互设计提升AI产品的安全性。
via AI新闻资讯 (author: AI Base)
Elevated errors on Haiku 4.5
Jul 21, 07:11 UTC
Identified - The issue has been identified and a fix is being implemented.
via Claude Status - Incident History
Jul 21, 07:11 UTC
Identified - The issue has been identified and a fix is being implemented.
via Claude Status - Incident History
节省 40 亿元还是触发监管?微软拟为Copilot引入国产AI模型陷两难
为了降低高昂的AI运营成本,微软目前正在评估将中国人工智能公司月之暗面研发的Kimi K3 模型引入其Copilot服务。此前该服务主要依赖OpenAI与Anthropic的技术,而新模型的加入有望重塑其底层架构。
性能出众兼具降本优势,每年最高可省 6 亿美金
作为全球参数规模最大的开源模型,Kimi K3 在编程等多项权威评测中展现出了媲美顶级模型的卓越性能。微软内部测算显示,切换至该模型后单个Token的推理成本最高可降低60%,每年将为公司节省约6. 02 亿美元的开支。
巨额收益碰撞政治风险,政策红线成最大隐忧
然而,这项极具商业诱惑力的决策正面临着严峻的外部政治考量与政策风险。当前美国政府正计划进一步限制本土企业使用中国AI模型,甚至可能出台针对性的禁用禁令。
如果在旗舰产品中深度整合中国开源技术,微软极有可能招致白宫方面的强烈不满与审查。面对巨大的经济利益与复杂的政治局势,微软目前依然处于谨慎权衡与抉择的阶段。
via AI新闻资讯 (author: AI Base)
为了降低高昂的AI运营成本,微软目前正在评估将中国人工智能公司月之暗面研发的Kimi K3 模型引入其Copilot服务。此前该服务主要依赖OpenAI与Anthropic的技术,而新模型的加入有望重塑其底层架构。
性能出众兼具降本优势,每年最高可省 6 亿美金
作为全球参数规模最大的开源模型,Kimi K3 在编程等多项权威评测中展现出了媲美顶级模型的卓越性能。微软内部测算显示,切换至该模型后单个Token的推理成本最高可降低60%,每年将为公司节省约6. 02 亿美元的开支。
巨额收益碰撞政治风险,政策红线成最大隐忧
然而,这项极具商业诱惑力的决策正面临着严峻的外部政治考量与政策风险。当前美国政府正计划进一步限制本土企业使用中国AI模型,甚至可能出台针对性的禁用禁令。
如果在旗舰产品中深度整合中国开源技术,微软极有可能招致白宫方面的强烈不满与审查。面对巨大的经济利益与复杂的政治局势,微软目前依然处于谨慎权衡与抉择的阶段。
via AI新闻资讯 (author: AI Base)