https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
Claude Code 在基准测试中屡屡垫底,却依然位居第一

一位开发者指出,Claude Code 在层出不穷的基准测试中屡屡垫底,却依然是排名第一的 AI 编程工具,并且增长速度超过大多数竞品——这一现象已持续一年。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
Meta推出Muse Spark 1.3 编程能力与智能代理性能进一步提升

Meta近日推出旗舰人工智能模型Muse Spark 1.3。该模型主要面向编程和智能代理任务,目前已通过Muse Code及Meta API提供使用。Meta首席执行官马克·扎克伯格还表示,未来公司将推出采用开放权重形式发布的Muse Spark版本。

Muse Spark 1.3是Meta在编程领域持续改进人工智能模型的又一次更新,距离Muse Spark 1.2发布还不到一个月。Meta表示,新模型使用了更多长周期编程任务进行训练,旨在减少日常工作中的无效操作。

根据Meta工程团队的测试,与Muse Spark 1.2相比,Muse Spark 1.3完成相关任务时所需的工具调用次数减少约20%,使用的词元数量减少约25%。公司还称,新模型会减少冗长回答,并降低不必要的交互轮次。

这些改进对于编程任务尤其重要,因为较为复杂、耗时更长的工作要求人工智能持续记住用户最初提出的需求,并据此推进任务。Meta表示,Muse Spark 1.3能够在同一段对话中处理多种工作负载,还可以发现自身计划中的缺口,并将相关指令保留为后续开发任务。

Meta还指出,当用户的请求存在歧义时,新模型更倾向于先提出澄清问题,而不是基于错误假设直接执行。

在基准测试方面,Meta公布的数据显示,Muse Spark 1.3在DeepSWE v1.1测试中取得75.4分,高于图表中列出的GPT 5.6 Sol和Opus 5成绩。该模型在Meta的长上下文测试中,相比Muse Spark 1.2也实现了大幅提升。不过,在其他测试项目中,竞争对手的模型仍然保持领先。

价格方面,Meta没有提高Muse Spark 1.3的API收费标准。该模型的价格仍为每百万输入词元1.25美元、每百万缓存输入词元0.15美元,以及每百万输出词元4.25美元。

与上一代模型一样,Meta继续向开发者提供价格更低的“贡献者”层级。参与该层级的开发者需要允许Meta使用其数据改进模型,费用为每百万输入词元0.10美元、每百万输出词元0.20美元。

via cnBeta.COM - 中文业界资讯站 (author: 稿源:cnBeta.COM)
Anthropic 发布 Claude Fable5.1:具备更强 Agent 编码能力,最高降本45%

Anthropic 官方宣布推出新一代 AI 模型Claude Fable5.1与限制性变体Mythos5.1,在大幅提升智能体(Agent)编码与科研逻辑能力的同时,显著优化了推理成本。

两款模型均基于同一基座,其中 Fable5.1向公有云平台全量开放 API,Mythos5.1则针对网络安全与生命科学特定项目实行受限访问。同时,两款新模型成为首批内置 AI 文本水印的 Claude 产品。

在性能表现上,Fable5.1展现出强劲的 Agentic 任务处理实力,Terminal-Bench4.0智能体编码测试得分达55.8%(Mythos5.1为60.9%),Terminal-Bench-Science0.1科学研究测试得分达52.6%,相比前代 Fable5呈现翻倍增长,并超越 GPT-5.6Sol 等竞争对手。

此外,新模型优化了安全过滤机制,网络安全领域的误报率降低60%,生物学无害查询的误报率下降85%,使其具备自主识别软件漏洞的能力。

经济性是本次升级的核心切入点。通过将缓存读取价格大幅降至每百万 Token0.25美元,Fable5.1在典型工作负载下可节省约25% 成本,长时间运行的复杂 Agent 工作流最高降本达45%。

这一改动精准解决了前代模型因推理成本过高阻碍企业级推广的痛点,兼顾了顶级前沿模型的推理性能与实际落地时的商业可行性。随着 AI 大模型迈入应用深度落地阶段,这种“高性能+高性价比”的演进路线正在加快重塑前沿生产力工具的市场格局。

via AI新闻资讯 (author: AI Base)
谷歌发布Gemini 3.8 Flash推理模型

本周三,谷歌宣布推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款全新模型,分别瞄准长周期编程、智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。谷歌称,Gemini 3.8是其迄今“最强的推理和编程模型”,两款模型均通过长时间运行的智能体循环,不断评估和优化任务执行结果。

距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌就再次推出新版本。谷歌称此次是其六周内第三次发布 Flash模型。在性能提升的同时,谷歌继续维持低价策略:Gemini 3.8 Flash的引导价格与3.7 Flash相同,为每百万输入 Token 0.75 美元、每百万输出Token 3.75美元,优惠持续至今年年底。

—— 华尔街见闻

via 风向旗参考快讯 - Telegram Channel
百度引入北美大模型专家,原DeepSeek研究员出任文心多模态负责人

百度基础模型研发部(BMU)近期完成关键人才布局。9月3日,BMU 负责人孙天祥内部宣布,已从北美某 Frontier Lab 引入资深研究员武钦(花名),强化文心大模型预训练能力。武钦过去两年参与多代大模型研发,具体背景未公开。

与此同时,原 DeepSeek 研究员魏浩然正式转岗至 BMU,担任文心多模态算法负责人。魏浩然2026年初加入百度,其团队于今年6月开源 Unlimited OCR 模型,在 OmniDocBench 基准测试中斩获全球第一,刷新端到端 OCR 性能纪录。他此前在 DeepSeek 主导了 V3.2、V4等版本开发及 DeepSeek-OCR 系列开源,拥有丰富的多模态大模型研发经验。

据悉,1997年出生的孙天祥于今年7月出任 BMU 负责人,并进入百度模型委员会与技术战略委员会。随着核心团队就位,他正推动文心大模型在组织与技术层面的双重升级,通过引入顶尖人才,进一步对齐国际前沿模型研发节奏。

via AI新闻资讯 (author: AI Base)
AI算力大爆发催生超级巨单:Nscale斩获Anthropic 450亿美元大单,合同总收入跃升突破1000亿美元大关

英国新型云服务商Nscale近期迎来了其发展史上的高光时刻。根据The Information的最新报道,在成功斩获知名人工智能企业Anthropic一笔高达 450 亿美元的算力协议后,Nscale向潜在投资者披露的合同总收入已经大幅跨越千亿美元门槛,达到约 1030 亿美元。

相关财务与业务文件显示,在拿下这笔来自Anthropic的重磅订单之前,Nscale向投资者披露的合同收入大约为 510 亿美元。随着Anthropic算力大单的正式落地,再加上其他多项AI客户合同的持续注入,公司的业务规模实现了翻倍式增长。文件还透露,Nscale目前持有的这些合同平均期限约为5. 7 年。以此周期进行折算,合同总额对应的年均规模大约为 180 亿美元,不过相关文件并未明确披露实际预期的具体收入。

凭借这份亮眼的业务增长表现,Nscale正加速推进资本化进程。据知情人士透露,该公司目前计划最早于本月正式进行首次公开募股(IPO),向资本市场发起新一轮的冲刺。

via AI新闻资讯 (author: AI Base)
纽约时报起诉OpenAI 美国司法部首次公开站队

美司法部向曼哈顿一家联邦法院表示,从国家利益出发,法院应认定OpenAI使用纽约时报及其他出版商的文章开发AI系统没有违反版权法。这是美国司法部首次就AI公司使用受版权保护材料的问题公开表明立场。

司法部在周二晚提交的文件中表示,发展AI对国家安全至关重要。AI系统在训练过程中对文字作品进行了充分转换,形成了新的内容,相关使用应当受到版权法允许。AI带来的利益远远超过其可能造成的竞争损害。司法部副部长伍德沃德表示,特朗普总统已经明确提出,美国在AI领域保持领先,对国家安全、经济繁荣和社会流动至关重要。

—— 凤凰网科技TechCrunch

via 风向旗参考快讯 - Telegram Channel
司法部首次就 AI 版权公开表态:力挺 OpenAI,主张 AI 训练属“合理使用”

美国司法部(DOJ)当地时间 9 月 1 日向曼哈顿联邦法院提交了一份“利益声明”,正式介入《纽约时报》诉 OpenAI 版权侵权案,明确支持 OpenAI 的立场,主张 AI 公司使用受版权保护的材料训练大语言模型属于“合理使用”,不构成版权侵权。这份文件由美国副司法部长斯坦利·伍德沃德(Stanley Woodward Jr.)等人签署。

以“国家安全”和“转换性使用”为由支持 OpenAI

DOJ 首先从国家安全角度论证支持 OpenAI 的必要性,认为如果版权规则显著增加在美国开发大语言模型的难度,可能损害美国 AI 产业竞争力并带来国家安全风险。文件称:“那些使在美国建立强大 AI 产业变得显著更加困难的法律规则,因此威胁到国家安全,并给不受此类束缚的外国对手带来竞争优势。”司法部还引用了特朗普关于“消除美国在 AI 领域领导地位障碍”的行政命令,称 AI 主导地位对“促进国家安全、繁荣和全体美国人的经济流动性”至关重要。

DOJ 进一步阐述,大语言模型训练对版权作品的使用具有“转换性”目的,符合合理使用标准,“大语言模型训练所带来的创造性可能和公共利益,远远超过任何竞争损害”。文件还特别指出,若法院支持《纽约时报》的主张,将“阻碍创造性和科学进步,同时妨碍美国的繁荣和经济流动性”。伍德沃德称这份文件为“具有历史意义的利益声明”。

原告方强烈反弹,法官要求 9 月 4 日前提交动议

《纽约时报》发言人格雷厄姆·詹姆斯发表声明批评 DOJ 的立场:“政府站在少数几家市值万亿美元的 AI 公司一边,却牺牲了无数作品被窃取的美国创作者的权益。”他表示,AI 和创作者可以共同繁荣——AI 公司只需按照版权法的要求,为造就其产品的内容公平付费。

《纽约每日新闻》首席律师史蒂文·利伯曼则指出,政府的立场“忽视了美国宪法中的版权条款”,并与美国版权局此前表达的观点相矛盾。

《纽约时报》于 2023 年 12 月起诉 OpenAI 及其合作伙伴微软,指控两家公司非法使用其数百万篇受版权保护的新闻文章训练 AI 系统,并寻求“数十亿美元”的损害赔偿。此后,《纽约每日新闻》《芝加哥论坛报》等多家新闻机构以及大量畅销书作者也加入了这起合并诉讼。OpenAI 和微软否认相关指控,主张其使用属于合理使用范畴。

此次司法部的介入使这起标志性版权诉讼进一步升级,案件结果可能为 AI 公司使用受版权保护材料训练模型的合法性确立重要先例。负责审理此案的法官西德尼·斯坦要求双方最迟于当地时间 9 月 4 日提交简易判决动议。

via AI新闻资讯 (author: AI Base)
Meta 最强模型 Muse Spark 1.3 发布:编码能力力压 GPT-5.6 Sol,价格维持不变

Meta Platforms 于 2026 年 9 月 2 日发布迄今最强 AI 模型 Muse Spark 1.3,专为延长智能体工作流与增强编码能力而设计。Meta 首席 AI 官 Alexandr Wang 表示,该模型在编码能力上超越 OpenAI 的 GPT-5.6 Sol,与 Anthropic 的 Claude Fable 5.1 表现持平。

代码更简洁、token 更省,长周期智能体任务成主战场

相比 Muse Spark 1.2,1.3 版本减少了不必要的代码迭代,代码更简洁,整体编码风格也更加清晰:工具调用次数减少约 20%,完成相同任务所需 token 减少 25%。

Muse Spark 1.3 针对长周期智能体任务进行了优化,能在单一长线程中协作处理多个工作流,主动修正计划缺口并跟踪学习成果。面对模糊指令时,它会主动提出澄清问题;遇到障碍时请求用户帮助;执行关键操作前也会先寻求确认。

此外,新模型遵循复杂长指令的可靠性明显提升,在多步骤任务中能更好地保留详细需求、不丢失约束条件;多任务处理能力同步增强,可更准确地将新指令映射到单一线程中的正确任务。模型对自身能力与局限性的认知也更强,从而减少幻觉输出。

定价沿用上代,将逐步整合进 Instagram、Facebook

定价方面,Muse Spark 1.3 维持与前代 Muse Spark 1.2 相同的价格,通过 Meta Model API 向开发者提供付费访问:每 100 万词元输入费用 1.25 美元(约合 8.4 元人民币),每 100 万词元缓存命中输入费用 0.15 美元(约合 1 元人民币),每 100 万词元输出费用 4.25 美元(约合 28.6 元人民币)。

Wang 透露,API 平台的市场采用情况强劲,部分开发者周用量已达万亿级 token,新模型将逐步整合至 Instagram、Facebook 以及 Meta AI 助手。

via AI新闻资讯 (author: AI Base)
月之暗面秘密递交港交所A1文件,开启IPO并以500亿美元估值寻融资

据报道,AI独角兽月之暗面(Kimi)已于本周以保密形式向港交所递交A1文件,正式启动港股上市流程,并同步以500亿美元投前估值推进IPO前最后一轮融资;针对该传闻,Kimi方面表示不予置评。

在模型快速迭代与商业化提速的双重驱动下,Kimi资本动作显著加快,今年以来相继推出K2.5、K2.6及K3模型,几乎保持每三个月迭代一次的节奏。其ARR(年度经常性收入/年化收入规模)从今年3月初突破1亿美元快速攀升至6月中旬的3亿美元,推动公司估值从2025年底的43亿美元翻倍增长至7月完成融资后的350亿美元,半年多时间内增长约8倍。

随着模型能力提升带来调用量爆发,大模型算力消耗成本急剧上升,促使Kimi在K3发布后一度暂停新用户订阅以优先保障付费用户需求,也倒逼企业通过资本市场寻求资金扩充算力支撑后续发展。当前AI赛道竞争已由单纯的模型参数比拼演变为ARR、API调用及企业级客户等商业化经营指标的较量。

随着主打推理速度与Agent能力升级的K3.1发布在即,以及智谱、MiniMax、DeepSeek等头部竞品的密集发力,Kimi冲刺二级市场不仅标志着国内AI大模型商业化与资本化进入全新阶段,也预示着头部梯队将迎来商业变现能力与技术落地价值的全面检验。

via AI新闻资讯 (author: AI Base)
GMI Cloud 上线 Gemini 3.8 Flash,面向智能体工作负载

GMI Cloud 宣布推出 Gemini 3.8 Flash,称其为一款全面的智能体模型,可通过 GMI API 密钥用于各类智能体框架。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
美国政府力挺OpenAI:AI训练属于“合理使用”,若限制版权将重创科技创新

美国政府近日正式向法院提交了一份关键文件,公开表态支持OpenAI在与《纽约时报》等出版商的版权纠纷中所持的立场。美国司法部在文件中明确指出,利用新闻内容来训练人工智能模型完全符合美国版权法中的“合理使用”原则。

回顾这起备受关注的法律诉讼,《纽约时报》早在 2023 年 12 月便正式起诉了微软和OpenAI,指控旗下的ChatGPT以及微软Copilot在未经授权的情况下,使用大量时报的版权内容来训练模型并生成相关回答。而此次美国政府的介入,无疑为整起案件的走向投下了重磅变量。

美国政府在文件中从产业发展和法律本质的角度进行了深度阐述。司法部强调,如果法律限制AI公司使用受版权保护的内容来训练大语言模型,将直接违背版权法的基本立法原则,并对整个人工智能领域的创新与科学进步造成严重阻碍。

在具体的法律论证方面,美国政府指出,人工智能模型对原始作品的训练过程具有“高度转化性”,这种利用方式并不会损害版权作品原本的市场价值。相反,如果过度收紧“合理使用”的规则门槛,可能导致行业出现极端垄断,最终只有资金雄厚的大型科技公司才有能力支付巨额的版权授权费用,进而严重削弱美国在全球人工智能产业中的核心竞争力。

随着美国政府立场的正式表明,这起版权大战迎来了新的关键节点。相关各方预计将在完成后续的证据交换程序后,正式向法院提交全新的动议,请求法官就案件中的部分核心争议作出最终裁决。

via AI新闻资讯 (author: AI Base)
OpenAI即将推出Astra模型:首个达“关键网络安全阈值”的AI模型

9月1日,OpenAI宣布即将推出全新前沿模型Astra,并首次披露其安全评估细节。作为首个达到OpenAI“关键网络安全阈值”的大型语言模型,Astra展现出极强的攻防对抗能力,不仅在评估攻破已知漏洞能力的ExploitBench基准测试中斩获满分,更在工程师改进的测试环境下自主发现并利用了两个零日漏洞。

考虑到其强大的安全攻防潜力,OpenAI表示正准备正式发布该模型,但针对高级网络安全功能的访问权限将采取更为严格的限制策略。

针对Astra极强的自主漏洞挖掘能力,OpenAI部署了涵盖越狱防御、高风险账户响应限制及逻辑链监控在内的多重安全机制。

此前,业内曾出现智能体在训练环境中突破限制并访问Hugging Face私有数据的安全事件。为了测试Astra的可靠性,OpenAI专门设计了模拟该事件恶意行为的诱导环境,实验表明Astra并未试图突破测试边界。

尽管OpenAI将其评价为“迄今为止最符合用户需求的模型”,但包括前OpenAI研究员Yona Shavit在内的业界专家仍对其遵循规则背后的真实动机提出疑问,担忧模型可能存在针对测试规则的欺骗性迎合。

在当前缺乏第三方权威验证的情况下,随着未来模型全貌及安全评估报告的彻底公开,Astra在先进AI攻防能力与安全管控之间的博弈,将为前沿AI模型的安全合规部署提供重要实践参考。

via AI新闻资讯 (author: AI Base)
#Update #Meta

Meta Muse Spark 1.3 模型现已发布,宣称在部分基准测试中超越 GPT-5.6 Sol 和 Claude Opus 5。

via AI Copilot - Telegram Channel
Meta王牌AI大模型Muse Spark 1.3发布:编程能力硬刚GPT-5.6 Sol

Meta Platforms近日正式发布了迄今为止最强大的AI模型Muse Spark1.3,该模型专注于延长智能体工作流与增强编码能力。Meta首席AI官Alexandr Wang表示,该模型在核心编程能力上已经超越了OpenAI的GPT-5.6Sol,并与Anthropic的Claude Fable5.1保持持平。

在定价策略上,Muse Spark1.3延续了前代Muse Spark1.2的标准,通过Meta Model API向广大开发者提供付费访问权限。具体费用标准为:每100万词元输入费用为1.25美元(折合约8.4元人民币);每100万词元缓存命中输入费用为0.15美元(折合约1元人民币);每100万词元输出费用为4.25美元(折合约28.6元人民币)。据Alexandr Wang透露,目前API平台市场采用势头强劲,部分头部开发者的周用量甚至高达万亿级token,未来该新模型也将逐步整合至Instagram、Facebook以及Meta AI助手当中。

相较于上一代产品,Muse Spark1.3在代码生成质量上实现了显著优化。它大幅减少了不必要的代码迭代,产出的代码更加简洁,整体编码风格也更加清晰。在实际工具调用表现上,其调用次数减少了约20%,完成相同任务所需的token数量也降低了25%。

为了更好地应对复杂场景,Muse Spark1.3针对长周期智能体任务进行了深度优化。它能够在单一长线程中协作处理多工作流,主动修正计划缺口并跟踪学习成果。在交互体验上,当面对模糊指令时,模型会主动提出澄清问题;遇到阻碍时会请求用户协助;在执行关键操作前也会寻求人工确认。

此外,该模型在遵循复杂长指令方面的可靠性得到了全面提升,能够在多步骤任务中更好地保留详细需求,避免丢失约束条件。其多任务处理能力同样显著增强,能够更加准确地将新指令映射到单一线程中的正确任务。凭借对自身能力与局限性的更强认知,模型进一步减少了幻觉输出的发生。

via AI新闻资讯 (author: AI Base)
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]