https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
路透社根据对80多份中国学术论文和专利的审查报道称,中国军方及相关研究机构正利用美国顶级人工智能模型(如OpenAI和Anthropic旗下产品)的输出数据,来训练本土AI系统以提升国防能力。
报道指出,尽管美国政府持续收紧对华高精尖芯片及战略技术的出口限制,中国军事与安全相关机构仍将美方先进AI模型作为快速开发专用系统的途径。相关论文与专利展示了一种被称为“模型蒸馏”的技术应用,即利用强力AI系统的输出来训练体积更小、更具针对性的模型。这种做法无需从零开始构建前沿AI所需的庞大算力,即可将模型部署在本地或边缘设备上。
相关研究涵盖了从社交媒体监测到前线军事部署的广泛场景。例如,山西的北中科技大学研究人员曾利用Anthropic的Claude 3 Haiku生成合成训练数据,用于文本分类及内容审查模型;国防科技大学在2024年发表的一篇论文中,展示了如何通过蒸馏技术压缩图像处理模型,使其能够安装在无人机上,即使在通信中断的情况下也能实时分析视频并辅助导航与打击决策;军事科学院的研究人员则将蒸馏后的目标识别模型应用于模拟海上无人艇与潜艇演习中。此外,解放军96941部队的研究人员曾使用GPT-3.5处理敏感代码,并利用其生成的摘要训练出可完全在军用内网运行的国产模型。
这一现象正成为中美人工智能竞争与治理谈判中的新焦点。美方官员指责部分中国实体通过抽取美国AI模型的能力来规避出口管制和侵犯知识产权;中方则坚决否认相关指控,强调美国在搞AI“霸权”,并指出美国企业同样存在类似的技术实践。中国AI初创公司月之暗面(Moonshot)近期也明确澄清,其Kimi K3模型完全基于自主创新,并非依赖蒸馏技术。
行业专家分析认为,受限于高算力芯片的获取,中国政府目前在积极推广“模型轻量化”和边缘计算,引导科研资金投入至可运行于无人机、卫星等终端设备的AI技术。不过,蒸馏技术也存在局限性,蒸馏出的模型虽然成本更低、可控性更高,但其综合智能水平仍无法替代原生的前沿大模型,且中国军方学者也在同步研究如何防止自身模型被他人通过“无数据蒸馏”手段逆向工程破解。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:cnBeta.COM)
DeepSeek V4 正式版自 7 月中旬开启灰度测试后一度跳票,官方至今未公布确切发布时间。但多个新证据指向 8 月 3 日可能成为重要节点——硅基流动率先露出马脚。
该平台发布通知称,将于 8 月 3 日起将 DeepSeek V4 Pro 大模型的缓存命中价格从当前每百万 Token 0.1 元大幅上调至 1.0 元。如此突兀的涨价,最合理的解释只有 DeepSeek V4 正式版即将上线,否则很难解释硅基流动的动机。
API 提前"变聪明",服务频繁波动佐证灰度测试
另一关键信号来自开发者社区的实测验证。多名网友发现,部分 DeepSeek V4 相关 API 已能正确回答此前在不联网状态下无法答对的 Claude Opus 4.5、Sonnet 4.5 等模型发布日期。测试均通过 API 而非网页对话进行,且并非所有用户都能复现,这正是灰度测试分批放量的典型特征。
近期 DeepSeek 服务频繁出现不稳定情况,也从侧面印证了团队正不断小范围测试并撤回修改,为全面推送打磨稳定性。从 7 月中旬至今,一个月的时间里 DeepSeek 持续迭代,外界期待正式版的性能至少能达到 GLM 5.2 与 Claude Opus 4.8 之间的水平。
对手没闲着:OpenAI 降价 80%,GLM 反涨价
DeepSeek V4 的压力不仅来自技术层面。OpenAI 今日宣布 GPT-5.6 系列降价高达 80%,降价后的性价比直追 DeepSeek V4 Pro,再叠加多模态等优势,当前性价比最高的模型头衔已被 OpenAI 夺走。反观国内,GLM 最新订阅价格大涨 2 至 3 倍,反而让 GPT 的性价比优势更加凸显。在对手一边降价抢市场、一边涨价提营收的分化格局下,DeepSeek V4 能否用性能扳回一局,8 月 3 日或将给出第一份答卷。
via AI新闻资讯 (author: AI Base)
DeepSeek-V4-Flash(V4 Flash)正式版 API今日上线公测。据官方介绍,V4 Flash Agent能力大幅增强,在多项基准测试中,表现远超V4-Pro-Preview、智谱GLM-5.2等模型。
对于公开基准测试集中的Code Agent任务,正式版V4 Flash 使用DeepSeek Harness(即将发布)的极简模式作为框架进行测试,并使用max档位,topp=0.95,temperature=1.0。
目前,正式版V4-Flash已原生支持Responses API格式并针对 Codex进行了优化适配。V4-Flash-0731的模型结构、尺寸和V4-Flash-Preview保持一致,仅重新进行了后训练。本次仅升级了 DeepSeek-V4-Flash的API接口, DeepSeek-V4-Pro API及 APP/WEB 端模型未做更改。 DeepSeek-V4-Pro正式版将会尽快发布。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:新浪科技)
↩️ 法官称美政府封禁 Anthropic 证据不足
法官称美政府封禁 Anthropic 证据不足
美国联邦地区法官 Rita Lin 在周四听证会上表示,特朗普政府未提供足够证据,证明将 Anthropic 列为「供应链风险」并禁止联邦政府使用其 AI 技术的决定合理。政府以 Anthropic 公开批评国防部为由实施封禁,Lin 称这一逻辑「非常令人不安」,可能开创报复与政府意见不合的联邦承包商的先例;她还表示案卷记录「在某些方面对政府而言变得更糟了」。
争端源于 Anthropic 与国防部的合同谈判破裂:Anthropic 要求其 AI 不被用于对美国人进行大规模监控或致命武器决策,国防部则认为私营企业不应规定军方如何使用技术。Anthropic 于 3 月提起两起诉讼,Lin 此前已临时叫停封禁,目前正考虑是否永久撤销;政府律师称计划在 9 月 30 日前完成停用 Anthropic 产品。
TechCrunch | Bloomberg
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
科技圈🎗在花频道📮:
🤖 Anthropic 将就美国战争部供应链风险认定提起法律挑战 Anthropic 首席执行官 Dario Amodei 3 月 5 日发表声明称,公司于前一日收到美国战争部信函,被认定为美国国家安全供应链风险。Anthropic 表示不相信该行动具备法律依据,将在法庭上提出挑战。 声明指出认定适用范围狭窄,仅适用于客户将 Claude 直接用于与战争部合同相关的用途。Anthropic 将在过渡期内以名义成本继续向战争部和国家安全社区提供模型及工程师支持。 Anthropic 🍀在花频道 🍵茶馆聊天…
法官称美政府封禁 Anthropic 证据不足
美国联邦地区法官 Rita Lin 在周四听证会上表示,特朗普政府未提供足够证据,证明将 Anthropic 列为「供应链风险」并禁止联邦政府使用其 AI 技术的决定合理。政府以 Anthropic 公开批评国防部为由实施封禁,Lin 称这一逻辑「非常令人不安」,可能开创报复与政府意见不合的联邦承包商的先例;她还表示案卷记录「在某些方面对政府而言变得更糟了」。
争端源于 Anthropic 与国防部的合同谈判破裂:Anthropic 要求其 AI 不被用于对美国人进行大规模监控或致命武器决策,国防部则认为私营企业不应规定军方如何使用技术。Anthropic 于 3 月提起两起诉讼,Lin 此前已临时叫停封禁,目前正考虑是否永久撤销;政府律师称计划在 9 月 30 日前完成停用 Anthropic 产品。
TechCrunch | Bloomberg
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
科技圈迎来新一轮效率革命。字节跳动旗下 Seed 团队正式推出了Seedance2.5音视频联合生成模型,主打“一镜成片”能力,全面赋能多个产业场景。
在叙事表现上,Seedance2.5将单次生成时长由15秒扩展至30秒,并支持多轮无缝延长,让复杂的故事情节更加连贯。同时,模型对材质、光影及肤质进行了深度打磨,有效改善了传统生成视频的塑料感,呈现出更加贴近实拍的质感。
针对多元化的创意诉求,该版本大幅升级了多模态参考功能。创作者单次最多可输入30张图片、10段视频以及10段音频。白模参考与光照控制机制的加入,也使物理光影和运动轨迹更加真实稳定。
此外,Seedance2.5在后期剪辑和可控性方面进行了精细化升级,用户能够通过时间戳对画面视角、运镜节奏及绿幕背景等细节进行定向修改,从而降低后期拼接成本。目前,该模型正陆续登陆即梦 AI、豆包专业版等平台,API 服务也将于近期上线火山方舟。
via AI新闻资讯 (author: AI Base)
LG AI 研究院 7 月 31 日在 Hugging Face 上正式发布 K-EXAONE 2.0 模型,这是韩国科技信息通信部主权人工智能基金会模型项目下开发的第二代产品。新模型采用混合注意力 MoE 架构,拥有 7500 亿总参数和 370 亿激活参数,规模是初代的 3 倍以上,也是韩国迄今为止开发的最大人工智能基础模型。
值得一提的是,K-EXAONE 2.0 以 Apache 2.0 许可证完全开源,这在韩国 AI 发展史上颇为罕见。
性能全面提升,正面叫板中国开源模型
纵向对比,K-EXAONE 2.0 在 24 项基准测试中平均得分 70.1 分,比初代的 63.3 分提升超过 10%,三大编码和智能体编码基准测试中性能改进约 30%。横向来看更是野心勃勃——在长上下文理解方面优于智谱 GLM-5.1,在智能体工具使用能力上同样超越 GLM-5.1 和 Qwen3.5,在指令执行评估中则与 GLM-5.1、DeepSeek V4 Pro Max、Qwen3.5 等处于同一水平。
从初代到 2.0,LG AI 研究院仅用一代就将模型参数规模翻了三倍多,且在多项关键指标上直接对标中国头部开源模型。在 Kimi K3 引发的全球开源模型竞赛尚未降温之际,韩国以主权 AI 之名加入战局,意味着东亚 AI 开源生态的三角竞争格局正在成型。
via AI新闻资讯 (author: AI Base)
7月31日,DeepSeek-V4-Flash正式版API悄然上线公测,标志着这家国产大模型公司在Agent赛道上迈出关键一步。与以往"Pro强、Flash弱"的分层逻辑不同,此次更新后,Flash正式版在多项Agent基准测试中的表现已逼近甚至超越三个月前的V4-Pro预览版。
官方数据显示,V4-Flash正式版在Terminal Bench2.1上取得82.7分,Cybergym达76.7分,Toolathlon verified为70.3分。值得注意的是,该模型总参数2840亿,激活参数仅130亿,与V4-Pro(激活490亿)相差近一个数量级。DeepSeek明确表示,此次更新"仅重新进行了后训练",模型结构完全不变。这意味着,通过训练方法和数据质量的优化,轻量模型在特定任务上正缩小与旗舰模型的差距。
此次升级的另一看点,是自研Agent框架DeepSeek Harness首次以正式命名亮相。同时,V4-Flash原生支持OpenAI力推的Responses API格式,并针对性适配Codex,开发者可低成本将OpenAI生态的Agent应用迁移至DeepSeek平台。
战略意图十分清晰:用高性价比的轻量模型切入Agent应用市场。Agent场景对推理速度和成本极度敏感,Flash的低价优势在反复调用工具的多轮任务中将形成显著竞争力。
此次发布距离DeepSeek完成超500亿元首轮融资不足两月,公司估值已攀升至约710亿美元。在资本加持下,DeepSeek正加速从"不融资不上市"转向商业化冲刺。随着Pro正式版即将到来,Agent战争的大幕已然拉开。
via AI新闻资讯 (author: AI Base)
Anthropic发布最新安全报告披露,在内部安全测试过程中,旗下Claude系列模型曾因测试环境配置问题意外访问互联网,并未经授权进入三家不同机构的生产系统。事件涉及Claude Opus4.7、网络安全模型Claude Mythos5以及一款尚未公开发布的原型模型。Anthropic表示,此次事件源于测试环境配置失误,而非模型主动突破安全限制。
据介绍,这些模型当时正在执行内部“夺旗(Capture the Flag)”安全挑战,目标是在Anthropic内部网络中寻找隐藏的“旗帜”信息。由于Anthropic与评测合作伙伴之间存在沟通误差,模型实际上获得了互联网访问权限,尽管系统提示仍告知其无法联网。当模型发现外部网络入口后,将互联网上的目标系统误认为演练环境,并对三家机构实施了未经授权的访问。
Anthropic表示,模型主要利用弱密码等基础安全缺陷完成渗透,并未利用复杂漏洞实施攻击。公司还指出,最新一代模型在意识到目标属于真实互联网环境后主动停止了后续攻击,而部分早期模型则继续执行任务,导致三家机构受到影响。
事件曝光后,Anthropic对测试流程进行了全面审查,并承认如果在测试开始前充分验证网络访问路径、加强日志审计,或明确告知模型具备互联网访问能力,相关事件本可避免。公司已于7月27日通知评测合作伙伴及三家受影响机构,其中两家此前并不知道自身系统曾遭未经授权访问,第三家机构目前仍在联系中。
继OpenAI此前披露AI智能体在测试期间成功访问互联网并进入Hugging Face环境后,Anthropic此次公开事件再次凸显,随着AI智能体自主能力不断增强,测试环境隔离、权限控制和安全评估机制正成为行业亟需强化的重要环节。
via AI新闻资讯 (author: AI Base)
DeepSeek-V4-Flash 正式版 API 上线公测,V4-Pro 正式版将“尽快”发布
7 月 31 日,DeepSeek 通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。据悉,正式版 V4-Flash 原生支持 Responses API 格式并针对性适配 Codex。
官方还表示,本次仅升级了 DeepSeek-V4-Flash 的 API 接口,DeepSeek-V4-Pro API 及 APP / WEB 端模型未做更改,DeepSeek-V4-Pro 正式版将会尽快发布。
—— IT之家
via 风向旗参考快讯 - Telegram Channel
7 月 31 日,DeepSeek 通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。据悉,正式版 V4-Flash 原生支持 Responses API 格式并针对性适配 Codex。
官方还表示,本次仅升级了 DeepSeek-V4-Flash 的 API 接口,DeepSeek-V4-Pro API 及 APP / WEB 端模型未做更改,DeepSeek-V4-Pro 正式版将会尽快发布。
—— IT之家
via 风向旗参考快讯 - Telegram Channel
Degraded performance on Claude Sonnet 5
Jul 31, 06:18 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
Jul 31, 06:18 UTC
Investigating - We are currently investigating this issue.
via Claude Status - Incident History
在人工智能技术加速赋能日常工具的背景下,Google Earth(谷歌地球)近日正式推出了基于Nano Banana2模型的全新图像生成功能。通过将卫星、航空与3D实景地图同生成式AI深度融合,该功能允许全球网页端用户直接在地图上对现实地点进行视觉重塑。
作为该功能的亮点,用户只需在网页版谷歌地球中放大至特定目标区域,点击“创建 image”并输入描述性指令,即可基于真实地理数据生成深度契合实际地形的定制图像。这一技术不仅拓展了空间可视化的边界,也为多个行业应用场景提供了全新解法。
在教育领域,该功能使历史教学摆脱了纯文字的抽象感。教师带领学生观察世界遗产时,输入诸如渲染公元78年庞贝古城繁华街景的指令,废墟便能一键复原为充满罗马帝国风貌的立体场景。同时,结合 Gemini 的底层检索能力,系统还能够围绕地标建筑快速生成包含关键历史因果的直观信息图。
对于房地产开发与城市规划行业,这项技术显著降低了前期概念演示的门槛。无论是向客户展示东京空置地块改造为商业综合体的未来愿景,还是为买家模拟依山傍水的现代湖畔木屋,规划者只需输入具体需求,系统便能在原有自然地貌上实时渲染出具备高精度的3D设计效果,帮助团队在动工前更直观地评估方案。
此外,该工具也为大众提供了打破现实边界的趣味体验。用户可以将谷歌的山景城园区一键转化为充满赛博朋克风格的科幻乌托邦,直观感受百年后的视觉奇观。目前,该功能已面向全球网页端用户正式上线。
via AI新闻资讯 (author: AI Base)
科技圈🎗在花频道📮:
🤖 DeepSeek V4 正式版计划 7 月中旬上线,引入峰谷定价机制 DeepSeek V4 正式版计划 7 月中旬上线,并将在发布后同步调整 API 定价,引入峰谷定价机制。高峰时段为北京时间每日 9:00 至 12:00、14:00 至 18:00,调价前 24 小时会通过邮件告知用户。 deepseek-v4-pro 每百万 tokens 输入缓存命中为平时 0.025 元、高峰 0.05 元,缓存未命中为 3 元和 6 元,输出为 6 元和 12 元;deepseek-v4-flash 对应为…
DeepSeek-V4-Flash 正式版 API 上线公测并推出 Responses API
2026 年 7 月 31 日,DeepSeek 上线 V4-Flash 正式版 API 公测,Agent 能力大幅增强,基准测试成绩远超 V4-Pro-Preview。其中 Terminal Bench 2.1 达 82.7,Cybergym 达 76.7,DSBench-FullStack 达 68.7,DSBench-Hard 达 59.6。
正式版 V4-Flash 原生支持 Responses API 格式并针对性适配 Codex。模型结构与尺寸和 V4-Flash-preview 保持一致,仅重新进行了后训练。此次仅升级 V4-Flash 的 API 接口,V4-Pro API 及 APP/WEB 端未做更改,V4-Pro 正式版将尽快发布。值得注意的是,公告中还提到了测试使用即将发布的 DeepSeek Harness 极简模式。
DeepSeek API Docs
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景"最后一公里"
7月31日,阿里通义千问正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,主打"长音频不丢词、行业词不用教",已在阿里云百炼平台开放调用。
新模型在五大维度实现升级:
一是长音频上下文记忆,转写时可参考前文语义,几小时会议中的人名、技术概念全程保持一致,告别跨片段"断片";
二是内置多行业词库,医疗场景专业词召回率达95.36%,IT编程达91.87%,无需人工配置即可精准识别冷门术语;
三是分级热词定制,企业专属词汇即时生效,多数场景召回率突破99%,不因热词增多而误触发;四是集成语音润色,一步完成去口头禅、清理重复、处理自我纠正和语义重组,输出可读性接近"ASR+大模型润色"两步方案;
五是一套模型覆盖30余种语言,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型,适配跨国会议和出海客服场景。
同步推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒,中文工业场景错字率7.80%,英文11.52%,领跑行业。该系列此前已在Artificial Analysis评测中以1.7%错字率拿下全球第一,广泛应用于会议纪要、实时字幕、教育录播、智能客服等领域。
via AI新闻资讯 (author: AI Base)
7月31日,阿里通义千问正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,主打"长音频不丢词、行业词不用教",已在阿里云百炼平台开放调用。
新模型在五大维度实现升级:
一是长音频上下文记忆,转写时可参考前文语义,几小时会议中的人名、技术概念全程保持一致,告别跨片段"断片";
二是内置多行业词库,医疗场景专业词召回率达95.36%,IT编程达91.87%,无需人工配置即可精准识别冷门术语;
三是分级热词定制,企业专属词汇即时生效,多数场景召回率突破99%,不因热词增多而误触发;四是集成语音润色,一步完成去口头禅、清理重复、处理自我纠正和语义重组,输出可读性接近"ASR+大模型润色"两步方案;
五是一套模型覆盖30余种语言,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型,适配跨国会议和出海客服场景。
同步推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒,中文工业场景错字率7.80%,英文11.52%,领跑行业。该系列此前已在Artificial Analysis评测中以1.7%错字率拿下全球第一,广泛应用于会议纪要、实时字幕、教育录播、智能客服等领域。
via AI新闻资讯 (author: AI Base)
使用 Responses API
支持的模型
Responses API 目前仅支持
为了满足大家对 Codex 的需求,我们的 API 新增了对 Responses API 格式的支持,其 base_url 为 https://api.deepseek.com/
通过简单的配置,即可在 Codex 中使用 DeepSeek 模型。
将 DeepSeek 模型接入 Codex
请参考接入 Codex
通过 Responses API 调用 DeepSeek 模型
流式输出
设置
完整事件列表:
兼容性明细
本小节罗列了 DeepSeek API 对 Responses API 的兼容性细节。Responses API 完整格式定义,请参考 OpenAI 官方 API 手册。
顶层请求参数
不支持的参数会被静默忽略、不会报错,因此现有的 Responses API 客户端无需修改即可接入。
输入 Items
Tools
响应字段
响应对象与 OpenAI Responses API 的
Token 用量在
●
●
via DeepSeek 新闻
支持的模型
Responses API 目前仅支持
deepseek-v4-flash 模型,暂不支持 deepseek-v4-pro 模型。我们将于 2026 年 8 月初增加对 deepseek-v4-pro 模型的支持。为了满足大家对 Codex 的需求,我们的 API 新增了对 Responses API 格式的支持,其 base_url 为 https://api.deepseek.com/
通过简单的配置,即可在 Codex 中使用 DeepSeek 模型。
将 DeepSeek 模型接入 Codex
请参考接入 Codex
通过 Responses API 调用 DeepSeek 模型
# Please install OpenAI SDK first: `pip3 install openai`
from openai import OpenAI
client = OpenAI(api_key="<your DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
流式输出
设置
stream: true,响应将以语义化的流式 SSE 事件序列返回。每个事件带有表示事件类型的 event 字段和递增的 sequence_number。流以 response.completed / response.incomplete / response.failed 事件结束,没有 data: [DONE] 消息。stream = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
stream=True,
)
for event in stream:
if event.type == "response.output_text.delta":
print(event.delta, end="")
完整事件列表:
兼容性明细
本小节罗列了 DeepSeek API 对 Responses API 的兼容性细节。Responses API 完整格式定义,请参考 OpenAI 官方 API 手册。
顶层请求参数
不支持的参数会被静默忽略、不会报错,因此现有的 Responses API 客户端无需修改即可接入。
输入 Items
Tools
响应字段
响应对象与 OpenAI Responses API 的
response 结构兼容。依赖未支持能力的字段恒为固定值(如 store: false、previous_response_id: null、parallel_tool_calls: true)。Token 用量在
usage 中返回:●
input_tokens:输入 token 数,其中 input_tokens_details.cached_tokens 为命中上下文缓存的 token 数●
output_tokens:输出 token 数,其中 output_tokens_details.reasoning_tokens 为思维链 token 数via DeepSeek 新闻
聚焦语音Agent可靠性:xAI正式发布Grok Voice Think Fast 2.0
人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,并全面向开发者开放。该模型在智能水平、转录准确率、对话交互能力及工具调用效率等方面实现了显著跃升,其官方定价为每分钟音频 0.08 美元。
在权威的 Artificial Analysis 语音识别基准测试中,Grok Voice Think Fast 2.0的综合得分达到 82.9%,不仅超越了前代版本,也高于GPT-Realtime-2.1与Gemini 3.1 Flash。同时,其智能体能力评分录得 56.5%,在同类模型中处于领先地位。在响应速度上,该模型的首次音频播放时间大幅缩短至 0.70 秒,交互体验更加流畅。
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,Grok Voice Think Fast 2.0引入了语音并行推理机制,大幅减少了系统等待时间。通过强化学习对对话策略的深度优化,模型能够输出更简练的回答,确保单次处理单个核心问题,从而显著提升了复杂任务中的工具调用效率。
目前,该技术已在实际业务场景中展开验证,并在Starlink电话服务中完成了 A/B 测试,有效推动了销售转化率与客服响应效率的双重提升。按照官方规划,旧版本标识符计划于 2026 年 8 月 5 日自动切换至全新版本。
via AI新闻资讯 (author: AI Base)
人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,并全面向开发者开放。该模型在智能水平、转录准确率、对话交互能力及工具调用效率等方面实现了显著跃升,其官方定价为每分钟音频 0.08 美元。
在权威的 Artificial Analysis 语音识别基准测试中,Grok Voice Think Fast 2.0的综合得分达到 82.9%,不仅超越了前代版本,也高于GPT-Realtime-2.1与Gemini 3.1 Flash。同时,其智能体能力评分录得 56.5%,在同类模型中处于领先地位。在响应速度上,该模型的首次音频播放时间大幅缩短至 0.70 秒,交互体验更加流畅。
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,Grok Voice Think Fast 2.0引入了语音并行推理机制,大幅减少了系统等待时间。通过强化学习对对话策略的深度优化,模型能够输出更简练的回答,确保单次处理单个核心问题,从而显著提升了复杂任务中的工具调用效率。
目前,该技术已在实际业务场景中展开验证,并在Starlink电话服务中完成了 A/B 测试,有效推动了销售转化率与客服响应效率的双重提升。按照官方规划,旧版本标识符计划于 2026 年 8 月 5 日自动切换至全新版本。
via AI新闻资讯 (author: AI Base)
↩️ MiniMax 发布全模态模型 H3,将开源权重
MiniMax 发布全模态模型 H3,将开源权重
7 月 31 日,MiniMax 正式发布通用全模态生成模型 H3,支持对文本、图像、视频、声音的多模态上下文统一理解与生成,可输出原生双声道音视频,最高支持 15 秒 2K 分辨率。该模型在指令遵循、文字呈现及视频动作迁移方面表现突出,适用于广告、电商、游戏等商业场景。
H3 默认提供 2K 分辨率,同分辨率下每秒价格不到主流模型的三分之一。公司计划在未来几天内开放模型权重,以推动开源社区发展并加速国产芯片适配。H3 是继 Hailuo 01、02 后的第三代模型,在预训练阶段即融合多模态数据与任务,追求任务的统一与泛化。
MiniMax 稀宇科技
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
科技圈🎗在花频道📮:
MiniMax 发布 M3 模型:1M 上下文、原生多模态,编程能力领先 MiniMax 正式发布 M3 模型,采用全新 MSA 稀疏注意力架构,支持最高 100 万 token 上下文窗口,可原生处理图片、视频和桌面操作。在编程评测 SWE-Bench Pro 上,M3 得分 59%,超过 GPT-5.5 和 Gemini 3.1 Pro;在多模态 OmniDocBench 和 Agent 评测 Claw-Eval 中也达到领先水平。M3 是国内首个同时具备超长上下文、前沿编程与原生多模态能力且开源的模型。…
MiniMax 发布全模态模型 H3,将开源权重
7 月 31 日,MiniMax 正式发布通用全模态生成模型 H3,支持对文本、图像、视频、声音的多模态上下文统一理解与生成,可输出原生双声道音视频,最高支持 15 秒 2K 分辨率。该模型在指令遵循、文字呈现及视频动作迁移方面表现突出,适用于广告、电商、游戏等商业场景。
H3 默认提供 2K 分辨率,同分辨率下每秒价格不到主流模型的三分之一。公司计划在未来几天内开放模型权重,以推动开源社区发展并加速国产芯片适配。H3 是继 Hailuo 01、02 后的第三代模型,在预训练阶段即融合多模态数据与任务,追求任务的统一与泛化。
MiniMax 稀宇科技
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel