https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
DeepSeek V4 Pro 登陆硅基流动:百万级上下文窗口配三档推理强度,缓存命中每百万 token 只要 0.44 美元

DeepSeek-V4-Pro-0813正式上线硅基流动 SiliconFlow,而且是 Day-0首发。这次更新的核心卖点是三个数字和一种取向:1M 上下文窗口、低/高/最大三档推理强度,以及更明确地把重心压在编码、工具调用和智能体工作流上。开源协议没变,仍然是 MIT。

定价结构也摆得很清楚:每百万输入 token 收1.32美元,每百万输出 token 收3.96美元,而缓存命中 token 只要0.44美元。最后这个数字才是真正值得琢磨的——对大量依赖反复调用、长上下文输入的 Agent 工作流来说,缓存命中价格压到这个水平,意味着长文本场景下的单位成本测算有了更具体的锚点,不至于一跑长上下文就烧穿预算。

同系列里还摆着 DeepSeek-V4-Flash-0731,定位截然不同:它面向的是追求速度和高性价比的日常生产负载,走快而省的路子;V4Pro 则冲着复杂推理、编码和智能体工作流去,要的是脑子。两个型号一快一重,把日常生产和重度推理的档位分开,用户各取所需。

via AI新闻资讯 (author: AI Base)
Claude Code 桌面版新增自动继续,额度重置后接续任务

Claude Code 桌面版新增“自动继续”复选框。用户开启后,使用额度达到上限时,系统会在额度重置后自动从中断处继续。

ClaudeDevs(@ClaudeDevs)

🌸 在花频道 · 茶馆水群 · 投稿通道

via 科技圈🎗在花频道📮 - Telegram Channel
百万上下文解锁复杂办公!金山办公灵犀全量上线 DeepSeek-V4正式版双模型

金山办公旗下 AI 办公智能体“灵犀专业版”于2026年8月14日宣布正式接入DeepSeek最新旗舰模型 DeepSeek-V4-Pro 正式版(V4-Pro-0813),用户无需任何额外配置,在产品内手动切换即可直接体验。

作为 DeepSeek 的最新旗舰产品,V4-Pro-0813原生支持高达100万 token 的超长上下文,单次最大输出可达38.4万 token,各项基准测试表现较 Preview 版本实现全面提升。

在落地场景方面,灵犀专业版区别于仅将对话作为终点的传统 AI 产品,能够持续理解用户的历史文档、会议材料及个人偏好等工作上下文,并可自主调用文档、表格、浏览器、代码及数据处理等多种工具推进复杂任务,最终交付可编辑、可溯源且支持协作的原生 Office 成果。

随着 DeepSeek-V4-Pro 的加入,灵犀专业版在需求拆解、工具调用与成果交付上的智能体(Agent)执行链路更加完整,显著提升了复杂办公场景下的自动化处理稳定性。目前,DeepSeek-V4正式版系列已在灵犀专业版全量上线,涵盖 Flash 与 Pro 两个版本,并已面向全体用户开放使用。

via AI新闻资讯 (author: AI Base)
深度绑定本土生态:传苹果与阿里联手打造中国专属大模型

近年来在激烈的中国市场中面临销量承压与份额挑战的苹果,正在悄然调整其在华的人工智能布局策略。知情人士透露,苹果已经专门针对中国市场训练了一款专属的大语言模型,而这一突破性进展背后,是苹果与阿里巴巴展开的深度合作,依托后者的技术支持完成了核心模型的训练工作。

在此之前,外界普遍预计苹果会通过引入国内第三方大模型的方式,为在中国发售的iPhone等设备搭载生成式AI功能。虽然苹果在美国本土市场采取了将自身技术与OpenAI、Anthropic等海外大模型相结合的策略,但这些海外AI产品由于种种原因未能在中国市场直接落地。此次通过与本土科技巨头携手进行专属模型的自研,标志着苹果彻底改变了以往的传统路径。

按照目前的规划,苹果的全套AI工具套装Apple Intelligence将在数月内伴随iOS系统更新正式登陆中国市场。通过自研并适配中国场景的大模型,苹果不仅能够牢牢掌控在华的AI产品体验,更使其成为首家在中国采取AI双轨落地策略的海外科技企业,同时也将成为首家获得国内监管许可、在中国上线自有专属大模型的外企。

via AI新闻资讯 (author: AI Base)
智谱发布 GLM-5.3:不换底座、只炼后训,开源编程王座易主

智谱今日正式发布 GLM-5.3,与前代最大的不同在于——基座模型完全没变,提升全部来自后训练阶段的 Scaling。通过数十倍规模的长程任务环境、更丰富的环境类型以及超长的后训练时间,智谱在相同基座上把模型的智能上界显著抬高。公司内部评测显示,新模型的编程体感较 GLM-5.2 提升约 50%,一跃成为当前编程能力最强的开源模型。

在公开基准上,GLM-5.3 也交出了亮眼答卷。Terminal-Bench 3.0 得分从 4.6 跃升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 提到 28.5,GDPval-AA v2 达到 1769 分。其在编程与智能体能力上已接近 Claude Fable 5,体感超过其他国产模型,在 Terminal Bench 3.0 与 Agents' Last Exam(CLI)两项测试中拿下开源第一。

后训练 Scaling:基座潜力远未触顶

智谱强调,上述全部提升均来自后训练而非换模型。基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架,团队在与 GLM-5.2 完全相同的基座上高效推进强化学习,并坦言"可能远未开发出这个基座的智能上界"。这一思路释放出明确信号:大模型竞争未必总要靠堆参数,把已有底座"练透"同样能逼近前沿水平。

在安全维度,GLM-5.3 在白盒代码审查与漏洞发现等任务中表现持平 Mythos 5,展现出面向网络防御场景的潜力。智谱将在发布两周后开放完整模型权重,但前提是完成安全评估与模型加固,以限制潜在攻击能力、保留防御价值。与此同时,新模型即日上线官方编程工具 ZCode、AutoClaw 及 GLM Coding Plan,并面向 Trae、扣子、WorkBuddy / CodeBuddy、Qoder 等编码平台开放抢先体验。当开源模型在编程赛道逼近闭源旗舰,国产大模型的下半场较量,正从"谁更会说话"转向"谁更会干活"。

via AI新闻资讯 (author: AI Base)
OpenAI年化营收突破400亿美元,7月环比暴增超20%

备受全球瞩目的OpenAI正加速推进其在今年晚些时候的美国上市计划,外界普遍预测其估值有望突破万亿美元大关。随着资本市场的高度聚焦,这家人工智能领域的领头羊在财务层面交出了一份相当亮眼的成绩单。

根据内部文件显示,OpenAI目前的年化营收已正式跨过400亿美元大关,相较于去年年底实现了翻倍增长。其中,仅在刚刚过去的7月份,其单月营收就实现了超过20%的环比增长,展现出了极其强劲的商业化扩张势头。与此同时,其主要竞争对手Anthropic也计划于年内推进IPO,此前曾公布其5月份的年化营收达到470亿美元,不过由于两家公司的会计处理方式存在差异,在财务维度上较难直接横向对比。

回顾近期的业务进展,OpenAI营收的高速增长主要得益于多条产品线的齐头并进。不仅核心付费订阅层的收入持续攀升,早期广告业务也逐步实现了盈利。而在企业级市场,平台的Codex编码代理和企业协作工具均得到了市场的广泛认可。为了在激烈的行业竞争中巩固市场份额,OpenAI还灵活调整了定价与市场策略,通过下调部分模型价格来吸引更多注重成本的开发者。

尽管在商业化道路上高歌猛进,OpenAI近期也伴随着一定的人事震荡。前首席营收官Denise Dresser的离职一度让外界对其企业业务的后续表现产生担忧,不过公司已迅速完成交接,由曾任职于网络安全巨头Wiz的Dali Rajic接任新职务。随着两家头部AI企业相继迈向资本市场,未来在巨额资本支出和高强度研发背景下,这种激进的增长模式能否持续,将成为华尔街观察行业发展的重要风向标。

via AI新闻资讯 (author: AI Base)
三星用Claude Code加速芯片验证:一个月项目缩短至两天

三星系统LSI部门正将Anthropic的Claude Code引入半导体设计与验证流程,将部分原本耗时一个月以上的芯片测试项目压缩至两天,开发效率提升约15倍。韩国媒体《朝鲜商业》报道称,三星今年5月率先向软件开发人员开放Claude Code,随后进一步拓展至硬件设计和验证领域。

在一项包含64条复杂交织数据通路的定制SoC项目中,Claude Code仅用两天便搭建虚拟测试环境并完成验证。由于DRAM控制器标准文档和RTL代码尚未交付,工程师向模型提供SoC规格及EDA供应商数据,Claude通过插入虚拟占位符检查核心数据路径,并在实际电路设计完成前发现潜在错误。

在另一案例中,一名此前没有Vibe Code或Claude Code经验的二年级工程师,仅用一天便完成虚拟USB键盘、鼠标模型及Android驱动开发,而传统流程通常需要数周。此类应用有助于三星弥补与高通之间的人员规模差距:三星系统LSI部门约有6000名员工,高通约5.2万人。

不过,Claude Code仍存在硬件理解不足等问题,曾出现修改错误标签、误恢复代码以及尝试改动核心RTL电路等情况。因此,三星目前仍将其定位为辅助工具,由工程师设定边界、目标并逐行审核代码,以降低芯片量产阶段的硬件风险。

via AI新闻资讯 (author: AI Base)
Anthropic 拟 10 月 IPO 冲刺 2 万亿美元:估值碾压 SpaceX,剑指史上最大上市案

《财富》于 8 月 13 日发布报道称,Anthropic 计划于 2026 年 10 月以 2 万亿美元估值登陆资本市场,其规模将超过 SpaceX,成为史上规模最大的 IPO。作为参照,马斯克旗下的 SpaceX 于今年 6 月 12 日完成 IPO,按每股 135 美元的发行价计算市值约 1.77 万亿美元,曾创下美股史上最大规模上市纪录。若 Anthropic 如期推进,这家成立仅数年的 AI 公司将在四个月里把"最大 IPO"的桂冠从火箭巨头手中夺走。

业内消息显示,Anthropic 已于 6 月向美国证券交易委员会秘密提交 IPO 相关文件,目前进入静默期,受监管约束不得对外披露自身财务表现。这一安排与近期频频见于媒体报道的"已保密提交上市申请"信息相互印证,也为 10 月挂牌的时间表提供了可信度支撑。

模型能打、营收飙涨,撑起万亿估值

Anthropic 敢于喊出 2 万亿美元估值,底气来自产品与商业化的双重突破。今年以来,公司接连推出多款性能优于竞品的模型,同时在企业客户销售上重点发力,把增长引擎从消费者订阅转向更高价值的 B 端市场。今年 5 月,Anthropic 公布其年化营收已突破 470 亿美元,这一数字甚至略高于 OpenAI 同期约 400 亿美元的预估水平。

在 AI 双雄的上市竞速中,Anthropic 显然选择了"抢跑"策略——相较 OpenAI 仍在私有阶段以 70 亿美元回购安抚员工、为 IPO 蓄力,Anthropic 直接把敲钟时间定在了秋季。2 万亿美元的估值若最终兑现,不仅将重塑资本市场对 AI 公司的定价预期,也意味着投资者愿意为"更安全的 Claude"及其企业级叙事支付远超传统科技巨头的溢价。这场由大模型点燃的上市浪潮,正把硅谷的估值游戏推向前所未有的高度。

via AI新闻资讯 (author: AI Base)
DeepSeek Harness v0.1开放全球测试:采用“一切皆插件”架构并开源

DeepSeek Harness 开发者预览版(v0.1)已面向全球 Harness 开发者开放测试,并同步以 MIT 协议开源。作为早期预览版本,DeepSeek Harness 采用“一切皆插件”的设计思路,通过插件化架构构建 Agent Harness,模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等能力均以插件形式组合,可独立替换与灵活重组。

DeepSeek Harness 主要基于 Cordis 插件系统构建。Cordis 元框架仅负责插件加载、卸载及依赖管理,Agent Harness 的具体组件则由不同 Cordis 插件实现,并通过服务与事件机制协作。开发者无需修改 DeepSeek Harness 源码,即可在配置层独立选择、替换或扩展任意能力。

针对不同场景,DeepSeek Harness 提供标准、PTC(程序化工具调用)、极简和创造四种模式。其中,PTC模式由模型生成代码组合多轮工具调用;极简模式仅保留 Shell 和文件编辑工具,用于最小环境下的模型基准测试;创造模式则支持检查运行时、在内存中试验 Cordis 插件并组合新的模式。目前,已安装 Node.js 开发工具链的系统可通过 npx 快速启动其 Web UI。

via AI新闻资讯 (author: AI Base)
DeepSeek V4 Pro 编程测评夺亚:分数仅输 Kimi K3,成本却只有对手十四分之一

CLUE 团队最新发布的 SuperCLUE-Terminal 中文智能体终端编程测评榜单显示,DeepSeek-V4-Pro-0813 拿下 51.52 分,在所有参测模型中位列第二,仅落后于登顶的 Kimi K3。更值得注意的是,它在取得这一成绩的同时保持着极低的调用成本,性价比优势在一众高分模型中格外突出。该榜单专门面向国内开发者设计,全部采用本土真实编程任务,并统一以 Claude Code 作为运行框架,公平对比各大模型理解中文需求、规划任务、调用工具及排错改代码的完整能力。

评测的真实感来自其任务设定:每道考题需要模型完成 50 至 110 轮交互,单题完整运行耗时半小时到一小时半,能高度还原日常开发中的复杂工作流。本轮榜单中 Kimi K3 以 60.61 分排名第一,DeepSeek-V4-Pro-0813 紧随其后,分数高于 GLM-5.2 的 48.48 分和老版 DeepSeek-V4-Flash 的 46.46 分,稳居第一梯队。

1.42 元单题成本,硬刚顶级算力

最亮眼的是 DeepSeek-V4-Pro-0813 的成本控制:单题调用成本仅约 1.42 元,大约是 Kimi K3 的十四分之一、GLM-5.2 的十六分之一。在头部模型比拼分数往往只差几分的当下,这种数量级的成本差距,意味着中小团队用得起"接近顶级"的代码能力,而不必为每一次交互支付高昂算力费。

从实测场景看,该模型覆盖了前端页面、3D 游戏和工程脚本修改等真实需求,能完整闭环游戏开发逻辑,碰撞、计分、结算功能均运转正常,页面配色与交互反馈也摆脱了模板化的 AI 风格。少数创意绘图类题目会出现结构小瑕疵,但整体完成度仍处于领先水平。对预算敏感的中小企业和独立开发者而言,DeepSeek-V4-Pro-0813 用"第二名的分数、十四分之一的价格"重新定义了编程模型的性价比基准——当顶级能力不再意味着顶级开销,AI 编程的普及门槛正在被真正拉低。

via AI新闻资讯 (author: AI Base)
微软大刀阔斧精简AI业务:合并Copilot应用并砍掉多项冷门功能

微软近期对其人工智能战略进行了重大调整,宣布将消费者端与商业端的Copilot应用进行全面合并,同时淘汰多项未能达到预期效果的AI功能。这一举措不仅反映出个人与专业场景在AI应用中日益模糊的界限,也宣告了微软以往过于繁琐的产品布局需要做出改变,以更好地与ChatGPT、Claude和Gemini等竞品展开竞争。

根据相关的支持文档显示,多项消费者端的功能将在 8 月 18 日正式下线,其中包括群聊功能、AI生成的播客、Copilot Labs实验性功能以及深度研究。不过,付费专业用户未来将通过Researcher功能获得相应的替代方案。此外,微软还决定撤下此前颇受争议、被称为Mico的虚拟动画角色。在过渡期间,独立Copilot应用生成的文件将自动迁移至OneDrive。

此次精简的核心目标是打造更简单、连贯的使用体验。微软内部近期强调,各类功能必须真正赢得用户在日常生活中的存在价值,果断舍弃无效模块。在当前各大科技公司纷纷对AI应用进行整合的背景下,微软正通过精简架构来优化资源,寻求在激烈的市场竞争中站稳脚跟。

via AI新闻资讯 (author: AI Base)
谷歌发布Gemini3.7Flash:编码性能全面升级,初始定价降幅达50%

8月13日,谷歌在其前代模型Gemini3.6Flash发布仅三周后,正式推出全新Gemini3.7Flash。谷歌将其定位为迄今针对代码编写与AI Agent场景功能最强的主力模型,并归功于算法层面的重大突破。

该模型在软件工程与逻辑任务上实现显著升级:FrontierCode基准测试得分由前代的34.4%提升至43.6%,DeepSWE测试得分由49.0%跃升至65.3%,且在Web开发、文档理解与业务流程自动化等方面均表现出色,综合性能已超越Claude Sonnet5和GPT-5.6Terra。

在生态部署与成本控制方面,Gemini3.7Flash已通过API、AI Studio及Antigravity同步开放。其初始定价设定为每百万输入代币0.75美元、每百万输出代币3.75美元,相比3.6Flash的发布初始价格直接降低50%(目前两款模型价格已平齐)。

该优惠定价预计将维持至2026年年底。随着轻量级主力模型在复杂编码与自主代理领域的性能突破及成本压低,高性价比大模型正在加速大规模落地应用的商业化进程。

via AI新闻资讯 (author: AI Base)
OpenAI推Ultrafast模式:最高750词元/秒

OpenAI 推出了一款名为 “Ultrafast” 的新模式,其设计目的是大幅加速其最新、最强大的模型GPT-5.6 Sol完成工作的速度。公司表示,Ultrafast模式可以以标准处理速度的14倍运行,每秒提供高达750个输出token。

该公司在周四的博客文章中表示:“到目前为止,获得实时速度通常意味着选择更小或更专业的模型。Ultrafast指明了一个新方向的进展:每秒完成更多有用的工作。”

OpenAI称,这款高强度的GPT-5.6 Sol版本可以部署在多种不同的企业工作流程中,最显著的是事件响应、客户服务与支持、金融市场分析和电子商务,及其他相关领域。

—— Techcrunch

via 风向旗参考快讯 - Telegram Channel
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]