https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
DeepSeek Harness v0.1开放全球测试:采用“一切皆插件”架构并开源

DeepSeek Harness 开发者预览版(v0.1)已面向全球 Harness 开发者开放测试,并同步以 MIT 协议开源。作为早期预览版本,DeepSeek Harness 采用“一切皆插件”的设计思路,通过插件化架构构建 Agent Harness,模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等能力均以插件形式组合,可独立替换与灵活重组。

DeepSeek Harness 主要基于 Cordis 插件系统构建。Cordis 元框架仅负责插件加载、卸载及依赖管理,Agent Harness 的具体组件则由不同 Cordis 插件实现,并通过服务与事件机制协作。开发者无需修改 DeepSeek Harness 源码,即可在配置层独立选择、替换或扩展任意能力。

针对不同场景,DeepSeek Harness 提供标准、PTC(程序化工具调用)、极简和创造四种模式。其中,PTC模式由模型生成代码组合多轮工具调用;极简模式仅保留 Shell 和文件编辑工具,用于最小环境下的模型基准测试;创造模式则支持检查运行时、在内存中试验 Cordis 插件并组合新的模式。目前,已安装 Node.js 开发工具链的系统可通过 npx 快速启动其 Web UI。

via AI新闻资讯 (author: AI Base)
DeepSeek V4 Pro 编程测评夺亚:分数仅输 Kimi K3,成本却只有对手十四分之一

CLUE 团队最新发布的 SuperCLUE-Terminal 中文智能体终端编程测评榜单显示,DeepSeek-V4-Pro-0813 拿下 51.52 分,在所有参测模型中位列第二,仅落后于登顶的 Kimi K3。更值得注意的是,它在取得这一成绩的同时保持着极低的调用成本,性价比优势在一众高分模型中格外突出。该榜单专门面向国内开发者设计,全部采用本土真实编程任务,并统一以 Claude Code 作为运行框架,公平对比各大模型理解中文需求、规划任务、调用工具及排错改代码的完整能力。

评测的真实感来自其任务设定:每道考题需要模型完成 50 至 110 轮交互,单题完整运行耗时半小时到一小时半,能高度还原日常开发中的复杂工作流。本轮榜单中 Kimi K3 以 60.61 分排名第一,DeepSeek-V4-Pro-0813 紧随其后,分数高于 GLM-5.2 的 48.48 分和老版 DeepSeek-V4-Flash 的 46.46 分,稳居第一梯队。

1.42 元单题成本,硬刚顶级算力

最亮眼的是 DeepSeek-V4-Pro-0813 的成本控制:单题调用成本仅约 1.42 元,大约是 Kimi K3 的十四分之一、GLM-5.2 的十六分之一。在头部模型比拼分数往往只差几分的当下,这种数量级的成本差距,意味着中小团队用得起"接近顶级"的代码能力,而不必为每一次交互支付高昂算力费。

从实测场景看,该模型覆盖了前端页面、3D 游戏和工程脚本修改等真实需求,能完整闭环游戏开发逻辑,碰撞、计分、结算功能均运转正常,页面配色与交互反馈也摆脱了模板化的 AI 风格。少数创意绘图类题目会出现结构小瑕疵,但整体完成度仍处于领先水平。对预算敏感的中小企业和独立开发者而言,DeepSeek-V4-Pro-0813 用"第二名的分数、十四分之一的价格"重新定义了编程模型的性价比基准——当顶级能力不再意味着顶级开销,AI 编程的普及门槛正在被真正拉低。

via AI新闻资讯 (author: AI Base)
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]