https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
#Update #Gemini
Antigravity 现已支持通过网页远程管理会话。
管理入口:https://antigravity.google.com/
via AI Copilot - Telegram Channel
Antigravity 现已支持通过网页远程管理会话。
管理入口:https://antigravity.google.com/
via AI Copilot - Telegram Channel
#Update #Grok
Grok Bot 现已面向所有 SuperGrok Plus、Cursor Pro+、Cursor Teams 用户推出。
Grok Bot 也将面向所有其他用户提供免费试用。
via AI Copilot - Telegram Channel
Grok Bot 现已面向所有 SuperGrok Plus、Cursor Pro+、Cursor Teams 用户推出。
Grok Bot 也将面向所有其他用户提供免费试用。
via AI Copilot - Telegram Channel
2026 年 8 月,我的最新 AI 装机单
最近直播了几场,直播间和公号后台问得最多的问题就是,编程,生图,视频该用哪个,以及哪个 AI 最强之类的话题。
其实过去的一个月,真算得上 AI 一个大更新的月份,编程,图片,视频,每个赛道用大换血来说都不为过。
索性今天给大家更新一版最新的,按赛道给结论,大家按照自己的场景自行选择就好。
你可以理解为一份 2026 年 8 月版的 AI 装机单。
1. 先说明几点
首先,我不是从自媒体角度,网上搜点信息,就给出结论。
我是一个一线 AI 开发者,每月自己各家 AI 套餐订阅花费差不多有近万了,虽然可能附带个人喜好,但是会尽量客观,仅作大家参考。
其次,Anthropic 家的 Claude Code 现如今再也不像之前断崖式领先了,现在 AI 的能力逐渐被追平,甚至如果这几个月你深度使用,你会发现除了 Fable 5 确实不错,但是从 Opus 4.7,4.8 哪怕到现在的 Opus 5,评价都非常拉,有时候你都会有种错觉,这家公司之前领先完全就是选择了一个对的赛道,吃到了红利,但是之后的相对进步水平,跟其他家比,是真不能看。
再加上 Anthropic 这家公司的价值观和傲慢程度,我现在真心建议,Claude Code 现在不是必选项了,虽然现在也很强,但是跟三个月之前比,地位不可同日而语。
如果还在用 Claude Code 的同学,没问题。但是如果没用上的,现在可以直接忽略了,没必要硬着头皮非得用它。
而且我之前的文章就说过,AI 之后的竞争,可能在生态更重要,而 Anthropic 在这块是短板。
2. AI 编程推荐:Codex + GPT-5.6 Sol
如果你想用 AI 做点产品,工具之类的,这就是 AI 编程场景,那么毫无疑问,Codex + GPT-5.6 Sol 就是编程的王,而且 OpenAI 最近老是给 Codex 重置,最近一个月,Codex 订阅套餐不管是从能力还是性价比,可能是最优选。
但是这也是 OpenAI 的营销宣传策略,主要为了抢用户,随着用户量级的增长,重置一定不会像之前那么频繁,但是能力层面是真的能打。
加上 OpenAI 的生态层面。
Codex 基本是当下最强 Agent 那一档。
自家的 GPT Image 2 到目前为止依然是最强的图片生成模型,而且生图和 Codex 共享额度。
语音层面,不管是之前开源的 Whisper 还是现在的 GPT-Live,依然是最强。
视频就不说了,虽然 Sora 关闭了,但是当时一出,基本吊打全球所有视频模型。
也就是说,OpenAI 在 AI 生态是非常全面,而且技术能力非常强的。
这就导致 Codex 一个 Agent,可以轻松搞定任何场景了。
3. AI 编程国内最优:Kimi Code + K3
K3 刚出来的时候,我就单独写了篇文章评测,因为国产模型在之前一出世,多是各种吊打的软文。所以大家习惯了,是不是又一次夸大营销。
我自己亲自使用之后,我的评测就是我自己的真实体验。
我自己是 Kimi 最高套餐,在深度使用 K3 之后,我可以告诉大家,Kimi Code + K3 远比大家想象的强,国人都低估了 K3 的能力。
现在 Kimi K3 和 Codex 都是我主力开发环境了,因为一个订阅套餐不够用,前端能力就不说了,甚至在一些复杂编程任务,实测 K3 也非常抗打。
所以,如果你因为种种原因用不了 Codex 的时候,强烈推荐你 Kimi Code + K3。
当然,Kimi 的问题是,算力不够,很多人抢不到套餐,加上额度不够量大管饱以及速度上相对慢些。
4. 图片生成顶配:GPT Image 2
图片这块,GPT Image 2 是 4 月 21 日发布的,到现在快四个月了,文生图竞技场第一的位置就没动过。
Google 的 Nano Banana 也不错,但是 Gemini 生态现在太拉了,现在就是美国版豆包。
不过 Google 的问题是自己团队问题,前几天内部大地震,AI 技术领域的领头羊组团创业去了,Google 内部做了非常大的组织架构调整,这不是坏事,给它点时间,起码现在不是推荐选择。
马斯克的 Grok 刚刚发布了 Imagine Image 2.0,官方放的数据,文生图和图像编辑两个榜都是全球第二,而且价格便宜。
之前 Grok 一直不被看好,用的人也很少,但是自从收购 Cursor,并入 SpaceXAI 后,最近 AI 各方面进步都很神速,最近不管是 AI 编程模型,还是图片,视频生态都有进步。
最大的优势是,老马不缺钱,不缺算力,如果你用过 Grok,你的第一印象就是,Grok 吞吐速度是真尼玛快,那输出速度就跟机关枪一样,肉眼可见的快。
所以 Grok 家族生态值得关注,后续潜力很大,但是当下不是第一选择。
当然,图片领域,国内混元,千问也有更新最新的,但是当下都依然还没法和 GPT Image 2 相比,还是那句话,如果没必要单独为了一个图片生成去全部切换,生态层面 Codex 当下就是最优选。
5. 视频双雄:Seedance 2.5 和 MiniMax H3
Seedance 2.5,强在成片能力。 单次生成 30 秒原生视频,不用拼接不用超分,还支持多轮延长,理论上能续到几分钟。别小看这个 30 秒,行业普遍水平还在 5 到 15 秒,这一下把 AI 视频从「生成素材」推到了「直接出成片」的阶段。参考素材单次最多塞 50 个,30 张图,10 段视频,10 段音频随便混。还支持时间戳精准编辑,指哪一秒改哪一秒。
目前字节系 Seedance 2.5 是毫无疑问的视频领域王者,但是缺点是,贵。
MiniMax H3,强在开源和便宜。 8 月 3 日权重直接开源,2K 分辨率 15 秒,自带原生立体声,画面和声音一次出来,不用后期配音。API 价格 2K 每秒 0.13 美元,官方口径是主流模型的三分之一。自己有显卡的,ComfyUI 当天就支持了,拉下来本地跑,边际成本就是电费。
我实测 H3 也很强,但是和 Seedance 2.5 比依然有差距,然而 H3 是开源,这个意味着很快,全领域的视频模型能力都有机会缩小差距,而且可能把视频生成的价格打下来。
我们应该感谢每个开源界的 AI 公司,值得尊重。
6. 直接抄作业:分人群装机单
最后按人群给结论,对号入座。
如果你只是日常办公,那国内用户无脑 Workbuddy,内置一堆职场办公人的技能工具包,开箱即用,上手门槛低。
靠代码吃饭的开发者,有条件的闭眼 Codex + GPT-5.6 Sol。
国内开发者,预算有限的,Kimi Code + K3,套餐抢不到的可以看下国内一些云服务商。
做自媒体,设计,运营的,图片主力 GPT Image 2,如果量大考虑成本的,可以看下最新的 Grok Imagine Image 2.0。
短视频创作者,Seedance 2.5,30 秒直出目前独一档,但成本比较高。
技术团队,要批量出片或者有硬件资源想自部署的,MiniMax H3。
关于视频生成这里补充一个技巧,视频制作其实分 Motion Graphics 和创意素材类视频。前者是代码工程化制作视频,指哪打哪,后者才需要用到视频大模型生成,成本很高,需要抽卡。
如果有一定技术能力的,可以通过 Motion Graphics 工程能力结合视频大模型创意层面,做的好的话,在保持同等视频质量的前提下,能把视频制作成本打得很低。
最近我们团队在这块花了不少时间研究,现在星球也更新了 AI 视频的教程,后续有机会可以真实分享下实际视频质量和成本。
最后说句实话,AI 这个行业没有毕业配置,只有当下最合适的配置。
以上这份装机单,仅是当下我的推荐建议,供大家参考。
via 掘金人工智能本月最热 (author: stormzhangV)
最近直播了几场,直播间和公号后台问得最多的问题就是,编程,生图,视频该用哪个,以及哪个 AI 最强之类的话题。
其实过去的一个月,真算得上 AI 一个大更新的月份,编程,图片,视频,每个赛道用大换血来说都不为过。
索性今天给大家更新一版最新的,按赛道给结论,大家按照自己的场景自行选择就好。
你可以理解为一份 2026 年 8 月版的 AI 装机单。
1. 先说明几点
首先,我不是从自媒体角度,网上搜点信息,就给出结论。
我是一个一线 AI 开发者,每月自己各家 AI 套餐订阅花费差不多有近万了,虽然可能附带个人喜好,但是会尽量客观,仅作大家参考。
其次,Anthropic 家的 Claude Code 现如今再也不像之前断崖式领先了,现在 AI 的能力逐渐被追平,甚至如果这几个月你深度使用,你会发现除了 Fable 5 确实不错,但是从 Opus 4.7,4.8 哪怕到现在的 Opus 5,评价都非常拉,有时候你都会有种错觉,这家公司之前领先完全就是选择了一个对的赛道,吃到了红利,但是之后的相对进步水平,跟其他家比,是真不能看。
再加上 Anthropic 这家公司的价值观和傲慢程度,我现在真心建议,Claude Code 现在不是必选项了,虽然现在也很强,但是跟三个月之前比,地位不可同日而语。
如果还在用 Claude Code 的同学,没问题。但是如果没用上的,现在可以直接忽略了,没必要硬着头皮非得用它。
而且我之前的文章就说过,AI 之后的竞争,可能在生态更重要,而 Anthropic 在这块是短板。
2. AI 编程推荐:Codex + GPT-5.6 Sol
如果你想用 AI 做点产品,工具之类的,这就是 AI 编程场景,那么毫无疑问,Codex + GPT-5.6 Sol 就是编程的王,而且 OpenAI 最近老是给 Codex 重置,最近一个月,Codex 订阅套餐不管是从能力还是性价比,可能是最优选。
但是这也是 OpenAI 的营销宣传策略,主要为了抢用户,随着用户量级的增长,重置一定不会像之前那么频繁,但是能力层面是真的能打。
加上 OpenAI 的生态层面。
Codex 基本是当下最强 Agent 那一档。
自家的 GPT Image 2 到目前为止依然是最强的图片生成模型,而且生图和 Codex 共享额度。
语音层面,不管是之前开源的 Whisper 还是现在的 GPT-Live,依然是最强。
视频就不说了,虽然 Sora 关闭了,但是当时一出,基本吊打全球所有视频模型。
也就是说,OpenAI 在 AI 生态是非常全面,而且技术能力非常强的。
这就导致 Codex 一个 Agent,可以轻松搞定任何场景了。
3. AI 编程国内最优:Kimi Code + K3
K3 刚出来的时候,我就单独写了篇文章评测,因为国产模型在之前一出世,多是各种吊打的软文。所以大家习惯了,是不是又一次夸大营销。
我自己亲自使用之后,我的评测就是我自己的真实体验。
我自己是 Kimi 最高套餐,在深度使用 K3 之后,我可以告诉大家,Kimi Code + K3 远比大家想象的强,国人都低估了 K3 的能力。
现在 Kimi K3 和 Codex 都是我主力开发环境了,因为一个订阅套餐不够用,前端能力就不说了,甚至在一些复杂编程任务,实测 K3 也非常抗打。
所以,如果你因为种种原因用不了 Codex 的时候,强烈推荐你 Kimi Code + K3。
当然,Kimi 的问题是,算力不够,很多人抢不到套餐,加上额度不够量大管饱以及速度上相对慢些。
4. 图片生成顶配:GPT Image 2
图片这块,GPT Image 2 是 4 月 21 日发布的,到现在快四个月了,文生图竞技场第一的位置就没动过。
Google 的 Nano Banana 也不错,但是 Gemini 生态现在太拉了,现在就是美国版豆包。
不过 Google 的问题是自己团队问题,前几天内部大地震,AI 技术领域的领头羊组团创业去了,Google 内部做了非常大的组织架构调整,这不是坏事,给它点时间,起码现在不是推荐选择。
马斯克的 Grok 刚刚发布了 Imagine Image 2.0,官方放的数据,文生图和图像编辑两个榜都是全球第二,而且价格便宜。
之前 Grok 一直不被看好,用的人也很少,但是自从收购 Cursor,并入 SpaceXAI 后,最近 AI 各方面进步都很神速,最近不管是 AI 编程模型,还是图片,视频生态都有进步。
最大的优势是,老马不缺钱,不缺算力,如果你用过 Grok,你的第一印象就是,Grok 吞吐速度是真尼玛快,那输出速度就跟机关枪一样,肉眼可见的快。
所以 Grok 家族生态值得关注,后续潜力很大,但是当下不是第一选择。
当然,图片领域,国内混元,千问也有更新最新的,但是当下都依然还没法和 GPT Image 2 相比,还是那句话,如果没必要单独为了一个图片生成去全部切换,生态层面 Codex 当下就是最优选。
5. 视频双雄:Seedance 2.5 和 MiniMax H3
Seedance 2.5,强在成片能力。 单次生成 30 秒原生视频,不用拼接不用超分,还支持多轮延长,理论上能续到几分钟。别小看这个 30 秒,行业普遍水平还在 5 到 15 秒,这一下把 AI 视频从「生成素材」推到了「直接出成片」的阶段。参考素材单次最多塞 50 个,30 张图,10 段视频,10 段音频随便混。还支持时间戳精准编辑,指哪一秒改哪一秒。
目前字节系 Seedance 2.5 是毫无疑问的视频领域王者,但是缺点是,贵。
MiniMax H3,强在开源和便宜。 8 月 3 日权重直接开源,2K 分辨率 15 秒,自带原生立体声,画面和声音一次出来,不用后期配音。API 价格 2K 每秒 0.13 美元,官方口径是主流模型的三分之一。自己有显卡的,ComfyUI 当天就支持了,拉下来本地跑,边际成本就是电费。
我实测 H3 也很强,但是和 Seedance 2.5 比依然有差距,然而 H3 是开源,这个意味着很快,全领域的视频模型能力都有机会缩小差距,而且可能把视频生成的价格打下来。
我们应该感谢每个开源界的 AI 公司,值得尊重。
6. 直接抄作业:分人群装机单
最后按人群给结论,对号入座。
如果你只是日常办公,那国内用户无脑 Workbuddy,内置一堆职场办公人的技能工具包,开箱即用,上手门槛低。
靠代码吃饭的开发者,有条件的闭眼 Codex + GPT-5.6 Sol。
国内开发者,预算有限的,Kimi Code + K3,套餐抢不到的可以看下国内一些云服务商。
做自媒体,设计,运营的,图片主力 GPT Image 2,如果量大考虑成本的,可以看下最新的 Grok Imagine Image 2.0。
短视频创作者,Seedance 2.5,30 秒直出目前独一档,但成本比较高。
技术团队,要批量出片或者有硬件资源想自部署的,MiniMax H3。
关于视频生成这里补充一个技巧,视频制作其实分 Motion Graphics 和创意素材类视频。前者是代码工程化制作视频,指哪打哪,后者才需要用到视频大模型生成,成本很高,需要抽卡。
如果有一定技术能力的,可以通过 Motion Graphics 工程能力结合视频大模型创意层面,做的好的话,在保持同等视频质量的前提下,能把视频制作成本打得很低。
最近我们团队在这块花了不少时间研究,现在星球也更新了 AI 视频的教程,后续有机会可以真实分享下实际视频质量和成本。
最后说句实话,AI 这个行业没有毕业配置,只有当下最合适的配置。
以上这份装机单,仅是当下我的推荐建议,供大家参考。
via 掘金人工智能本月最热 (author: stormzhangV)
8月21日消息,多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp已上线DeepSeek API平台,支持Chat Completions、Messages、Responses三种格式调用。
在图像理解方面,DeepSeek-v4-flash-vision-exp模型支持在文本之外输入图片,并让模型描述图片、识别截图中的文字、分析图表等。
价格方面,百万tokens输入缓存命中为0.05元起,缓存未命中1.5元起;百万tokens输出4.5元起。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:三言科技)
8月21日消息,DeepSeek对其大模型工具链进行了高强度迭代,正式将DeepSeek Harness升级至0.1.1-rc.1版本。此次更新最大的亮点,是在原有的DeepSeek V4Flash及V4Pro模型基础之上,重磅新增了全新的视觉模型体验版——V4Flash Vision-Exp。
就在前一日发布的v0.1.0-rc.8版本中,DeepSeek Harness已经率先打通了多模态核心能力。通过支持配置原生图片请求,系统的/goal、/plan等关键指令正式实现图文混合输入。这意味着,用户现在可以直接将工作截图和具体需求同时发送,让AI智能体(Agent)直接“看图干活”,大幅简化了开发与操作流程。
虽然此前DeepSeek在网页端已提供体验不错的识图模式,但将其深度整合并落地到开发工具链中,标志着V4Flash Vision-Exp彻底补全了多模态处理的最后一块拼图。对于开发者而言,只需通过指定npm命令进行升级,即可抢先体验这一兼具速度与准确度的全新视觉模型能力。
via AI新闻资讯 (author: AI Base)
DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 开放平台
这款实验性多模态模型在文本能力上比肩 DeepSeek-V4-Flash——涵盖智能体(Agents)、逻辑推理以及世界知识。 在多模态智能体基准测试中,V4-Flash-Vision-Exp 相比 V4-Flash 实现了大幅飞跃,使多模态智能体性能逼近 Opus-4.8。
现指定参数
—— DeepSeek
via 风向旗参考快讯 - Telegram Channel
这款实验性多模态模型在文本能力上比肩 DeepSeek-V4-Flash——涵盖智能体(Agents)、逻辑推理以及世界知识。 在多模态智能体基准测试中,V4-Flash-Vision-Exp 相比 V4-Flash 实现了大幅飞跃,使多模态智能体性能逼近 Opus-4.8。
现指定参数
model='deepseek-v4-flash-vision-exp' 进行体验。今天同步发布的 DeepSeek Harness 0.1.1 已开箱即用支持该新模型。—— DeepSeek
via 风向旗参考快讯 - Telegram Channel
还在忍受共享机场 IP 乱跳导致的账号风控、异地登录警告吗?
独立原生 IP,每次连接稳定如一
完美支持主流交易所与 DeFi 深度交互
极速低延迟,告别卡顿与断连
👇 立即体验独享稳定网络
🚀 网站: https://tglink.io/dd8a84ea056c35
✈️ 群组: https://t.me/happyvless
雷鸟创新(RayNeo)在2026雷鸟AI眼镜新品发布会上推出全新iO系列,首款产品雷鸟iO定位“人类增强AI眼镜”,售价2499元,首发到手价1996元起,支持0至1000度近视配镜,已在京东、天猫、抖音及线下眼镜渠道开售。Counterpoint与IDC数据显示,雷鸟创新2026年第一季度位居中国及全球AR眼镜出货量第一。
雷鸟iO采用双目显示架构和蓝湖光波导,OC区域透过率93%,非显示区超过98%,入眼亮度1800尼特,支持等效33英寸画面及DC调光。整机采用镁铝合金前框和钛合金镜腿,重量34克,配备体积小于一颗红豆的“萤火光引擎Nano”。产品支持Smart Crown智能旋钮、点头确认和摇头取消,并可显示天气、日程、待办等信息。
AI能力方面,雷鸟iO首批接入DeepSeek V4Pro和千问3.7Max,后续将支持Kimi K3及自研RayNeo AI大模型,续航最长两天。RayNeo全天候记忆引擎可处理声音、位置等信息,形成24小时上下文,并自动生成每日总结;实时提示功能还能识别对话中的问题并将参考答案显示在镜片上。产品还支持55种语言及109种口音翻译,以及AI提词器。
隐私方面,雷鸟iO采用无摄像头设计,录音、翻译等功能启动时隐私指示灯同步亮起且无法通过软件关闭。全天智记原始对话先在设备端匿名化、脱敏,用户可导出、迁移或彻底删除数据。
via AI新闻资讯 (author: AI Base)
Investigating service degradation
Aug 21, 09:20 UTC
Investigating - We are investigating a service degradation affecting some non-fast Grok-4.6 sessions.
Users may experience failures in sessions with attached images.
via Cursor Status - Incident History
Aug 21, 09:20 UTC
Investigating - We are investigating a service degradation affecting some non-fast Grok-4.6 sessions.
Users may experience failures in sessions with attached images.
via Cursor Status - Incident History
Files API 让你上传图片,之后通过
● 在多个请求中复用同一张图片,无需重复上传。
● 发送会超过 48 MiB 请求体限制或 32 MiB 单图内联限制的图片(见 图像理解:限制)。
上传的文件与
支持的格式:JPEG、PNG、GIF、WebP。格式由文件实际内容判断。
以下示例的
----------------------
上传文件
通过
表单字段:
响应描述了已存储的文件:
只有在上传时设置了有效期,
----------------------
列出文件
查询参数:
响应为分页列表:
----------------------
查询文件信息
----------------------
删除文件
----------------------
在对话请求中使用已上传的文件
使用
文件归属于你的 API key,可被任一 API 家族引用。注意:通过 Anthropic 兼容
与内联(base64)图片不同,通过
----------------------
Anthropic 兼容 Files API
同样的文件操作也可通过 Anthropic 兼容端点使用,
端点位于
这些端点(
Anthropic 兼容端点返回的文件对象形如:
使用
删除文件返回
----------------------
限制
via DeepSeek 新闻
file_id 引用。推荐在以下场景使用:● 在多个请求中复用同一张图片,无需重复上传。
● 发送会超过 48 MiB 请求体限制或 32 MiB 单图内联限制的图片(见 图像理解:限制)。
上传的文件与
deepseek-v4-flash-vision-exp 模型配合使用。如何在对话请求中引用已上传的文件,请参考 图像理解。支持的格式:JPEG、PNG、GIF、WebP。格式由文件实际内容判断。
以下示例的
base_url 为 https://api.deepseek.com。----------------------
上传文件
通过
multipart/form-data 请求向 POST /files 上传文件。单个文件最大 64 MiB,上传需在 10 分钟内完成。表单字段:
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
with open("image.jpg", "rb") as f:
uploaded = client.files.create(file=f, purpose="user_data")
print(uploaded.id) # file-api-xxxxxxxxxxxxxxxx
curl https://api.deepseek.com/files \
-H "Authorization: Bearer <DeepSeek API Key>" \
-F purpose="user_data" \
-F file="@image.jpg"
响应描述了已存储的文件:
{
"id": "file-api-xxxxxxxxxxxxxxxx",
"object": "file",
"bytes": 102400,
"created_at": 1700000000,
"filename": "image.jpg",
"purpose": "user_data",
"expires_at": 1700003600
}
只有在上传时设置了有效期,
expires_at 才会出现。----------------------
列出文件
files = client.files.list()
for f in files.data:
print(f.id, f.filename)
curl https://api.deepseek.com/files \
-H "Authorization: Bearer <DeepSeek API Key>"
查询参数:
响应为分页列表:
{
"object": "list",
"data": [
{
"id": "file-api-xxxxxxxxxxxxxxxx",
"object": "file",
"bytes": 102400,
"created_at": 1700000000,
"filename": "image.jpg",
"purpose": "user_data"
}
],
"first_id": "file-api-xxxxxxxxxxxxxxxx",
"last_id": "file-api-xxxxxxxxxxxxxxxx",
"has_more": false
}
----------------------
查询文件信息
info = client.files.retrieve("file-api-xxxxxxxxxxxxxxxx")
print(info.filename, info.bytes)
curl https://api.deepseek.com/files/file-api-xxxxxxxxxxxxxxxx \
-H "Authorization: Bearer <DeepSeek API Key>"
----------------------
删除文件
client.files.delete("file-api-xxxxxxxxxxxxxxxx")
curl -X DELETE https://api.deepseek.com/files/file-api-xxxxxxxxxxxxxxxx \
-H "Authorization: Bearer <DeepSeek API Key>"
{
"id": "file-api-xxxxxxxxxxxxxxxx",
"object": "file",
"deleted": true
}
----------------------
在对话请求中使用已上传的文件
使用
file 内容块引用返回的 file_id:response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里有什么?"},
{"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"},
],
}
],
)
print(response.choices[0].message.content)
文件归属于你的 API key,可被任一 API 家族引用。注意:通过 Anthropic 兼容
/messages 端点引用文件时需携带 anthropic-beta: files-api-2025-04-14 请求头。与内联(base64)图片不同,通过
file_id 引用的文件不受 32 MiB 单图限制,请求中单张最大 64 MiB。file 块也可以通过 file_data 以 base64 形式内联携带图片,替代 file_id(二者互斥)。使用 file_data 时还可设置 filename;filename 不能与 file_id 同时出现。----------------------
Anthropic 兼容 Files API
同样的文件操作也可通过 Anthropic 兼容端点使用,
base_url 为 https://api.deepseek.com/anthropic。所有请求必须带请求头 anthropic-beta: files-api-2025-04-14。端点位于
/anthropic/v1/ 路径下:Anthropic SDK 设置上述 base URL 时会自动补上 /v1;直接用 curl 等裸 HTTP 客户端时需要写完整路径。这些端点(
POST /anthropic/v1/files、GET /anthropic/v1/files、GET /anthropic/v1/files/{file_id}、DELETE /anthropic/v1/files/{file_id})遵循 Anthropic Files API 的形态,与上文 OpenAI 兼容版本存在差异:Anthropic 兼容端点返回的文件对象形如:
{
"id": "file-api-xxxxxxxxxxxxxxxx",
"type": "file",
"size_bytes": 102400,
"created_at": "2026-01-01T00:00:00+00:00",
"filename": "image.jpg",
"mime_type": "image/jpeg"
}
使用
after_id / before_id 游标列出文件:curl "https://api.deepseek.com/anthropic/v1/files?limit=20" \
-H "x-api-key: <DeepSeek API Key>" \
-H "anthropic-beta: files-api-2025-04-14"
{
"data": [
{
"id": "file-api-xxxxxxxxxxxxxxxx",
"type": "file",
"size_bytes": 102400,
"created_at": "2026-01-01T00:00:00+00:00",
"filename": "image.jpg",
"mime_type": "image/jpeg"
}
],
"first_id": "file-api-xxxxxxxxxxxxxxxx",
"last_id": "file-api-xxxxxxxxxxxxxxxx",
"has_more": false
}
删除文件返回
{ "id": "...", "type": "file_deleted" }。----------------------
限制
via DeepSeek 新闻
🤖deepseek-v4-flash-vision-exp 已上线 DeepSeek API,文档、定价暂未公布
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
OpenAI近日进一步开放Codex Harness相关核心能力,将驱动Codex不同产品形态的智能体运行框架向开发者开放。Codex Harness是Codex背后的核心Agent运行环境,负责连接模型、用户与工具,并管理任务执行、上下文、会话及代码操作等流程。OpenAI此前已将Codex CLI及相关核心代码开源,并持续完善Harness和App Server能力。
从架构来看,Codex Harness并非单纯的代码生成工具,而是完整的Agent执行框架。其核心包括Agent Loop、线程生命周期与持久化、配置及身份认证、工具执行和扩展机制等。通过Codex App Server,开发者可使用双向JSON-RPC协议将Harness接入不同客户端,并获得实时事件流,从而构建IDE、桌面应用及其他定制化Agent产品。
目前,Codex Harness已支撑Codex Web、CLI、IDE扩展及macOS应用等多种使用场景。OpenAI此前还公开分享“全由Codex编写代码”的Harness工程实践:一个内部产品在约5个月内形成约100万行代码,并完成约1500个Pull Request,团队核心理念从“人工编写代码”转向“人类设定目标、Agent执行”。
此次进一步开放Harness,意味着AI编程竞争正从模型能力延伸至Agent运行时、工具调用、上下文管理和工程反馈闭环。随着底层Harness逐渐标准化,开发者能够在Codex核心Agent能力之上构建更加丰富的专业化AI编程与软件工程工作流。
via AI新闻资讯 (author: AI Base)