字节跳动发布全模态大模型Doubao-Seed-2.0-lite,AI能听会看还能直接“上手”干活

字节跳动旗下火山引擎于5月6日宣布,豆包大模型家族正式迎来首款全模态理解模型——Doubao-Seed-2.0-lite。作为该系列的重磅升级版本,新模型彻底打破了单一模态的限制,实现了视频、图像、音频与文本的原生统一理解,标志着其在多模态交互领域迈出了关键一步。

该模型在视觉与逻辑推理能力上表现尤为亮眼。在物理、医疗等高阶学科的复杂推理测试中,其性能已大幅超越今年2月发布的Pro版本。而在细粒度感知以及具身理解等前沿领域,该模型更是达到了行业领先水平。通过融入语音理解技术,Doubao-Seed-2.0-lite 能够实现“音画同步”的深度联合推理。这意味着它不仅能“看懂”视频画面,还能结合背景音频精准判断视频内容的视听一致性,甚至能根据指令在长视频中精准定位特定事件,并还原复杂的人物关系脉络。

在音频处理层面,新模型展现了极高的翻译与感知精度,支持包括中英在内的19种语种转写及14个语种的互译。除了精准的语义识别,它还能敏锐捕捉语音中的情绪波动及环境背景声,使其理解能力更接近人类的自然认知。

值得关注的是,Doubao-Seed-2.0-lite 的 Agent(智能体)与 Coding(编程)能力也同步完成了进化。模型对多轮复杂指令的遵循度显著提升,具备了更强的自我拆解与校验能力。在开发领域,它的代码能力已覆盖前端页面、3D场景及游戏开发,能够交付视觉美观且工程完整的产物。

此外,该模型首次实现了GUI(图形用户界面)理解与执行的一体化。它不仅能识别网页或应用中的按钮、菜单等元素,还能像真人一样完成点击、拖拽、输入等操作,真正实现了从“读懂界面”到“端到端交付任务”的闭环。

目前,这一技术已在电竞复盘、在线教育及跨境电商等多个领域落地。例如在电竞场景中,AI可以作为教练,连续分析长达25小时的比赛视频与语音,自动生成战术复盘图谱。与此同时,更高效的 Doubao-Seed-2.0-mini 版本也已同步上线,为企业大规模、低成本部署全模态推理任务提供了更具性价比的选择。

via AI新闻资讯 (author: AI Base)
 
 
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]