字节跳动发布全模态大模型Doubao-Seed-2.0-lite，AI能听会看还能直接“上手”干活字节跳动旗下火山引擎于5月6日宣布，豆包大模型家族正式迎来首款全模态理解模型——Doubao-Seed-2.0-lite

字节跳动发布全模态大模型Doubao-Seed-2.0-lite，AI能听会看还能直接“上手”干活

字节跳动旗下火山引擎于5月6日宣布，豆包大模型家族正式迎来首款全模态理解模型——Doubao-Seed-2.0-lite。作为该系列的重磅升级版本，新模型彻底打破了单一模态的限制，实现了视频、图像、音频与文本的原生统一理解，标志着其在多模态交互领域迈出了关键一步。

该模型在视觉与逻辑推理能力上表现尤为亮眼。在物理、医疗等高阶学科的复杂推理测试中，其性能已大幅超越今年2月发布的Pro版本。而在细粒度感知以及具身理解等前沿领域，该模型更是达到了行业领先水平。通过融入语音理解技术，Doubao-Seed-2.0-lite 能够实现“音画同步”的深度联合推理。这意味着它不仅能“看懂”视频画面，还能结合背景音频精准判断视频内容的视听一致性，甚至能根据指令在长视频中精准定位特定事件，并还原复杂的人物关系脉络。

在音频处理层面，新模型展现了极高的翻译与感知精度，支持包括中英在内的19种语种转写及14个语种的互译。除了精准的语义识别，它还能敏锐捕捉语音中的情绪波动及环境背景声，使其理解能力更接近人类的自然认知。

值得关注的是，Doubao-Seed-2.0-lite 的 Agent（智能体）与 Coding(编程)能力也同步完成了进化。模型对多轮复杂指令的遵循度显著提升，具备了更强的自我拆解与校验能力。在开发领域，它的代码能力已覆盖前端页面、3D场景及游戏开发，能够交付视觉美观且工程完整的产物。

此外，该模型首次实现了GUI（图形用户界面）理解与执行的一体化。它不仅能识别网页或应用中的按钮、菜单等元素，还能像真人一样完成点击、拖拽、输入等操作，真正实现了从“读懂界面”到“端到端交付任务”的闭环。

目前，这一技术已在电竞复盘、在线教育及跨境电商等多个领域落地。例如在电竞场景中，AI可以作为教练，连续分析长达25小时的比赛视频与语音，自动生成战术复盘图谱。与此同时，更高效的 Doubao-Seed-2.0-mini 版本也已同步上线，为企业大规模、低成本部署全模态推理任务提供了更具性价比的选择。

via AI新闻资讯 (author: AI Base)