豆包近日宣布其视频通话功能完成重大升级,正式接入自主研发的原生音视频全双工大模型SeedRealtime。这一技术突破标志着实时音视频交互领域迈入新阶段,通过多模态感知能力的深度融合,为用户带来更接近真实对话的智能体验。
据技术团队介绍,SeedRealtime大模型突破了传统音视频处理的单向模式,创新性地构建了视听联合理解框架。该模型能够实时分析对话场景中的视觉动态与语音节奏,智能判断交互时机——既能在对方发言时保持静默倾听,也能在恰当节点精准回应,甚至通过表情变化预判用户需求。这种多维度感知能力使系统在复杂场景下仍能保持自然流畅的对话节奏。
基于这项技术,升级后的豆包视频通话展现出三大核心优势:动态场景适应能力显著提升,可自动识别背景变化并调整交互策略;多模态响应速度达到毫秒级,实现真正的"边看边说"同步效果;情感理解维度扩展,通过微表情与语调分析提供更人性化的反馈。测试数据显示,在家庭聚会、户外运动等动态场景中,系统连续交互成功率较传统方案提升40%。
用户即日起可通过更新豆包APP至最新版本体验新功能。操作路径为:进入应用主界面后点击视频通话入口,系统将自动加载增强型交互模块。技术负责人特别说明,此次升级完全基于端侧计算架构,在保障实时性的同时确保用户隐私安全,所有音视频数据处理均在本地设备完成。




