豆包近日宣布其视频通话功能迎来重大升级,通过接入自主研发的原生音视频全双工大模型SeedRealtime,实现了音视频交互技术的突破性进展。该模型支持音视频联合解析能力,可实时识别对话场景中的视觉与听觉信息,精准判断用户表达意图,自动协调聆听、回应与静默的时机,为实时对话提供更智能的交互逻辑。
基于SeedRealtime的底层架构,豆包视频通话在复杂动态场景中展现出显著优势。系统能够同步处理视觉画面与语音内容,通过多模态信息融合实现连续自然的交互流程。用户在与AI对话时,可同时完成观察、倾听与表达动作,系统会根据实时语境自动调整响应策略,避免传统交互中常见的延迟或信息错位问题。
技术团队透露,该模型通过大规模音视频数据训练,构建了独特的时空感知机制。在测试环境中,系统对非结构化场景的适应能力较前代提升40%,特别是在多人对话、背景噪音干扰等场景下,仍能保持稳定的交互质量。这种技术突破使得AI视频通话首次具备接近人类对话的流畅度。
即日起,用户将豆包APP升级至最新版本后,通过视频通话入口即可体验全新功能。系统支持多设备无缝切换,在移动网络环境下仍能保持720P高清画质与毫秒级响应速度。开发团队表示,未来将持续优化模型在专业领域的应用能力,拓展教育、医疗等场景的深度交互可能性。




