人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,并全面向开发者开放。该模型在智能水平、转录准确率、对话交互能力及工具调用效率等方面实现了显著跃升,其官方定价为每分钟音频 0.08 美元。
在权威的 Artificial Analysis 语音识别基准测试中,Grok Voice Think Fast 2.0的综合得分达到 82.9%,不仅超越了前代版本,也高于GPT-Realtime-2.1与Gemini 3.1 Flash。同时,其智能体能力评分录得 56.5%,在同类模型中处于领先地位。在响应速度上,该模型的首次音频播放时间大幅缩短至 0.70 秒,交互体验更加流畅。
在语音转录精度方面,官方测试表明,新模型在多语言环境下的转录准确率较上一代提升了约 1.4 倍,并在多国语言的大规模音频测试中展现出强大实力。特别是在背景噪音干扰和电话压缩等复杂现实场景中,其抗干扰能力与竞品的差距被进一步拉大。
技术架构上,Grok Voice Think Fast 2.0引入了语音并行推理机制,大幅减少了系统等待时间。通过强化学习对对话策略的深度优化,模型能够输出更简练的回答,确保单次处理单个核心问题,从而显著提升了复杂任务中的工具调用效率。
目前,该技术已在实际业务场景中展开验证,并在Starlink电话服务中完成了 A/B 测试,有效推动了销售转化率与客服响应效率的双重提升。按照官方规划,旧版本标识符计划于 2026 年 8 月 5 日自动切换至全新版本。




