OpenAI 在 7 月 29 日甩出了两枚新的听觉引擎。GPT-Live-Transcribe 与 GPT-Transcribe 两款转录模型正式通过 API 开放调用,它们不再只是把声音转成文字的搬运工,而是学着去听懂一句话背后的上下文——口音、术语、数字,乃至背景里那阵喧闹的人声,都不再轻易让它犯晕。
两枚模型各有一副脾性。GPT-Live-Transcribe 生来为低延迟的实时场景而造,像一位贴着说话人同步落笔的速记员,每分钟收费 0.017 美元,按现汇率约合 0.12 元人民币。GPT-Transcribe 则把力气花在已完成的音频文件和批量任务上,走异步转录的路子,价格压到每分钟 0.0045 美元,约合 0.03 元人民币,更适合事后成批消化录音的活儿。
真正拉开代差的,是它们对语境的消化能力。在 Context Aware ASR 基准上,GPT-Transcribe 的语义准确率从没有自由形式上下文时的 41.6%,一路爬升到接入上下文后的 45.2%——它开始明白,同一个词在不同对话里可能意味着完全不同的东西。
面对 Whisper 这位老前辈,新模型几乎赢下了一个身位。在 Common Voice 覆盖的 22 种语言里,GPT-Transcribe 把转录错误率压到了 19.27%,而 Whisper(whisper-1)还停在 40.37%,差距超过一倍;放到真实世界录音的九种语言基准上,它更是把错误率砍到 8.98%,把 Whisper 的 15.21% 远远甩在身后。当机器能听清带噪环境下的专业术语,语音交互那扇一直半掩的门,似乎又被推开了一道缝。




