xAI 发布 Grok Voice Transcribe 2.0 语音转文字模型,面向真实录音中的噪声、口音、多人交谈和电话音质。xAI 表示,它在自有生产数据评测中比 1.0 版准确率更高,并在 Artificial Analysis 的公开榜单上以准确度排在 32 个流式模型之首;这些结果分别属于厂商评测和外部榜单,应按测试条件理解。阅读 xAI 官方说明与功能细节。

适合哪些录音工作
模型可用于客服通话、访谈、视频旁白和短语音指令。接口支持最多 8 声道,能加入最多 100 个领域词来帮助识别产品名、人名或专用术语,并返回说话人区分与时间戳。它会自动识别多种语言,并处理录音中途切换语言的情况。短句缺少上下文,数字、邮箱、地址和专有名词仍是需要重点抽查的部分。
价格与迁移安排
xAI 公布的批量转写价格为每小时音频 0.10 美元,实时转写为每小时 0.20 美元;公告称 2.0 将成为默认版本,1.0 会在随后数周逐步弃用。实时与批处理价格不同,按原始音频时长而非文字长度估算更容易做预算。切换模型后,即使接口仍返回文本,也应留意识别错误类型和下游时间戳表现是否变化。
怎么做一次可信的转写对比
- 准备一组已人工校对的代表性录音,涵盖电话噪声、多人交谈、口音、短语音和数字拼读。
- 在请求中提供与业务相关的术语词表,比较有无词表时的识别准确度。
- 按词错误率、说话人归属、时间戳偏差和人工校对分钟数统计,而不只比较“听起来更通顺”。
- 检查录音中是否含个人信息或受保护内容,按组织规则控制上传、留存与访问权限。