SpaceXAI 推出 Grok Voice Transcribe 2.0,实现多语言流式识别精度翻倍
2026年9月18日,SpaceXAI 发布 Grok Voice Transcribe 2.0,声称在保持同等价格的前提下,转录准确率提升两倍,并支持 19 种语言的自动检测。

2026年9月18日,SpaceXAI 通过其全新语音识别 API 正式发布 Grok Voice Transcribe 2.0(模型标识为 grok-voice-transcribe-2.0),并将其定位为原版 Grok Voice Transcribe 的直接升级版,强调在转录准确率上实现双倍提升,同时每小时费用保持不变。
在 SpaceXAI 自行组织的基准测试中,该模型在包含 19 种语言的短句多语言测试集上的词错误率(WER)下降至 6.8%,而 1.0 版的 WER 为 20.6%。这意味着错误率降低约 67%,并且测试场景模拟了真实的混合语言对话环境。
基准表现与公开排名
SpaceXAI 引用了公开的 Artificial Analysis 排行榜,指出 Grok Voice Transcribe 2.0 目前在 32 种流式转录模型中以精度排名第一。公司说明该排名基于独立评估,但未披露排行榜的具体评估方法和评分细则。
除了整体 WER 的显著改进外,针对四套内部专有数据集(电话通话、对话语音、口述标识和短多语言短句)的测试也显示,各领域错误率均出现一致下降,尤其是短句数据集的错误率从 20.6% 降至 6.8%。
技术能力与 API 功能
Grok Voice Transcribe 2.0 同时提供批处理和流式两种工作模式。批处理模式下,用户可离线提交音频文件进行批量转录;流式模式则实现实时转录、词级时间戳、说话人分离以及最多八条音频通道的并行处理。所有这些功能均包含在每小时 0.10 美元(批处理)和 0.20 美元(流式)的基础价格中。
模型具备自动语言检测能力,能够在录音过程中实时切换检测语言,这对多语言会议或客服通话尤为实用,因为坐席与来电者可能交替使用不同语言。
除基础转录外,API 还能返回格式化文本、对一百个专业术语的重音标注,以及说话人分离,且无需额外费用。这一捆绑方案与许多竞争对手对分离或时间戳另收费用的做法形成鲜明对比。
采纳情况与生态系统整合
Atlassian 已将 Grok Voice Transcribe 2.0 集成到其 Loom 视频平台,用于为录制的会议和教学视频自动生成字幕。该服务仍由 SpaceXAI 托管,且公司未发布任何可本地部署的开源模型。
- 每小时 0.10 美元的批处理转录
- 每小时 0.20 美元的流式转录
- 支持 19 种语言的自动语言检测
- 内置说话人分离和词级时间戳
定价结构十分简明:客户仅按处理的音频时长计费,先进功能不收隐藏费用。这种透明定价旨在吸引需要可预测成本模型的大规模转录企业。
对中文企业的意义
对于主要使用中文但经常与多语言客户或合作伙伴交流的企业,Grok Voice Transcribe 2.0 提供了一个能够统一处理混合语言内容的 API,无需为不同语言分别调用不同服务。短句错误率的大幅下降提升了自动记录、合规日志以及实时字幕的可靠性,显著降低人工编辑成本。
基础价包含的说话人分离和词级时间戳功能,使得与企业内部分析平台的对接更加便捷,帮助企业快速从通话和会议录音中提取业务洞察。
在中国市场,监管机构对语音数据的存储与处理有严格要求。SpaceXAI 通过在美国数据中心提供全托管服务,承诺符合 GDPR 与中国网络安全法的相关规定,为本地企业提供合规的跨境语音转录解决方案。
综合来看,Grok Voice Transcribe 2.0 的技术提升、价格透明以及多语言自动检测能力,使其在全球语音转录市场中具备竞争优势,尤其对需要高精度、多语言支持且成本可控的中文企业而言,具有重要的战略意义。
信息来源
- Introducing Grok Voice Transcribe 2.0SpaceXAI · 2026年9月18日
- SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per HourMarkTechPost · 2026年9月18日



