💬 观点Hugging Face
Can Voice Agents Handle Bilingual Customers? — 评测前沿语音识别模型处理中英混合语音的能力,揭示多语言客户服务的技术挑战与进展。
评测前沿语音识别模型处理中英混合语音的能力,揭示多语言客户服务的技术挑战与进展。
2026-06-09原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
语音代理处理中英混合语音评测
企业客服中双语用户常中英混说,ASR 转录错误会传导至下游
- 覆盖西英、法英、加法英、德英四语对
- 场景为 HR 与 ITSM 支持请求
- 数据经语言学家审核,共 918 条
⚙️ 流程拆解
STEP 1筛选双语平行语料
STEP 2GPT-5 生成混合文本
STEP 3LLM 口语化并合成音频
STEP 4语言学家审核
STEP 5运行 ASR 模型评测
STEP 6计算 WER/SWER/AER
🔗 涉及的概念与玩家
- ServiceNow-AI公司
- ElevenLabs Scribe V2模型
- Google Gemini 3 Flash模型
- AssemblyAI Universal 3-Pro模型
- OpenAI Whisper Large V3 Turbo模型
- GPT-5模型
- AU-Harness产品
- code-switching概念
- ServiceNow-AI—发布→AU-Harness
- ServiceNow-AI—评测→code-switching
- GPT-5—生成→code-switching
- ElevenLabs Scribe V2—处理→code-switching
- Google Gemini 3 Flash—处理→code-switching
- AssemblyAI Universal 3-Pro—处理→code-switching
文章介绍了 ServiceNow AI 与 Hugging Face 合作,针对中英混合语音(code-switched speech)创建了一个新的基准测试。
- 基准测试的构建:他们收集并标注了一个包含中英混合语句的真实语音数据集,用于评估自动语音识别(ASR)模型在复杂语言环境下的表现。这对开发者意味着,要构建可靠的语音助手,必须拥有能够反映真实世界语言混杂情况的评估工具。
- 前沿模型的评测结果:测试了包括 Whisper、Gemini 等在内的多个前沿 ASR 模型。结果显示,即使是最先进的模型,在处理语言快速切换时,准确率也会显著下降。这对 Agent 开发的含义是,当前的语音技术在多语言场景下仍存在明显短板,直接影响用户体验。
- 开源贡献与未来方向:团队将数据集和评测代码开源,鼓励社区共同改进。这为工具链的演进提供了关键资源,开发者可以利用这些材料来训练和优化自己的多语言语音识别系统。
原文:Can Voice Agents Handle Bilingual Customers? Benchmarking Frontier ASR on Code-Switched Speech · 作者 Hugging Face
🕸 顺着图谱继续读
- System prompt · OpenClaw — OpenClaw 如何分层构建系统提示词,兼顾缓存与动态上下文。2026-08-24 · 共同涉及 GPT-5
- Predicting model behavior before release by simulating — OpenAI 推出部署模拟方法,通过真实对话数据预测模型行为,提升安全性和评估准2026-06-16 · 共同涉及 GPT-5
- OpenAI WebRTC Audio Session, now with document context — Simon Willison 分享如何利用 OpenAI WebRTC API 2026-06-12 · 共同涉及 GPT-5
- opencode v1.16.2 — 修复推理摘要兼容性,支持后台运行子代理,提升多服务器桌面体验2026-06-05 · 共同涉及 GPT-5