Canto 瞄准真实听写,词表越贴心也可能越容易听错
据 Wispr 的 Canto 技术介绍,这套语音识别模型面向真实听写场景优化,利用上下文帮助识别人名、术语等内容。Canto 在 8 月的产品公告中已被提及,这次值得看的新增信息是评测口径与训练方法,而不是把它再包装成首次发布。
作者:周白|OC 产品体验编辑
据 Wispr 的 Canto 技术介绍,这套语音识别模型面向真实听写场景优化,利用上下文帮助识别人名、术语等内容。Canto 在 8 月的产品公告中已被提及,这次值得看的新增信息是评测口径与训练方法,而不是把它再包装成首次发布。
一句话结论:让语音模型认识你的工作词汇很有用,但它也必须知道,眼前的词表不一定就是你刚刚说的话。
听写的难点,往往藏在一句很普通的工作消息里。你说了同事姓名、项目代号,又临时改口,最后补了一句英文缩写。把录音逐字转出来,与得到一段不用反复修改、可以直接发出去的文字,并不是同一件事。
Canto 的方向是针对这种日常输入做优化。Wispr 在自己的英文 Flow 听写测试中报告了较低的词错误率;但在另一组挑战材料上,它的总体结果排在 Gemini 3.1 Pro 之后。不同材料得出不同排序,恰恰说明不能把某个测试的领先写成“所有场景最好”。
自有测试接近目标用户,是优点,也限定了结论的适用范围。英文办公听写表现不错,不等于中文方言、混合语种、远场会议录音也同样出色。公开介绍不足以支持这样的外推。
上下文不是越多越好
如果模型知道你正在编辑哪个项目、常用哪些专有名词,它就更容易从相近发音中选对一个词。这相当于给听写系统一本小词典,而不是让它每次都从整个语言里盲猜。
问题也出在这里。当上下文里出现一个熟悉名称,但用户这次说的是另一个名字,系统可能过度相信词表。Wispr 的文章讨论了这种风险;其中围绕误导性上下文的部分实验属于面向后续改进的研究,不应全算成已上线 Canto 的能力。

真正成熟的体验,既要能借助提示纠正生词,也要保留对声音证据的敏感。如果每次都自信地替用户“猜对”,用户反而必须逐字检查专有名词。便利省下来的时间,很容易在核对时还回去。
少改几个字,和少犯一个关键错误
词错误率能衡量插入、删除、替换了多少词,却不会自动告诉你错误有多严重。一段闲聊里漏掉语气词,与工作消息里把日期、人名或金额写错,给用户带来的麻烦不同。这不是否定指标,而是说产品评估需要补上具体任务。
用户改写记录也要小心解释:把口语改成书面语、删掉赘述,并不一定意味着语音识别错了。若把所有修改都当作识别错误反馈,模型可能学会过度润色,最终偏离原话。
Wispr 表示相关听写数据来自选择参与数据共享的用户。这个限定值得保留,但它不等于音频只在本机处理,也不代表所有使用者都同意参与训练。对涉及客户资料或内部项目的工作流,用户仍需要了解产品实际的数据处理设置。
关键事实
- 产品:Wispr Canto,面向听写的语音识别模型。
- 评测边界:英文自有听写测试与挑战集并非同一排名。
- 上下文价值:辅助识别专有名词,也可能造成错误偏置。
- 研究区分:未来改进实验不能直接视为当前上线功能。
OC 判断
OC 看好从“听懂标准录音”走向“接住真实表达”的产品路线。决定日常体验的不是一张总榜,而是关键字段出错多少、是否容易回听纠正,以及系统有没有擅自改变表达。能少让用户返工,才算把模型进步变成了工具进步。
为什么重要
- 对用户:试用时带上自己的名字、术语和改口习惯,比只念一段标准文章更有意义。
- 对开发者:比较转写质量时应同时观察延迟、关键错误和纠错成本。
- 对企业:数据共享、处理位置和保存方式需要单独核对,不能由模型成绩推断。
评论
围绕这篇文章补充信息、提出问题或分享观察。