很多人第一次用 AI 工具做粤语会议记录,反应都差不多:看起来像模像样,但总觉得「不太对」。字面上没有明显错处,可是对照记忆里的对话,总有些东西不见了。
这种落差通常不是来自大家最直觉会想到的「识别率」。纯粤语、单一讲者、环境安静的情况下,今天主流工具的表现其实已经相当可用。问题出在另外两个地方,而它们恰好是香港日常对话最常见的两种形态。
第一,一句话里中英夹杂的时候,识别质量会明显下跌。第二,就算听对了,输出的文字往往已经被改写成书面中文,不再是你当下讲的那句话。
这两件事的成因不同,影响的场景也不同,值得分开讲清楚。
30 秒快速结论
- 中英夹杂是有代价的,而且代价可以量化 → 公开研究文献显示,粤英语码转换内容的字符错误率约在 20%–26% 之间,而同类系统处理单一语言内容时约为 6%–8%。差距达三到四倍。
- 「听对」和「写对」是两件事 → 你讲「幾時搞掂」,记录写成「什么时候完成」,语义保住了,原话没有了。
- 这在多数场景无所谓,在少数场景很要命 → 闲聊摘要不受影响;医疗问诊、社福个案、调解记录、研究访谈则相反。
- 粤语数据量在 2025 年出现数量级变化 → 从数十小时级别的公开语料,跳到 WenetSpeech-Yue 的 21,800 小时,但语码转换仍是未解的部分。
- 选工具之前,先想清楚你要的是「意思」还是「原话」 → 两者需要的设置不一样,文末有一份判断清单。
先分清楚两件事:识别 vs. 呈现
讨论粤语记录质量时,很容易把两个独立环节混为一谈。
识别(ASR) 是把声音变成文字。这一步的失败是「听错」——听不出你讲了什么,或者把音近的词认成别的字。
呈现 是决定这些文字最后以什么形态出现。这一步的失败是「改写」——听得很准,但输出时把口语顺成了书面语。
大部分人投诉的「粤语记录不准」,其实是这两层各自出问题,而且需要用完全不同的方法处理。第一层是模型能力和训练数据的问题,第二层则多数是设计选择的问题——而且往往是刻意的。
断层一:粤英夹杂
为什么这件事特别难
「我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。」(意思是:我想去铜锣湾开个会,顺便看一下日程。)
这句话在香港毫不特别,但对识别系统来说,它要求的能力和纯粤语句子完全不同。系统必须在同一句、甚至同一个气口之内,即时切换两套完全不同的音韵系统与词汇库,而且切换点没有任何预告。
更麻烦的是,香港人讲英文词的时候,发音往往已经粤语化——音节结构、声调轮廓都被本地化过。这些发音既不完全符合英语模型的预期,也不在粤语模型的词表里。两边都觉得它不属于自己。
数字上的落差
公开研究文献提供了相当一致的图像:粤英语码转换内容的字符错误率大约落在 20% 至 26% 区间,而同类系统在单一语言内容上约为 6% 至 8%。在专门的粤英混合语音评测集上,以 Whisper 为基础的系统混合错误率约为 22%。
换算成体感:纯粤语内容大约每十多个字错一个,中英夹杂内容大约每四到五个字错一个。后者已经足以让一段记录需要逐句核对才敢使用。
这种错误的形态很特别
值得留意的是,语码转换的错误不像一般识别错误那样「看得出是错的」。系统很少直接留空或输出乱码,它倾向猜一个读音接近、语法上又说得通的中文词填进去。
结果就是一句表面完全通顺、意思却已经偏掉的句子。这比明显的错字危险得多——明显的错字你会停下来查证,通顺的错句你会直接读过去。
断层二:口语粤语 vs 书面中文
同一句话的两种写法
| 实际讲出口 | 常见输出 |
|---|---|
| 佢哋幾時先搞得掂? | 他们什么时候才能完成? |
| 呢單嘢我唔係好清楚 | 这件事我不太清楚 |
| 咁我哋而家點算? | 那我们现在怎么办? |
| 頭先個 client 講嘅嗰樣 | 刚才那位客户说的那件事 |
右边那栏没有一句是「错」的。意思都准确,读起来甚至更顺。问题是——没有人这样说话。
为什么系统会这样做
这通常不是 bug。中文书面语的训练数据以标准书面中文为压倒性多数,口语粤语书写(「嘅」「咗」「喺」「哋」)在整体语料中占比极小。模型在缺乏明确指示时,会自然倾向输出它最熟悉的那种中文。
而且在多数情况下,这个默认是对的。做会议摘要、写待办事项、发给不懂粤语的同事看——书面语版本明显更合用。
但有些场景刚好相反
问题在于,有一整类场景需要的恰恰是原话。
- 医疗问诊:病人形容症状的用词本身就是临床信息。「頂住頂住」「唧住痛」「作嘔作悶」被改写成标准词汇之后,那个具体的质感就没了。
- 社福个案记录:服务对象的原话关系到个案评估,改写等于在记录阶段先加了一层诠释。
- 调解与纠纷处理:谁讲过什么、用什么语气讲,本身就是争议所在。
- 研究访谈与口述历史:逐字稿的价值前提就是逐字。
- 语言教学与语料整理:口语形态本身就是研究对象。
这些场景的共同点是:记录不只是为了让人记得讨论过什么,而是可能要在日后被引用、被复核、被当成依据。一份被悄悄顺过稿的记录,在这种用途下是有风险的——因为它看起来完全正常,你不会知道哪里被改过。
一个容易被忽略的前提:粤语数据的处境
要理解为什么粤语工具的表现参差,看一下可用数据的规模会有帮助。
| 语料 | 规模 | 年份 |
|---|---|---|
| WenetSpeech-Yue | 21,800 小时,10 个领域,开放 | 2025 |
| Common Voice 粤语 (yue) | 210.91 小时(已验证),1,174 位讲者 | 持续更新 |
| MDCC | 73.6 小时 | 2022 |
| CantoMap | 12.8 小时,40 位讲者 | 2020 |
| HKCanCor | 约 230,000 词(1997–98 年录制) | 2015 |
| Words.hk 粤典 | 56,373 条词目 | 持续更新 |
2025 年 WenetSpeech-Yue 的出现是一个数量级的转变——在此之前,公开粤语语音数据长期停留在数十至数百小时的水平,而主流语言动辄以万小时计。这解释了过去粤语工具为何普遍落后。
但要留意,数据量增加主要改善的是单一语言粤语的识别。语码转换需要的是混合语料,而这类数据在标注上更困难、规模上仍然薄弱。所以断层一的改善速度,会明显慢过纯粤语识别的改善速度。
香港的另一重脉络
顺带一提一组相关数字。根据 2021 年人口普查,香港非华裔居民约 619,568 人,占人口 8.4%。而在能否讲粤语这一项上:菲律宾裔 17.6%、印度裔 25.0%、全体南亚裔 34.7%,相对地英语能力则普遍在 84% 以上。
换句话说,香港日常沟通的语言处境,并不是「粤语」单一场景,而是粤语、英语、以及多种其他语言同时在场。一个只做好粤语识别、却无法即时翻译的工具,解决的只是问题的一半。
Traverba 在这两道断层上的处理
- 粤英夹杂优先 — 针对香港式中英混合语句的识别调整,而不是把粤语和英语当成两个要二选一的模式。
- 口语形态保留 — 转录以你实际讲出口的形态为准,摘要与翻译则另外生成;原话和整理稿并存,而不是用整理稿覆盖原话。
- 即时转录+即时翻译一体化 — 同一场对话,一位讲者、100+ 种语言,听众扫 QR code 就能看自己语言的字幕,不用下载 App。
- 设备本机优先 — 语音识别默认在设备上执行,云端 AI 为可选项;需要处理敏感内容时,可以完全不外传。
- 完整逐字稿可导出 — 会后可导出原话逐字稿与翻译版本,两者分开保存。
讲清楚:如果你的用途是一般商务会议摘要、内部同步、待办事项整理,市面上多数 AI 笔记工具已经做得不错,书面语输出反而更合用,没有必要为此换工具。上述差异真正有意义的场合,是那些「原话本身就是数据」的场景。
怎么判断?一份简短清单
问自己三个问题:
一、这份记录日后会不会被引用或复核? 如果会(个案记录、临床记录、调解、访谈),你需要逐字稿,而且需要确认工具没有在背后改写。如果不会,书面语摘要更实用。
二、对话里中英夹杂的密度有多高? 偶尔夹一两个英文词,多数工具都应付得来。如果是那种一句话里切换两三次的典型香港对话,你需要先用一段真实录音实测,不要看官方语言清单。
三、内容敏感吗? 涉及病历、个案、法律事务的录音,先确认数据流向——处理在本机还是云端、存储多久、有没有用作训练。
最后一点建议:不论选哪个工具,用一段你自己的真实对话去测,不要用朗读稿。朗读的粤语没有语码转换、没有口语助词、没有插话重叠,测不出上述任何一个问题。
了解更多
粤语记录这件事上,没有一个工具适合所有情况。关键是先弄清楚你要的是「意思」还是「原话」——这个决定会直接影响你该怎么选、怎么设置。
想了解 Traverba 如何处理粤英夹杂与口语保留,可以到 traverba.com,或于 Google Play 及 App Store 下载试用。
本文引用的错误率数字来自公开的粤语语音识别研究文献,语料规模数据来自各语料库官方公布资料,人口与语言能力数据来自香港政府 2021 年人口普查。各项数据截至 2026 年年中,模型与工具能力持续变动,实际表现视乎录音质量、口音、环境噪音及具体版本而异。所有品牌与商标均属各自拥有者所有。