为什么你的粤语会议记录总是「不太对」?粤英夹杂与口语/书面语的两道断层

很多人第一次用 AI 工具做粤语会议记录,反应都差不多:看起来像模像样,但总觉得「不太对」。字面上没有明显错处,可是对照记忆里的对话,总有些东西不见了。

这种落差通常不是来自大家最直觉会想到的「识别率」。纯粤语、单一讲者、环境安静的情况下,今天主流工具的表现其实已经相当可用。问题出在另外两个地方,而它们恰好是香港日常对话最常见的两种形态。

第一,一句话里中英夹杂的时候,识别质量会明显下跌。第二,就算听对了,输出的文字往往已经被改写成书面中文,不再是你当下讲的那句话。

这两件事的成因不同,影响的场景也不同,值得分开讲清楚。


30 秒快速结论

  • 中英夹杂是有代价的,而且代价可以量化 → 公开研究文献显示,粤英语码转换内容的字符错误率约在 20%–26% 之间,而同类系统处理单一语言内容时约为 6%–8%。差距达三到四倍。
  • 「听对」和「写对」是两件事 → 你讲「幾時搞掂」,记录写成「什么时候完成」,语义保住了,原话没有了。
  • 这在多数场景无所谓,在少数场景很要命 → 闲聊摘要不受影响;医疗问诊、社福个案、调解记录、研究访谈则相反。
  • 粤语数据量在 2025 年出现数量级变化 → 从数十小时级别的公开语料,跳到 WenetSpeech-Yue 的 21,800 小时,但语码转换仍是未解的部分。
  • 选工具之前,先想清楚你要的是「意思」还是「原话」 → 两者需要的设置不一样,文末有一份判断清单。

先分清楚两件事:识别 vs. 呈现

讨论粤语记录质量时,很容易把两个独立环节混为一谈。

识别(ASR) 是把声音变成文字。这一步的失败是「听错」——听不出你讲了什么,或者把音近的词认成别的字。

呈现 是决定这些文字最后以什么形态出现。这一步的失败是「改写」——听得很准,但输出时把口语顺成了书面语。

大部分人投诉的「粤语记录不准」,其实是这两层各自出问题,而且需要用完全不同的方法处理。第一层是模型能力和训练数据的问题,第二层则多数是设计选择的问题——而且往往是刻意的。


断层一:粤英夹杂

为什么这件事特别难

「我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。」(意思是:我想去铜锣湾开个会,顺便看一下日程。)

这句话在香港毫不特别,但对识别系统来说,它要求的能力和纯粤语句子完全不同。系统必须在同一句、甚至同一个气口之内,即时切换两套完全不同的音韵系统与词汇库,而且切换点没有任何预告。

更麻烦的是,香港人讲英文词的时候,发音往往已经粤语化——音节结构、声调轮廓都被本地化过。这些发音既不完全符合英语模型的预期,也不在粤语模型的词表里。两边都觉得它不属于自己。

数字上的落差

公开研究文献提供了相当一致的图像:粤英语码转换内容的字符错误率大约落在 20% 至 26% 区间,而同类系统在单一语言内容上约为 6% 至 8%。在专门的粤英混合语音评测集上,以 Whisper 为基础的系统混合错误率约为 22%。

换算成体感:纯粤语内容大约每十多个字错一个,中英夹杂内容大约每四到五个字错一个。后者已经足以让一段记录需要逐句核对才敢使用。

这种错误的形态很特别

值得留意的是,语码转换的错误不像一般识别错误那样「看得出是错的」。系统很少直接留空或输出乱码,它倾向猜一个读音接近、语法上又说得通的中文词填进去。

结果就是一句表面完全通顺、意思却已经偏掉的句子。这比明显的错字危险得多——明显的错字你会停下来查证,通顺的错句你会直接读过去。


断层二:口语粤语 vs 书面中文

同一句话的两种写法

实际讲出口常见输出
佢哋幾時先搞得掂?他们什么时候才能完成?
呢單嘢我唔係好清楚这件事我不太清楚
咁我哋而家點算?那我们现在怎么办?
頭先個 client 講嘅嗰樣刚才那位客户说的那件事

右边那栏没有一句是「错」的。意思都准确,读起来甚至更顺。问题是——没有人这样说话。

为什么系统会这样做

这通常不是 bug。中文书面语的训练数据以标准书面中文为压倒性多数,口语粤语书写(「嘅」「咗」「喺」「哋」)在整体语料中占比极小。模型在缺乏明确指示时,会自然倾向输出它最熟悉的那种中文。

而且在多数情况下,这个默认是对的。做会议摘要、写待办事项、发给不懂粤语的同事看——书面语版本明显更合用。

但有些场景刚好相反

问题在于,有一整类场景需要的恰恰是原话。

  • 医疗问诊:病人形容症状的用词本身就是临床信息。「頂住頂住」「唧住痛」「作嘔作悶」被改写成标准词汇之后,那个具体的质感就没了。
  • 社福个案记录:服务对象的原话关系到个案评估,改写等于在记录阶段先加了一层诠释。
  • 调解与纠纷处理:谁讲过什么、用什么语气讲,本身就是争议所在。
  • 研究访谈与口述历史:逐字稿的价值前提就是逐字。
  • 语言教学与语料整理:口语形态本身就是研究对象。

这些场景的共同点是:记录不只是为了让人记得讨论过什么,而是可能要在日后被引用、被复核、被当成依据。一份被悄悄顺过稿的记录,在这种用途下是有风险的——因为它看起来完全正常,你不会知道哪里被改过。


一个容易被忽略的前提:粤语数据的处境

要理解为什么粤语工具的表现参差,看一下可用数据的规模会有帮助。

语料规模年份
WenetSpeech-Yue21,800 小时,10 个领域,开放2025
Common Voice 粤语 (yue)210.91 小时(已验证),1,174 位讲者持续更新
MDCC73.6 小时2022
CantoMap12.8 小时,40 位讲者2020
HKCanCor约 230,000 词(1997–98 年录制)2015
Words.hk 粤典56,373 条词目持续更新

2025 年 WenetSpeech-Yue 的出现是一个数量级的转变——在此之前,公开粤语语音数据长期停留在数十至数百小时的水平,而主流语言动辄以万小时计。这解释了过去粤语工具为何普遍落后。

但要留意,数据量增加主要改善的是单一语言粤语的识别。语码转换需要的是混合语料,而这类数据在标注上更困难、规模上仍然薄弱。所以断层一的改善速度,会明显慢过纯粤语识别的改善速度。


香港的另一重脉络

顺带一提一组相关数字。根据 2021 年人口普查,香港非华裔居民约 619,568 人,占人口 8.4%。而在能否讲粤语这一项上:菲律宾裔 17.6%、印度裔 25.0%、全体南亚裔 34.7%,相对地英语能力则普遍在 84% 以上。

换句话说,香港日常沟通的语言处境,并不是「粤语」单一场景,而是粤语、英语、以及多种其他语言同时在场。一个只做好粤语识别、却无法即时翻译的工具,解决的只是问题的一半。


Traverba 在这两道断层上的处理

  • 粤英夹杂优先 — 针对香港式中英混合语句的识别调整,而不是把粤语和英语当成两个要二选一的模式。
  • 口语形态保留 — 转录以你实际讲出口的形态为准,摘要与翻译则另外生成;原话和整理稿并存,而不是用整理稿覆盖原话。
  • 即时转录+即时翻译一体化 — 同一场对话,一位讲者、100+ 种语言,听众扫 QR code 就能看自己语言的字幕,不用下载 App。
  • 设备本机优先 — 语音识别默认在设备上执行,云端 AI 为可选项;需要处理敏感内容时,可以完全不外传。
  • 完整逐字稿可导出 — 会后可导出原话逐字稿与翻译版本,两者分开保存。

讲清楚:如果你的用途是一般商务会议摘要、内部同步、待办事项整理,市面上多数 AI 笔记工具已经做得不错,书面语输出反而更合用,没有必要为此换工具。上述差异真正有意义的场合,是那些「原话本身就是数据」的场景。


怎么判断?一份简短清单

问自己三个问题:

一、这份记录日后会不会被引用或复核? 如果会(个案记录、临床记录、调解、访谈),你需要逐字稿,而且需要确认工具没有在背后改写。如果不会,书面语摘要更实用。

二、对话里中英夹杂的密度有多高? 偶尔夹一两个英文词,多数工具都应付得来。如果是那种一句话里切换两三次的典型香港对话,你需要先用一段真实录音实测,不要看官方语言清单。

三、内容敏感吗? 涉及病历、个案、法律事务的录音,先确认数据流向——处理在本机还是云端、存储多久、有没有用作训练。

最后一点建议:不论选哪个工具,用一段你自己的真实对话去测,不要用朗读稿。朗读的粤语没有语码转换、没有口语助词、没有插话重叠,测不出上述任何一个问题。


了解更多

粤语记录这件事上,没有一个工具适合所有情况。关键是先弄清楚你要的是「意思」还是「原话」——这个决定会直接影响你该怎么选、怎么设置。

想了解 Traverba 如何处理粤英夹杂与口语保留,可以到 traverba.com,或于 Google PlayApp Store 下载试用。


本文引用的错误率数字来自公开的粤语语音识别研究文献,语料规模数据来自各语料库官方公布资料,人口与语言能力数据来自香港政府 2021 年人口普查。各项数据截至 2026 年年中,模型与工具能力持续变动,实际表现视乎录音质量、口音、环境噪音及具体版本而异。所有品牌与商标均属各自拥有者所有。