Vì sao biên bản họp tiếng Quảng Đông của bạn luôn “hơi sai sai”? Hai đứt gãy: trộn Quảng-Anh và khẩu ngữ so với văn viết

Nhiều người lần đầu dùng công cụ AI để làm biên bản họp tiếng Quảng Đông đều có phản ứng khá giống nhau: nhìn thì có vẻ đâu ra đấy, nhưng vẫn thấy "hơi sai sai". Về mặt chữ nghĩa không có lỗi rõ ràng, nhưng đối chiếu với cuộc trò chuyện còn nhớ trong đầu, luôn thấy thiếu mất một thứ gì đó.

Khoảng cách này thường không đến từ thứ mà ai cũng nghĩ tới đầu tiên là "tỷ lệ nhận dạng". Với tiếng Quảng Đông thuần túy, một người nói, môi trường yên tĩnh, các công cụ phổ biến hiện nay thực ra đã đủ dùng. Vấn đề nằm ở hai chỗ khác, mà đó lại chính là hai dạng phổ biến nhất trong hội thoại thường ngày ở Hồng Kông.

Thứ nhất, khi một câu trộn lẫn tiếng Trung và tiếng Anh, chất lượng nhận dạng tụt xuống rõ rệt. Thứ hai, dù có nghe đúng đi nữa, văn bản đầu ra thường đã bị viết lại thành Trung văn viết chuẩn, không còn là câu bạn vừa nói ra nữa.

Hai chuyện này có nguyên nhân khác nhau, ảnh hưởng đến những tình huống khác nhau, nên đáng được tách ra nói cho rõ.


Kết luận nhanh trong 30 giây

  • Trộn Trung-Anh là có cái giá phải trả, và cái giá đó đo được → Tài liệu nghiên cứu công khai cho thấy tỷ lệ lỗi ký tự với nội dung chuyển mã Quảng-Anh vào khoảng 20%–26%, trong khi cùng loại hệ thống xử lý nội dung đơn ngữ chỉ khoảng 6%–8%. Chênh lệch tới ba đến bốn lần.
  • "Nghe đúng" và "viết đúng" là hai chuyện khác nhau → Bạn nói 幾時搞掂 (khi nào mới xong), biên bản ghi thành 什麼時候完成; ý nghĩa vẫn còn, nhưng nguyên văn đã mất.
  • Điều này không quan trọng trong phần lớn tình huống, nhưng rất nghiêm trọng trong một số ít → Tóm tắt chuyện phiếm thì không ảnh hưởng; khám bệnh, hồ sơ công tác xã hội, biên bản hòa giải, phỏng vấn nghiên cứu thì ngược lại.
  • Khối lượng dữ liệu tiếng Quảng Đông thay đổi về bậc độ lớn trong năm 2025 → Từ kho ngữ liệu công khai cỡ vài chục giờ nhảy lên 21.800 giờ của WenetSpeech-Yue, nhưng chuyển mã ngôn ngữ vẫn là phần chưa giải quyết được.
  • Trước khi chọn công cụ, hãy nghĩ cho rõ bạn cần "ý nghĩa" hay "nguyên văn" → Hai thứ đó đòi hỏi thiết lập khác nhau; cuối bài có một danh sách để tự đánh giá.

Trước hết phân biệt hai chuyện: nhận dạng vs. trình bày

Khi bàn về chất lượng biên bản tiếng Quảng Đông, người ta rất dễ gộp hai khâu độc lập làm một.

Nhận dạng (ASR) là biến âm thanh thành chữ. Thất bại ở bước này là "nghe nhầm" — không nhận ra bạn nói gì, hoặc nhận nhầm một từ đồng âm gần giống thành chữ khác.

Trình bày là quyết định những chữ đó cuối cùng xuất hiện dưới hình thức nào. Thất bại ở bước này là "viết lại" — nghe rất chuẩn, nhưng khi xuất ra lại gọt khẩu ngữ thành văn viết.

Cái mà phần lớn mọi người than phiền là "biên bản tiếng Quảng Đông không chính xác" thực ra là vấn đề phát sinh riêng ở từng lớp trong hai lớp này, và cần được xử lý bằng những cách hoàn toàn khác nhau. Lớp thứ nhất là vấn đề năng lực mô hình và dữ liệu huấn luyện; lớp thứ hai đa phần là vấn đề lựa chọn thiết kế — và thường là cố ý.


Đứt gãy thứ nhất: trộn Quảng Đông và tiếng Anh

Vì sao chuyện này đặc biệt khó

「我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。」(Nghĩa là: Tôi muốn đến Causeway Bay họp một buổi, tiện thể kiểm tra lịch trình.)

Câu này chẳng có gì đặc biệt ở Hồng Kông, nhưng với hệ thống nhận dạng, nó đòi hỏi những năng lực hoàn toàn khác so với một câu tiếng Quảng Đông thuần túy. Hệ thống phải chuyển đổi tức thời giữa hai hệ thống âm vị và kho từ vựng hoàn toàn khác nhau, ngay trong cùng một câu, thậm chí trong cùng một hơi thở, mà điểm chuyển đổi lại không hề được báo trước.

Rắc rối hơn nữa là khi người Hồng Kông nói từ tiếng Anh, cách phát âm thường đã bị Quảng Đông hóa — cấu trúc âm tiết và đường nét thanh điệu đều đã được bản địa hóa. Những cách phát âm này vừa không hoàn toàn khớp với kỳ vọng của mô hình tiếng Anh, vừa không nằm trong bảng từ của mô hình tiếng Quảng Đông. Cả hai bên đều thấy nó không thuộc về mình.

Khoảng cách trên con số

Tài liệu nghiên cứu công khai cho một bức tranh khá nhất quán: tỷ lệ lỗi ký tự với nội dung chuyển mã Quảng-Anh rơi vào khoảng 20% đến 26%, trong khi cùng loại hệ thống với nội dung đơn ngữ chỉ khoảng 6% đến 8%. Trên các bộ đánh giá giọng nói trộn Quảng-Anh chuyên biệt, hệ thống dựa trên Whisper có tỷ lệ lỗi hỗn hợp khoảng 22%.

Quy đổi thành cảm nhận thực tế: nội dung tiếng Quảng Đông thuần túy sai khoảng một chữ trên hơn mười chữ; nội dung trộn Trung-Anh sai khoảng một chữ trên bốn đến năm chữ. Mức sau đã đủ để một bản biên bản phải được đối chiếu từng câu mới dám đem ra dùng.

Dạng thức của loại lỗi này rất đặc biệt

Đáng lưu ý là lỗi do chuyển mã ngôn ngữ không "nhìn ra là sai" như lỗi nhận dạng thông thường. Hệ thống hiếm khi để trống hoặc xuất ra ký tự vô nghĩa; nó có xu hướng đoán một từ tiếng Trung có âm đọc gần giống và về ngữ pháp thì vẫn xuôi để điền vào.

Kết quả là một câu đọc lên hoàn toàn trôi chảy trên bề mặt nhưng ý nghĩa đã lệch đi. Điều này nguy hiểm hơn nhiều so với lỗi chính tả thấy rõ — lỗi chính tả rõ ràng khiến bạn dừng lại kiểm chứng, còn câu sai mà trôi chảy thì bạn sẽ đọc lướt qua luôn.


Đứt gãy thứ hai: khẩu ngữ Quảng Đông vs Trung văn viết

Hai cách viết cho cùng một câu

Lời nói ra thực tếĐầu ra thường gặpNghĩa tiếng Việt
佢哋幾時先搞得掂?他們什麼時候才能完成?Bao giờ họ mới làm xong được?
呢單嘢我唔係好清楚這件事我不太清楚Chuyện này tôi không rõ lắm
咁我哋而家點算?那我們現在怎麼辦?Vậy bây giờ chúng ta tính sao?
頭先個 client 講嘅嗰樣剛才那位客戶說的那件事Cái chuyện mà vị khách hàng vừa nói lúc nãy

Không câu nào ở cột giữa là "sai" cả. Ý nghĩa đều chính xác, đọc lên thậm chí còn mượt hơn. Vấn đề là — chẳng ai nói năng như vậy.

Vì sao hệ thống lại làm thế

Thông thường đây không phải lỗi kỹ thuật. Dữ liệu huấn luyện Trung văn viết áp đảo là Trung văn viết chuẩn, còn chữ viết khẩu ngữ Quảng Đông (嘅, 咗, 喺, 哋) chiếm tỷ lệ cực nhỏ trong toàn bộ ngữ liệu. Khi không có chỉ dẫn rõ ràng, mô hình sẽ tự nhiên nghiêng về việc xuất ra thứ tiếng Trung mà nó quen thuộc nhất.

Và trong phần lớn trường hợp, mặc định này là đúng. Làm tóm tắt cuộc họp, viết danh sách việc cần làm, gửi cho đồng nghiệp không biết tiếng Quảng Đông đọc — phiên bản văn viết rõ ràng phù hợp hơn.

Nhưng có những tình huống lại ngược hẳn lại

Vấn đề là có cả một nhóm tình huống mà thứ cần đến chính là nguyên văn.

  • Khám bệnh: Từ ngữ bệnh nhân dùng để mô tả triệu chứng bản thân nó đã là thông tin lâm sàng. Khi 頂住頂住 (cảm giác tức nghẹn, bị chèn lên), 唧住痛 (đau kiểu bị bóp siết), 作嘔作悶 (buồn nôn, nôn nao khó chịu) bị viết lại thành thuật ngữ chuẩn, cái sắc thái cụ thể đó biến mất.
  • Hồ sơ công tác xã hội: Nguyên văn lời của đối tượng phục vụ liên quan đến việc đánh giá hồ sơ; viết lại đồng nghĩa với việc thêm một lớp diễn giải ngay từ khâu ghi chép.
  • Hòa giải và xử lý tranh chấp: Ai đã nói gì, nói bằng giọng điệu nào, bản thân điều đó chính là chỗ tranh chấp.
  • Phỏng vấn nghiên cứu và lịch sử truyền miệng: Giá trị của bản gỡ băng nguyên văn nằm ở tiền đề nó phải nguyên văn.
  • Giảng dạy ngôn ngữ và xây dựng ngữ liệu: Hình thái khẩu ngữ chính là đối tượng nghiên cứu.

Điểm chung của những tình huống này là: biên bản không chỉ để người ta nhớ đã bàn những gì, mà còn có thể sẽ bị trích dẫn, bị rà soát lại, bị dùng làm căn cứ về sau. Một bản ghi đã bị âm thầm gọt giũa là rủi ro trong loại mục đích này — vì nó trông hoàn toàn bình thường, bạn sẽ không biết chỗ nào đã bị sửa.


Một tiền đề dễ bị bỏ qua: tình cảnh dữ liệu tiếng Quảng Đông

Để hiểu vì sao hiệu năng của các công cụ tiếng Quảng Đông không đồng đều, hãy nhìn vào quy mô dữ liệu khả dụng.

Ngữ liệuQuy môNăm
WenetSpeech-Yue21.800 giờ, 10 lĩnh vực, mở2025
Common Voice tiếng Quảng Đông (yue)210,91 giờ (đã kiểm chứng), 1.174 người nóiCập nhật liên tục
MDCC73,6 giờ2022
CantoMap12,8 giờ, 40 người nói2020
HKCanCorKhoảng 230.000 từ (ghi âm năm 1997–98)2015
Words.hk Từ điển Quảng Đông56.373 mục từCập nhật liên tục

Sự xuất hiện của WenetSpeech-Yue năm 2025 là một bước chuyển về bậc độ lớn — trước đó, dữ liệu giọng nói tiếng Quảng Đông công khai suốt thời gian dài chỉ dừng ở mức vài chục đến vài trăm giờ, trong khi các ngôn ngữ chính thống động một chút là tính bằng vạn giờ. Điều này giải thích vì sao các công cụ tiếng Quảng Đông trước đây nhìn chung tụt hậu.

Nhưng cần lưu ý, lượng dữ liệu tăng lên chủ yếu cải thiện khả năng nhận dạng tiếng Quảng Đông đơn ngữ. Chuyển mã ngôn ngữ cần ngữ liệu trộn, mà loại dữ liệu này khó gán nhãn hơn và quy mô vẫn còn mỏng. Vì vậy tốc độ cải thiện của đứt gãy thứ nhất sẽ chậm hơn rõ rệt so với tốc độ cải thiện nhận dạng tiếng Quảng Đông thuần túy.


Một lớp bối cảnh khác của Hồng Kông

Nhân tiện nhắc tới một nhóm số liệu liên quan. Theo điều tra dân số năm 2021, Hồng Kông có khoảng 619.568 cư dân không phải gốc Hoa, chiếm 8,4% dân số. Còn ở hạng mục có nói được tiếng Quảng Đông hay không: gốc Philippines 17,6%, gốc Ấn Độ 25,0%, toàn bộ nhóm Nam Á 34,7%; trong khi đó năng lực tiếng Anh nhìn chung đều trên 84%.

Nói cách khác, bối cảnh ngôn ngữ trong giao tiếp thường ngày ở Hồng Kông không phải là một khung cảnh "tiếng Quảng Đông" đơn nhất, mà là tiếng Quảng Đông, tiếng Anh cùng nhiều ngôn ngữ khác đồng thời hiện diện. Một công cụ chỉ làm tốt việc nhận dạng tiếng Quảng Đông nhưng không dịch được tức thời thì mới chỉ giải quyết được một nửa vấn đề.


Traverba xử lý hai đứt gãy này như thế nào

  • Ưu tiên trộn Quảng-Anh — điều chỉnh nhận dạng cho các câu trộn Trung-Anh kiểu Hồng Kông, thay vì coi tiếng Quảng Đông và tiếng Anh là hai chế độ phải chọn một.
  • Giữ nguyên hình thái khẩu ngữ — bản phiên âm bám theo đúng hình thái bạn nói ra, còn bản tóm tắt và bản dịch được tạo riêng; nguyên văn và bản đã chỉnh lý cùng tồn tại, chứ không lấy bản chỉnh lý đè lên nguyên văn.
  • Phiên âm tức thời + dịch tức thời trong một hệ thống — cùng một cuộc trò chuyện, một người nói, hơn 100 ngôn ngữ; người nghe quét mã QR là xem được phụ đề bằng ngôn ngữ của mình, không cần tải ứng dụng.
  • Ưu tiên xử lý ngay trên thiết bị — nhận dạng giọng nói mặc định chạy trên thiết bị, AI đám mây là tùy chọn; khi cần xử lý nội dung nhạy cảm, có thể hoàn toàn không gửi dữ liệu ra ngoài.
  • Xuất được bản gỡ băng nguyên văn đầy đủ — sau cuộc họp có thể xuất cả bản gỡ băng nguyên văn lẫn bản dịch, lưu tách riêng hai bản.

Nói cho rõ: nếu mục đích của bạn là tóm tắt cuộc họp kinh doanh thông thường, đồng bộ nội bộ hay sắp xếp danh sách việc cần làm, thì phần lớn công cụ ghi chú AI trên thị trường đã làm khá tốt, và đầu ra dạng văn viết còn phù hợp hơn; không cần đổi công cụ vì chuyện này. Những khác biệt nêu trên chỉ thực sự có ý nghĩa trong các tình huống mà "nguyên văn bản thân nó chính là dữ liệu".


Đánh giá thế nào? Một danh sách ngắn

Hãy tự hỏi ba câu:

Một, biên bản này về sau có bị trích dẫn hoặc rà soát lại không? Nếu có (hồ sơ ca, hồ sơ lâm sàng, hòa giải, phỏng vấn), bạn cần bản gỡ băng nguyên văn, và cần xác nhận công cụ không âm thầm viết lại phía sau. Nếu không, bản tóm tắt văn viết thực dụng hơn.

Hai, mật độ trộn Trung-Anh trong hội thoại cao đến mức nào? Thỉnh thoảng chen một hai từ tiếng Anh thì phần lớn công cụ đều xoay xở được. Nếu là kiểu hội thoại Hồng Kông điển hình chuyển đổi hai ba lần trong một câu, bạn cần thử nghiệm thực tế bằng một đoạn ghi âm thật trước đã, đừng chỉ nhìn danh sách ngôn ngữ chính thức.

Ba, nội dung có nhạy cảm không? Với các bản ghi âm liên quan đến bệnh án, hồ sơ ca hay việc pháp lý, hãy xác nhận dòng chảy dữ liệu trước — xử lý trên máy hay trên đám mây, lưu bao lâu, có được dùng để huấn luyện hay không.

Một lời khuyên cuối: dù chọn công cụ nào, hãy thử bằng một đoạn hội thoại thật của chính bạn, đừng dùng bản đọc theo kịch bản. Tiếng Quảng Đông đọc theo kịch bản không có chuyển mã ngôn ngữ, không có tiểu từ khẩu ngữ, không có chen lời chồng tiếng, nên không kiểm tra ra được bất kỳ vấn đề nào ở trên.


Tìm hiểu thêm

Trong chuyện biên bản tiếng Quảng Đông, không có công cụ nào phù hợp với mọi tình huống. Điều then chốt là làm rõ trước bạn cần "ý nghĩa" hay "nguyên văn" — quyết định này ảnh hưởng trực tiếp đến cách bạn chọn và cách bạn thiết lập.

Muốn tìm hiểu Traverba xử lý việc trộn Quảng-Anh và giữ nguyên khẩu ngữ ra sao, hãy truy cập traverba.com, hoặc tải dùng thử trên Google PlayApp Store.


Các con số về tỷ lệ lỗi được trích dẫn trong bài đến từ tài liệu nghiên cứu công khai về nhận dạng giọng nói tiếng Quảng Đông; số liệu quy mô ngữ liệu đến từ công bố chính thức của từng kho ngữ liệu; số liệu dân số và năng lực ngôn ngữ đến từ điều tra dân số năm 2021 của Chính quyền Hồng Kông. Các số liệu tính đến giữa năm 2026; năng lực mô hình và công cụ liên tục thay đổi, hiệu quả thực tế tùy thuộc vào chất lượng ghi âm, giọng nói, tiếng ồn môi trường và phiên bản cụ thể. Mọi thương hiệu và nhãn hiệu đều thuộc về chủ sở hữu tương ứng.