AI 도구로 광둥어 회의록을 처음 만들어 본 사람들의 반응은 대체로 비슷합니다. 겉보기에는 그럴듯한데 어딘가 «조금 이상하다»는 느낌이 듭니다. 글자만 놓고 보면 뚜렷한 오류가 없습니다. 그런데 기억 속의 대화와 대조해 보면 무언가가 빠져 있습니다.
이 간극은 대부분의 사람이 가장 먼저 떠올리는 «인식률»에서 오는 것이 아닙니다. 순수한 광둥어, 단일 화자, 조용한 환경이라면 오늘날 주요 도구의 성능은 이미 충분히 쓸 만합니다. 문제는 다른 두 곳에 있으며, 그 두 곳은 공교롭게도 홍콩 일상 대화에서 가장 흔한 두 가지 형태입니다.
첫째, 한 문장 안에서 중국어와 영어가 섞이면 인식 품질이 뚜렷하게 떨어집니다. 둘째, 정확히 알아들었더라도 출력된 문장은 이미 문어체 중국어로 고쳐 쓰인 경우가 많아, 그 자리에서 말한 그 문장이 아닙니다.
이 둘은 원인도 다르고 영향을 받는 상황도 다르므로 나누어 정리할 필요가 있습니다.
30초 요약
- 중국어·영어 혼용에는 대가가 있고, 그 대가는 수치화됩니다 → 공개된 연구 문헌에 따르면 광둥어·영어 코드스위칭 내용의 문자 오류율은 약 20%~26%이며, 같은 종류의 시스템이 단일 언어 내용을 처리할 때는 약 6%
8%입니다. 34배의 차이입니다. - «정확히 듣는 것»과 «정확히 쓰는 것»은 별개입니다 → 「幾時搞掂」(언제 끝나느냐)이라고 말해도 기록에는 「什麼時候完成」으로 적힙니다. 의미는 남지만 실제 발화는 사라집니다.
- 대부분의 상황에서는 문제가 되지 않지만, 일부 상황에서는 치명적입니다 → 잡담 요약은 영향을 받지 않습니다. 의료 문진, 사회복지 사례 기록, 조정 기록, 연구 인터뷰는 정반대입니다.
- 광둥어 데이터 규모는 2025년에 자릿수 단위의 변화를 맞았습니다 → 수십 시간 수준의 공개 말뭉치에서 WenetSpeech-Yue의 21,800시간으로. 다만 코드스위칭은 여전히 미해결 영역입니다.
- 도구를 고르기 전에 필요한 것이 «의미»인지 «실제 발화»인지 먼저 정하십시오 → 필요한 설정이 달라집니다. 글 끝에 판단용 점검표가 있습니다.
먼저 둘을 구분합니다 — 인식과 표현
광둥어 기록 품질을 논할 때 서로 독립된 두 단계가 자주 뒤섞입니다.
인식(ASR) 은 소리를 문자로 바꾸는 단계입니다. 여기서의 실패는 «잘못 들음»이며, 무엇을 말했는지 판별하지 못하거나 음이 비슷한 단어를 다른 글자로 인식하는 것입니다.
표현 은 그 문자가 최종적으로 어떤 형태로 나타날지 결정하는 단계입니다. 여기서의 실패는 «고쳐 씀»이며, 매우 정확히 들었는데도 출력할 때 구어를 문어체로 다듬어 버리는 것입니다.
«광둥어 기록이 부정확하다»는 불만의 대부분은 사실 이 두 층이 각각 별개로 실패한 것이며, 완전히 다른 방법으로 대응해야 합니다. 첫 번째 층은 모델 성능과 학습 데이터의 문제이고, 두 번째 층은 대개 설계상의 선택—그것도 흔히 의도적인 선택—의 문제입니다.
단층 하나: 광둥어와 영어의 혼용
이것이 특히 어려운 이유
「我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。」 (뜻: «코즈웨이베이에 가서 회의를 하고, 겸사겸사 일정을 확인하고 싶다.» 광둥어 문장 중간에 영어 단어가 그대로 끼어 있습니다.)
이 문장은 홍콩에서 전혀 특별하지 않지만, 인식 시스템에 요구되는 능력은 순수 광둥어 문장과 완전히 다릅니다. 시스템은 같은 문장, 때로는 한 호흡 안에서 완전히 다른 두 음운 체계와 어휘를 즉시 전환해야 하며, 전환 지점은 미리 알려지지 않습니다.
더 까다로운 점은 홍콩 사람이 영어 단어를 발음할 때 그 발음이 이미 광둥어화되어 있다는 것입니다. 음절 구조와 성조 윤곽이 모두 현지화되어 있습니다. 이런 발음은 영어 모델의 예상에도 맞지 않고 광둥어 모델의 어휘 목록에도 없습니다. 양쪽 모두 자기 것이 아니라고 여깁니다.
숫자로 본 격차
공개된 연구 문헌은 상당히 일관된 그림을 보여줍니다. 광둥어·영어 코드스위칭 내용의 문자 오류율은 대략 20%에서 26% 구간에 놓이고, 같은 종류의 시스템이 단일 언어 내용을 처리할 때는 약 6%에서 8%입니다. 광둥어·영어 혼용 음성 전용 평가 세트에서 Whisper 기반 시스템의 혼합 오류율은 약 22%였습니다.
체감으로 환산하면 순수 광둥어 내용은 열몇 글자에 하나꼴로 오류가 나고, 중국어·영어 혼용 내용은 네다섯 글자에 하나꼴로 오류가 납니다. 후자는 기록을 쓰기 전에 문장 단위로 대조해야 하는 수준입니다.
이 오류는 형태가 독특합니다
주목할 점은, 코드스위칭 오류가 일반적인 인식 오류처럼 «봐도 틀린 게 보이는» 형태가 아니라는 것입니다. 시스템이 빈칸을 남기거나 깨진 문자를 내놓는 일은 드물고, 음이 비슷하면서 문법적으로도 말이 되는 중국어 단어를 추측해 채워 넣는 경향이 있습니다.
그 결과 표면적으로는 완전히 매끄럽게 읽히지만 의미는 이미 어긋난 문장이 만들어집니다. 이는 눈에 띄는 오탈자보다 훨씬 위험합니다. 눈에 띄는 오탈자는 멈춰서 확인하게 되지만, 매끄럽게 읽히는 잘못된 문장은 그냥 지나쳐 읽게 되기 때문입니다.
단층 둘: 구어 광둥어 vs 문어체 중국어
같은 말의 두 가지 표기
| 실제로 말한 내용(구어 광둥어) | 일반적인 출력(표준 문어체 중국어) | 한국어 뜻 |
|---|---|---|
| 佢哋幾時先搞得掂? | 他們什麼時候才能完成? | 저쪽은 대체 언제쯤 이걸 끝낼 건가? |
| 呢單嘢我唔係好清楚 | 這件事我不太清楚 | 이 건은 저도 잘 모르겠습니다. |
| 咁我哋而家點算? | 那我們現在怎麼辦? | 그럼 우리는 지금 어떻게 하죠? |
| 頭先個 client 講嘅嗰樣 | 剛才那位客戶說的那件事 | 아까 그 고객이 말한 그 건. |
가운데 열에 «틀린» 문장은 하나도 없습니다. 의미는 정확하고 읽기에는 오히려 더 매끄럽습니다. 문제는—아무도 그렇게 말하지 않는다는 것입니다.
시스템이 이렇게 하는 이유
이는 대개 버그가 아닙니다. 중국어 문어의 학습 데이터는 표준 문어체가 압도적 다수를 차지하고, 구어 광둥어 표기(「嘅」「咗」「喺」「哋」)가 전체 말뭉치에서 차지하는 비중은 극히 작습니다. 명시적인 지시가 없으면 모델은 자연히 자신이 가장 익숙한 중국어를 출력하는 쪽으로 기웁니다.
게다가 대부분의 경우 이 기본 동작은 옳습니다. 회의 요약을 만들고, 할 일을 적고, 광둥어를 모르는 동료에게 보내는 용도라면 문어체 버전이 분명히 더 쓸모 있습니다.
그러나 정반대인 상황도 있습니다
문제는 바로 실제 발화 그 자체를 필요로 하는 부류의 상황이 존재한다는 점입니다.
- 의료 문진: 환자가 증상을 묘사하는 표현 자체가 임상 정보입니다. 「頂住頂住」(무언가 눌리고 막힌 듯한 느낌), 「唧住痛」(쥐어짜는 듯한 통증), 「作嘔作悶」(메스껍고 울렁거림)이 표준 용어로 바뀌는 순간 그 구체적인 질감은 사라집니다.
- 사회복지 사례 기록: 서비스 이용자의 실제 발화는 사례 평가와 직결됩니다. 고쳐 쓰는 것은 기록 단계에서 해석을 한 겹 더하는 셈입니다.
- 조정 및 분쟁 처리: 누가 무엇을, 어떤 어조로 말했는지가 그 자체로 쟁점입니다.
- 연구 인터뷰와 구술사: 축어록의 가치는 축어라는 전제 위에 있습니다.
- 언어 교육과 말뭉치 구축: 구어 형태 자체가 연구 대상입니다.
이들의 공통점은 기록이 단지 무엇을 논의했는지 기억하기 위한 것이 아니라, 훗날 인용되고 검토되며 근거로 쓰일 수 있다는 점입니다. 조용히 다듬어진 기록은 이런 용도에서 위험합니다. 완전히 정상으로 보이기 때문에 어디가 바뀌었는지 알 수 없기 때문입니다.
놓치기 쉬운 전제: 광둥어 데이터의 형편
광둥어 도구의 성능이 들쭉날쭉한 이유를 이해하려면 사용 가능한 데이터의 규모를 보는 것이 도움이 됩니다.
| 말뭉치 | 규모 | 연도 |
|---|---|---|
| WenetSpeech-Yue | 21,800시간, 10개 영역, 공개 | 2025 |
| Common Voice 광둥어 (yue) | 210.91시간(검증 완료), 화자 1,174명 | 지속 갱신 |
| MDCC | 73.6시간 | 2022 |
| CantoMap | 12.8시간, 화자 40명 | 2020 |
| HKCanCor | 약 230,000단어(1997~98년 녹음) | 2015 |
| Words.hk 粵典 | 표제어 56,373개 | 지속 갱신 |
2025년 WenetSpeech-Yue의 등장은 자릿수 단위의 전환이었습니다. 그 이전까지 공개된 광둥어 음성 데이터는 오랫동안 수십에서 수백 시간 수준에 머물렀고, 주요 언어는 흔히 만 시간 단위로 셈했습니다. 그동안 광둥어 도구가 전반적으로 뒤처졌던 이유가 여기에 있습니다.
다만 유의할 점은, 데이터 증가가 주로 개선하는 것이 단일 언어로서의 광둥어 인식이라는 것입니다. 코드스위칭에 필요한 것은 혼용 말뭉치이며, 이런 데이터는 주석 작업이 더 어렵고 규모도 여전히 빈약합니다. 따라서 첫 번째 단층의 개선 속도는 순수 광둥어 인식의 개선 속도보다 확연히 느릴 것입니다.
홍콩이라는 또 하나의 맥락
관련된 수치를 하나 덧붙입니다. «광둥어 도구»가 실제로 무엇을 감당해야 하는지를 좌우하기 때문입니다. 2021년 인구조사에 따르면 홍콩의 비화인 주민은 약 619,568명으로 인구의 8.4%를 차지합니다. 광둥어 구사 가능 여부 항목에서는 필리핀계 17.6%, 인도계 25.0%, 남아시아계 전체 34.7%인 반면, 영어 능력은 대체로 84% 이상입니다.
다시 말해 홍콩의 일상적 의사소통 언어 환경은 «광둥어»라는 단일 상황이 아니라, 광둥어와 영어, 그리고 여러 다른 언어가 동시에 존재하는 자리입니다. 광둥어 인식만 잘하고 실시간 번역은 못 하는 도구는 문제의 절반만 해결한 것입니다. 이는 다언어 도시라면 어디서나 마찬가지입니다.
Traverba가 이 두 단층을 다루는 방식
- 광둥어·영어 혼용 우선 — 광둥어와 영어를 둘 중 하나를 골라야 하는 모드로 취급하지 않고, 홍콩식 중국어·영어 혼용 문장에 맞춰 인식을 조정했습니다.
- 구어 형태 보존 — 전사는 실제로 말한 형태를 기준으로 하고, 요약과 번역은 별도로 생성합니다. 실제 발화와 정리본이 함께 남으며, 정리본이 실제 발화를 덮어쓰지 않습니다.
- 실시간 전사와 실시간 번역의 일체화 — 같은 대화에서 화자 한 명, 100개 이상의 언어. 청중은 QR 코드를 스캔하기만 하면 자기 언어의 자막을 볼 수 있고 앱을 내려받을 필요가 없습니다.
- 기기 로컬 우선 — 음성 인식은 기본적으로 기기에서 실행되고 클라우드 AI는 선택 사항입니다. 민감한 내용을 다룰 때는 외부로 전혀 보내지 않을 수 있습니다.
- 완전한 축어록 내보내기 — 회의 후 실제 발화 축어록과 번역본을 내보낼 수 있으며 둘은 따로 보관됩니다.
분명히 해 둡니다. 용도가 일반적인 비즈니스 회의 요약, 내부 공유, 할 일 정리라면 시중의 AI 노트 도구 대부분은 이미 충분히 잘 만들어져 있고 문어체 출력이 오히려 더 쓸모 있으므로, 이 때문에 도구를 바꿀 필요는 없습니다. 위에서 말한 차이가 실제로 의미를 갖는 곳은 «실제 발화 자체가 데이터»인 상황입니다.
어떻게 판단할까: 짧은 점검표
스스로에게 세 가지를 물어보십시오.
하나, 이 기록이 나중에 인용되거나 검토될 것인가? 그렇다면(사례 기록, 임상 기록, 조정, 인터뷰) 축어록이 필요하며, 도구가 뒤에서 고쳐 쓰지 않는지 확인해야 합니다. 그렇지 않다면 문어체 요약이 더 실용적입니다.
둘, 대화에서 중국어·영어 혼용의 밀도는 얼마나 높은가? 가끔 영어 단어가 한두 개 섞이는 정도라면 대부분의 도구가 감당합니다. 한 문장 안에서 두세 번 전환되는 전형적인 홍콩식 대화라면 먼저 실제 녹음으로 시험해 보십시오. 공식 지원 언어 목록만 보고 판단하지 마십시오.
셋, 내용이 민감한가? 진료 기록, 사례, 법률 사안과 관련된 녹음은 먼저 데이터의 흐름을 확인하십시오. 처리가 기기에서 이루어지는지 클라우드인지, 보관 기간은 얼마인지, 학습에 사용되는지 여부입니다.
마지막으로 한 가지 조언을 드립니다. 어떤 도구를 고르든 자신의 실제 대화로 시험하십시오. 낭독 원고로는 안 됩니다. 낭독한 광둥어에는 코드스위칭도, 구어 어조사도, 끼어들며 겹치는 발화도 없어서 위에서 말한 어떤 문제도 드러나지 않습니다.
더 알아보기
광둥어 기록에서 모든 상황에 맞는 단 하나의 도구는 없습니다. 핵심은 필요한 것이 «의미»인지 «실제 발화»인지를 먼저 분명히 하는 것입니다. 이 판단이 무엇을 고르고 어떻게 설정해야 하는지를 직접 좌우합니다.
Traverba가 광둥어·영어 혼용과 구어 보존을 어떻게 처리하는지는 traverba.com에서 확인하실 수 있으며, Google Play와 App Store에서 내려받아 사용해 보실 수 있습니다.
본 글이 인용한 오류율 수치는 공개된 광둥어 음성 인식 연구 문헌에서, 말뭉치 규모 데이터는 각 말뭉치의 공식 발표 자료에서, 인구 및 언어 능력 데이터는 홍콩 정부 2021년 인구조사에서 가져왔습니다. 각 데이터는 2026년 중반 기준입니다. 모델과 도구의 성능은 지속적으로 변하며, 실제 성능은 녹음 품질, 억양, 환경 소음 및 구체적인 버전에 따라 달라집니다. 모든 브랜드와 상표는 각 소유자에게 귀속됩니다.