При первом использовании ИИ-инструмента для протоколирования встречи на кантонском реакция у всех примерно одинаковая: выглядит вполне пристойно, но ощущается «не совсем то». Явных ошибок в тексте нет, однако при сопоставлении с тем разговором, который вы помните, обнаруживается, что нечто утрачено.
Этот разрыв обычно вызван вовсе не тем, что приходит в голову первым, — не точностью распознавания. При чистом кантонском, одном говорящем и тихой обстановке современные массовые инструменты работают уже вполне приемлемо. Проблема лежит в двух других местах — и именно они соответствуют двум самым распространённым формам повседневной речи в Гонконге.
Во-первых, когда в одной фразе смешиваются кантонский и английский, качество распознавания заметно падает. Во-вторых, даже при верно расслышанной речи выходной текст зачастую уже переписан в нормативный письменный китайский и перестал быть той фразой, которую вы произнесли.
Причины этих двух явлений различны, затронутые сценарии тоже различны, поэтому их стоит разобрать по отдельности.
И это не только гонконгская история. Тот же механизм воспроизводится везде, где говорящие смешивают два языка внутри одной фразы, — сбой на переключении кодов носит общий характер и не привязан к конкретной языковой паре.
Выводы за 30 секунд
- Смешение языков имеет цену, и эта цена измерима → Открытая исследовательская литература показывает, что уровень посимвольных ошибок для контента с кантонско-английским переключением кодов составляет примерно 20–26%, тогда как те же системы на одноязычном материале дают около 6–8%. Разница в три-четыре раза.
- «Верно расслышать» и «верно записать» — две разные вещи → Вы произносите разговорную фразу, а в протоколе появляется нормативная формулировка: смысл сохранён, исходных слов больше нет.
- В большинстве сценариев это неважно, в некоторых — критично → Резюме непринуждённой беседы не страдает; медицинский приём, записи по социальным кейсам, протоколы медиации и исследовательские интервью — наоборот.
- В 2025 году объём кантонских данных изменился на порядок → От публичных корпусов в десятки часов до 21 800 часов в WenetSpeech-Yue, но переключение кодов остаётся нерешённой частью задачи.
- Прежде чем выбирать инструмент, определитесь: вам нужен «смысл» или «исходные слова» → Для этого требуются разные настройки; в конце статьи приведён контрольный список.
Сначала разграничим два процесса: распознавание и подача
При обсуждении качества кантонских протоколов очень легко смешать два самостоятельных этапа.
Распознавание (ASR) — преобразование звука в текст. Отказ на этом этапе означает «ослышку»: система не улавливает сказанное или принимает слово за другое, близкое по звучанию.
Подача определяет, в каком виде этот текст в конечном счёте предстанет. Отказ на этом этапе — «переписывание»: услышано абсолютно точно, но на выходе устная речь приглажена до письменной.
То, на что жалуется большинство пользователей как на «неточность кантонских протоколов», на деле представляет собой сбои каждого из двух уровней по отдельности, и устраняются они совершенно разными способами. Первый уровень — вопрос возможностей модели и обучающих данных; второй в большинстве случаев является проектным решением, причём зачастую намеренным.
Разлом первый: кантонско-английское смешение
Почему это особенно трудная задача
我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。
Смысл: «Хочу съездить в Козуэй-Бей провести встречу и заодно проверить расписание». Слова Causeway Bay, meeting, check и schedule произнесены по-английски, тогда как структура фразы и остальные слова (我想去, 開個, 順便, 一下) — кантонские. Именно это смешение и составляет суть проблемы.
В Гонконге подобная фраза совершенно обыденна, но от системы распознавания она требует принципиально иных возможностей, нежели чисто кантонское высказывание. Системе приходится мгновенно переключаться — внутри одной фразы, а то и на одном дыхании — между двумя совершенно разными фонологическими системами и словарями, причём точка переключения ничем заранее не обозначена.
Дополнительная сложность в том, что гонконгцы произносят английские слова уже кантонизированно: слоговая структура и тональный контур локализованы. Такое произношение не вполне соответствует ожиданиям английской модели и одновременно отсутствует в словаре кантонской. Обе стороны считают его чужим.
Разрыв в цифрах
Открытая исследовательская литература даёт довольно согласованную картину: уровень посимвольных ошибок для контента с кантонско-английским переключением кодов лежит примерно в диапазоне от 20% до 26%, тогда как те же системы на одноязычном материале дают около 6–8%. На специализированных наборах для оценки смешанной кантонско-английской речи смешанный уровень ошибок систем на базе Whisper составляет около 22%.
В переводе на практические ощущения: в чистом кантонском контенте ошибка приходится примерно на одно слово из десяти с лишним, а в смешанном — примерно на одно из четырёх-пяти. Второго уже достаточно, чтобы протокол требовал построчной сверки, прежде чем им можно будет пользоваться.
Форма этой ошибки весьма своеобразна
Стоит отметить, что ошибки переключения кодов, в отличие от обычных ошибок распознавания, не «выглядят как ошибки». Система редко оставляет пропуск или выдаёт бессмысленные символы; она склонна подставить китайское слово, близкое по звучанию и грамматически уместное.
В результате получается фраза, внешне совершенно гладкая, но со смещённым смыслом. Это куда опаснее явной опечатки: на явной ошибке вы остановитесь и проверите, а гладкую, но неверную фразу вы просто прочтёте дальше.
Разлом второй: разговорный кантонский и письменный китайский
Две записи одной и той же фразы
| Что произнесено в действительности (кантонский) | Типичный вывод (письменный китайский) | Смысл по-русски |
|---|---|---|
佢哋幾時先搞得掂? | 他們什麼時候才能完成? | Когда же они наконец с этим справятся? |
呢單嘢我唔係好清楚 | 這件事我不太清楚 | В этом вопросе я не очень разбираюсь. |
咁我哋而家點算? | 那我們現在怎麼辦? | И что нам теперь делать? |
頭先個 client 講嘅嗰樣 | 剛才那位客戶說的那件事 | То, о чём только что говорил клиент. |
Ни одна фраза в среднем столбце не является «неверной». Смысл передан точно, читается даже более гладко. Проблема в том, что так никто не говорит.
Почему системы так поступают
Обычно это не ошибка реализации. В обучающих данных письменного китайского подавляющее большинство составляет нормативный письменный язык, тогда как запись разговорного кантонского (嘅 咗 喺 哋) занимает в общем корпусе крайне малую долю. При отсутствии явных указаний модель естественным образом склоняется к той разновидности китайского, которая ей наиболее знакома.
И в большинстве случаев это значение по умолчанию правильно. Для резюме встречи, списка задач или отправки коллегам, не владеющим кантонским, письменный вариант очевидно удобнее.
Но есть сценарии прямо противоположные
Дело в том, что существует целый класс задач, где требуются именно исходные слова.
- Медицинский приём: слова, которыми пациент описывает симптомы, сами по себе являются клинической информацией. Выражения
頂住頂住(ощущение постоянного давления или заложенности),唧住痛(сдавливающая, будто выжимающая боль) и作嘔作悶(тошнота вместе с ощущением дурноты) при переписывании стандартной терминологией утрачивают эту конкретную чувственную фактуру. - Записи по социальным кейсам: подлинные слова подопечного напрямую связаны с оценкой случая; переписывание означает добавление слоя интерпретации уже на этапе фиксации.
- Медиация и разрешение споров: кто именно что сказал и каким тоном — это и есть предмет спора.
- Исследовательские интервью и устная история: ценность дословной расшифровки основана на её дословности.
- Преподавание языка и составление корпусов: сама устная форма и является предметом изучения.
Общее у этих сценариев то, что запись служит не только для того, чтобы помнить предмет обсуждения: впоследствии на неё могут ссылаться, её могут перепроверять и класть в основу решений. Незаметно «приглаженный» протокол в таком применении несёт риск — именно потому, что выглядит совершенно нормально, и вы не узнаете, где именно внесены изменения.
Легко упускаемая предпосылка: положение с кантонскими данными
Чтобы понять, почему качество кантонских инструментов столь неравномерно, полезно взглянуть на объём доступных данных.
| Корпус | Объём | Год |
|---|---|---|
| WenetSpeech-Yue | 21 800 часов, 10 предметных областей, открытый | 2025 |
| Common Voice кантонский (yue) | 210,91 часа (верифицировано), 1174 диктора | Обновляется постоянно |
| MDCC | 73,6 часа | 2022 |
| CantoMap | 12,8 часа, 40 дикторов | 2020 |
| HKCanCor | около 230 000 слов (записи 1997–98 гг.) | 2015 |
| Words.hk | 56 373 словарные статьи | Обновляется постоянно |
Появление WenetSpeech-Yue в 2025 году стало изменением на целый порядок: до этого открытые данные кантонской речи долгое время держались на уровне от десятков до сотен часов, тогда как для основных языков счёт идёт на десятки тысяч. Это и объясняет, почему кантонские инструменты прежде повсеместно отставали.
Однако следует учитывать, что рост объёма данных улучшает главным образом распознавание одноязычного кантонского. Переключению кодов нужны смешанные корпуса, а такие данные значительно труднее размечать, и по объёму они по-прежнему скудны. Поэтому темп улучшений по первому разлому будет заметно ниже темпа улучшений в распознавании чистого кантонского.
Ещё один гонконгский контекст
Приведём попутно связанный набор цифр. По данным переписи 2021 года, численность жителей Гонконга некитайского происхождения составляет около 619 568 человек, или 8,4% населения. Что касается владения кантонским: среди лиц филиппинского происхождения — 17,6%, индийского — 25,0%, среди всех выходцев из Южной Азии — 34,7%; при этом владение английским, как правило, превышает 84%.
Иными словами, языковая ситуация в повседневном общении в Гонконге — это не однородная кантонская среда, а одновременное присутствие кантонского, английского и целого ряда других языков. Инструмент, который хорошо распознаёт только кантонский, но не способен переводить в реальном времени, решает лишь половину задачи.
Как Traverba работает с этими двумя разломами
- Приоритет кантонско-английскому смешению — распознавание настроено под смешанные фразы гонконгского типа, а не рассматривает кантонский и английский как два режима, между которыми нужно выбирать.
- Сохранение устной формы — транскрипция следует той форме, которую вы действительно произнесли, а резюме и перевод формируются отдельно; исходные слова и обработанный вариант сосуществуют, а не замещают друг друга.
- Транскрипция и перевод в реальном времени как единое целое — один разговор, один говорящий, более 100 языков; слушателям достаточно отсканировать QR-код, чтобы видеть субтитры на своём языке, без установки приложения.
- Приоритет обработки на устройстве — распознавание речи по умолчанию выполняется на устройстве, облачный ИИ опционален; при работе с чувствительным содержимым ничто не покидает устройство.
- Экспорт полной дословной расшифровки — после сеанса можно выгрузить исходную дословную расшифровку и переведённую версию, храня их раздельно.
Скажем прямо: если вы используете инструмент для резюме обычных деловых встреч, внутренней синхронизации или составления списков задач, большинство представленных на рынке ИИ-заметочников уже справляются хорошо, а письменный вывод там даже удобнее, — менять инструмент ради этого нет необходимости. Описанные различия по-настоящему значимы там, где «исходные слова сами по себе являются данными».
Как определиться? Краткий контрольный список
Задайте себе три вопроса:
Первый: будет ли эта запись впоследствии цитироваться или перепроверяться? Если да (записи по кейсам, клинические записи, медиация, интервью), вам нужна дословная расшифровка, и нужно убедиться, что инструмент ничего не переписывает за кулисами. Если нет — резюме на письменном языке практичнее.
Второй: насколько плотно в разговоре смешиваются языки? С одним-двумя английскими словами время от времени справится большинство инструментов. Но если это типичный гонконгский разговор с двумя-тремя переключениями внутри фразы, сначала протестируйте на реальной записи, а не полагайтесь на официальный список языков.
Третий: чувствительно ли содержимое? Для записей, связанных с медицинскими картами, делами клиентов или юридическими вопросами, сперва выясните маршрут данных: обработка выполняется локально или в облаке, сколько данные хранятся и используются ли они для обучения.
Последний совет: какой бы инструмент вы ни выбрали, тестируйте его на фрагменте вашего собственного реального разговора, а не на зачитанном тексте. В зачитанном кантонском нет ни переключения кодов, ни разговорных частиц, ни наложения реплик — ни одна из перечисленных проблем на нём не проявится.
Узнать больше
В вопросе кантонских протоколов нет инструмента, подходящего для всех ситуаций. Ключевое — сперва определить, что вам нужно: «смысл» или «исходные слова». Именно это решение напрямую определяет, что выбирать и как настраивать.
Чтобы узнать, как Traverba работает с кантонско-английским смешением и сохранением устной формы, посетите traverba.com либо загрузите приложение для пробы в Google Play или App Store.
Приведённые в статье показатели ошибок взяты из открытой исследовательской литературы по распознаванию кантонской речи, данные об объёмах корпусов — из официальных публикаций соответствующих корпусов, а данные о населении и владении языками — из переписи населения правительства Гонконга 2021 года. Все данные актуальны на середину 2026 года; возможности моделей и инструментов постоянно меняются, а фактические результаты зависят от качества записи, акцента, фонового шума и конкретной версии. Все бренды и товарные знаки принадлежат их владельцам.