Dlaczego notatki z kantońskich spotkań zawsze są „nie do końca takie”: dwie linie pęknięcia

Osoby, które po raz pierwszy używają narzędzia AI do sporządzenia notatek z kantońskojęzycznego spotkania, reagują zwykle podobnie: wynik wygląda porządnie, ale sprawia wrażenie „nie do końca takiego”. Nie ma w nim rażących błędów, a jednak przy zestawieniu z pamięcią rozmowy czegoś brakuje.

Ta różnica zwykle nie bierze się stamtąd, gdzie odruchowo jej szukamy — z dokładności rozpoznawania. Przy czystym kantońskim, jednym mówcy i cichym otoczeniu dzisiejsze popularne narzędzia radzą sobie już całkiem dobrze. Problem leży w dwóch innych miejscach — i są to dokładnie te dwie formy, które dominują w codziennych rozmowach w Hongkongu.

Po pierwsze: gdy w jednym zdaniu miesza się chiński z angielskim, jakość rozpoznawania wyraźnie spada. Po drugie: nawet przy poprawnym rozpoznaniu tekst wyjściowy bywa już przepisany na chiński pisany — to nie jest już zdanie, które Pan lub Pani wypowiedzieli.

Obie kwestie mają różne przyczyny i dotyczą różnych sytuacji. Warto omówić je osobno.

Nie dotyczą one zresztą wyłącznie Hongkongu: ten sam schemat powtarza się wszędzie tam, gdzie w codziennej mowie dwa języki funkcjonują w obrębie jednego zdania — polski z angielską terminologią branżową, hindi z angielskim, hiszpański z angielskim. Para kantoński–angielski jest szczególnie dobrze udokumentowana, ale mechanizm błędu pozostaje ten sam.


Wnioski w 30 sekund

  • Mieszanie języków ma swoją cenę i da się ją zmierzyć → publikowana literatura badawcza wskazuje dla treści z przełączaniem kodów kantoński–angielski wskaźnik błędu na poziomie znaków rzędu 20 %–26 %, podczas gdy te same systemy przy treściach jednojęzycznych osiągają około 6 %–8 %. To różnica trzy- do czterokrotna.
  • „Dobrze usłyszeć” i „dobrze zapisać” to dwie różne rzeczy → wypowiadają Państwo zdanie w języku mówionym, a w notatce pojawia się wariant pisany: sens zostaje, oryginalne słowa znikają.
  • W większości sytuacji nie ma to znaczenia, w nielicznych jest kluczowe → przy streszczaniu swobodnej rozmowy nie robi to różnicy; przy wywiadzie lekarskim, dokumentacji pomocy społecznej, protokołach mediacji i wywiadach badawczych — owszem.
  • W 2025 roku zasoby danych kantońskich zmieniły się o rząd wielkości → z publicznych korpusów rzędu kilkudziesięciu godzin do 21 800 godzin WenetSpeech-Yue, ale przełączanie kodów pozostaje nierozwiązane.
  • Zanim wybiorą Państwo narzędzie, proszę ustalić, czy potrzebny jest „sens”, czy „dosłowne słowa” → wymagają odmiennych ustawień; na końcu artykułu znajduje się krótka lista kontrolna.

Najpierw rozdzielmy dwie rzeczy: rozpoznawanie a prezentacja

W dyskusji o jakości kantońskich notatek łatwo pomieszać dwa niezależne etapy.

Rozpoznawanie (ASR) zamienia dźwięk w tekst. Porażka na tym poziomie to „przesłyszenie” — system nie wychwytuje tego, co zostało powiedziane, albo myli wyraz z podobnie brzmiącym.

Prezentacja decyduje o tym, w jakiej postaci ten tekst ostatecznie się pojawi. Porażka na tym poziomie to „przepisanie” — rozpoznanie było trafne, ale na wyjściu mowa potoczna została wygładzona do języka pisanego.

To, co większość osób zgłasza jako „niedokładne notatki po kantońsku”, w rzeczywistości oznacza problemy na obu poziomach, wymagające zupełnie różnych rozwiązań. Pierwszy poziom to kwestia możliwości modelu i danych treningowych, drugi zaś najczęściej kwestia decyzji projektowej — i to często świadomej.


Linia pęknięcia pierwsza: mieszanie kantońskiego z angielskim

Dlaczego jest to szczególnie trudne

「我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。」

Z grubsza: „Chcę pojechać do Causeway Bay na spotkanie i przy okazji sprawdzić harmonogram”. Po kantońsku są tu 我想去 (chcę pojechać do), 開個 (odbyć), 順便 (przy okazji), 一下 (na chwilę) oraz cała konstrukcja zdania; po angielsku — Causeway Bay, meeting, check i schedule. To właśnie owo wymieszanie w obrębie jednego zdania jest sednem sprawy.

W Hongkongu takie zdanie jest zupełnie zwyczajne, ale od systemu rozpoznawania wymaga czegoś zupełnie innego niż zdanie w czystym kantońskim. System musi w obrębie tego samego zdania, a nawet jednego oddechu, przełączać się w czasie rzeczywistym między dwoma całkowicie odmiennymi systemami fonologicznymi i dwoma zasobami leksykalnymi — a moment przełączenia nie jest w żaden sposób zapowiedziany.

Sprawę pogarsza to, że gdy mieszkańcy Hongkongu używają angielskich słów, wymowa bywa już skantonizowana — struktura sylabiczna i przebieg tonalny zostają zlokalizowane. Takie realizacje nie odpowiadają oczekiwaniom modelu angielskiego ani nie występują w słowniku modelu kantońskiego. Obie strony uznają je za obce.

Różnica w liczbach

Publikowana literatura badawcza daje dość spójny obraz: wskaźnik błędu na poziomie znaków dla treści z przełączaniem kodów kantoński–angielski mieści się mniej więcej w przedziale od 20 % do 26 %, podczas gdy te same systemy przy treściach jednojęzycznych osiągają około 6 %–8 %. Na wyspecjalizowanych zbiorach testowych dla mowy mieszanej kantońsko-angielskiej systemy oparte na Whisperze notują mixed error rate rzędu 22 %.

W przełożeniu na odczucie: przy czystym kantońskim błędny jest mniej więcej jeden znak na kilkanaście, przy treściach mieszanych — jeden na cztery, pięć. To drugie oznacza już konieczność sprawdzania notatki zdanie po zdaniu, zanim da się jej zaufać.

Te błędy mają szczególną postać

Warto zauważyć, że błędy wynikające z przełączania kodów nie są „widocznie błędne” jak zwykłe pomyłki rozpoznawania. System rzadko zostawia puste miejsce albo produkuje zbitki znaków — raczej wstawia chiński wyraz o zbliżonym brzmieniu, gramatycznie prawdopodobny.

W rezultacie powstaje zdanie na pozór całkowicie płynne, którego sens jednak już się przesunął. Jest to znacznie groźniejsze niż oczywista literówka — przy oczywistym błędzie zatrzymują się Państwo i sprawdzają, a po płynnym, lecz błędnym zdaniu prześlizgują się wzrokiem.


Linia pęknięcia druga: kantoński mówiony a chiński pisany

Dwa zapisy tego samego zdania

Faktycznie wypowiedziane (kantoński, dosłownie)Typowy zapis (chiński pisany)Znaczenie po polsku
佢哋幾時先搞得掂?他們什麼時候才能完成?Kiedy oni to wreszcie ogarną?
呢單嘢我唔係好清楚這件事我不太清楚W tej sprawie nie jestem zbyt zorientowany.
咁我哋而家點算?那我們現在怎麼辦?I co my teraz zrobimy?
頭先個 client 講嘅嗰樣剛才那位客戶說的那件事To, co przed chwilą powiedział klient.

Żaden wiersz w środkowej kolumnie nie jest „błędny”. Znaczenie za każdym razem się zgadza, tekst czyta się nawet gładziej. Problem w tym, że nikt tak nie mówi.

Dlaczego systemy tak postępują

Zwykle nie jest to usterka. Dane treningowe chińszczyzny pisanej to w przytłaczającej większości standardowy chiński pisany; zapis mówionego kantońskiego (znaki takie jak 嘅, 咗, 喺, 哋) stanowi w całym korpusie znikomy ułamek. Bez wyraźnej instrukcji model w naturalny sposób ciąży ku tej odmianie chińskiego, którą zna najlepiej.

W większości przypadków to ustawienie domyślne jest zresztą właściwe. Do streszczeń spotkań, list zadań czy tekstów przekazywanych współpracownikom nieznającym kantońskiego wersja w języku pisanym jest wyraźnie użyteczniejsza.

Ale w pewnych sytuacjach jest dokładnie odwrotnie

Istnieje cała kategoria zastosowań, w których potrzebne są właśnie oryginalne słowa.

  • Wywiad lekarski: słowa, którymi pacjent opisuje objawy, same w sobie są informacją kliniczną. Wyrażenia takie jak 「頂住頂住」 (uporczywe uczucie ucisku), 「唧住痛」 (ból ściskający, jakby zaciskało), 「作嘔作悶」 (mdłości połączone z uczuciem osłabienia) po przełożeniu na standardowe terminy tracą dokładnie tę konkretną jakość.
  • Dokumentacja pomocy społecznej: własne słowa podopiecznego mają znaczenie dla oceny sprawy; przepisanie dodaje warstwę interpretacji już na etapie rejestrowania.
  • Mediacja i rozstrzyganie sporów: kto co powiedział i jakim tonem, jest samo w sobie przedmiotem sporu.
  • Wywiady badawcze i historia mówiona: wartość transkrypcji dosłownej zakłada, że jest ona dosłowna.
  • Dydaktyka języka i prace korpusowe: tutaj forma mówiona sama jest przedmiotem badania.

Wspólną cechą tych sytuacji jest to, że zapis nie służy jedynie zapamiętaniu, o czym była mowa — może być później cytowany, weryfikowany lub traktowany jako podstawa. Po cichu wygładzona notatka jest w takim zastosowaniu ryzykowna, ponieważ wygląda całkowicie normalnie i nie dowiedzą się Państwo, w którym miejscu coś zmieniono.


Łatwo pomijana przesłanka: sytuacja danych kantońskich

Aby zrozumieć, dlaczego narzędzia do kantońskiego wypadają tak nierówno, warto spojrzeć na skalę dostępnych danych.

KorpusWielkośćRok
WenetSpeech-Yue21 800 godzin, 10 domen, otwarty2025
Common Voice kantoński (yue)210,91 godziny (zweryfikowane), 1174 mówcówaktualizowany na bieżąco
MDCC73,6 godziny2022
CantoMap12,8 godziny, 40 mówców2020
HKCanCorokoło 230 000 słów (nagrania z lat 1997–98)2015
Words.hk56 373 hasłaaktualizowany na bieżąco

Pojawienie się WenetSpeech-Yue w 2025 roku to zmiana o rząd wielkości — wcześniej publiczne kantońskie dane mowy przez długi czas utrzymywały się na poziomie od kilkudziesięciu do kilkuset godzin, podczas gdy w przypadku języków głównych operuje się swobodnie dziesiątkami tysięcy godzin. To wyjaśnia, dlaczego narzędzia do kantońskiego były dotąd powszechnie w tyle.

Trzeba jednak zaznaczyć, że przyrost danych poprawia przede wszystkim rozpoznawanie jednojęzycznego kantońskiego. Przełączanie kodów wymaga korpusów mieszanych, a te są trudniejsze w anotacji i wciąż skromne objętościowo. Pierwsza linia pęknięcia będzie się więc poprawiać wyraźnie wolniej niż rozpoznawanie czystego kantońskiego.


Jeszcze jeden hongkoński kontekst

Na marginesie zestaw powiązanych liczb. Według spisu powszechnego z 2021 roku w Hongkongu mieszka około 619 568 osób niebędących etnicznymi Chińczykami, co stanowi 8,4 % ludności. Jeśli chodzi o umiejętność mówienia po kantońsku: 17,6 % wśród osób pochodzenia filipińskiego, 25,0 % wśród osób pochodzenia indyjskiego, 34,7 % wśród ogółu osób pochodzenia południowoazjatyckiego — natomiast znajomość angielskiego przekracza zwykle 84 %.

Innymi słowy, codzienna sytuacja językowa Hongkongu to nie scenariusz wyłącznie kantoński, lecz jednoczesna obecność kantońskiego, angielskiego i wielu innych języków. Narzędzie, które dobrze rozpoznaje kantoński, ale nie potrafi tłumaczyć w czasie rzeczywistym, rozwiązuje jedynie połowę problemu.


Jak Traverba radzi sobie z obiema liniami pęknięcia

  • Priorytet dla mieszania języków — rozpoznawanie jest dostrojone do hongkońskich zdań mieszających chiński z angielskim, zamiast traktować kantoński i angielski jako dwa wykluczające się tryby.
  • Zachowanie formy mówionej — transkrypcja odwzorowuje formę, w jakiej rzeczywiście padły słowa; streszczenie i tłumaczenie powstają osobno. Oryginalna wypowiedź i wersja opracowana współistnieją, zamiast tego, by opracowanie nadpisywało oryginał.
  • Transkrypcja i tłumaczenie w czasie rzeczywistym w jednym — jedna rozmowa, jeden mówca, ponad 100 języków: słuchacze skanują kod QR i widzą napisy we własnym języku, bez pobierania aplikacji.
  • Najpierw urządzenie — rozpoznawanie mowy działa domyślnie na urządzeniu, sztuczna inteligencja w chmurze jest opcjonalna; przy treściach wrażliwych nic nie musi opuszczać urządzenia.
  • Pełna transkrypcja do eksportu — po spotkaniu można wyeksportować dosłowną transkrypcję oraz wersję przetłumaczoną i przechowywać je osobno.

Dla jasności: jeśli chodzi o streszczenia zwykłych spotkań biznesowych, wewnętrzne uzgodnienia czy listy zadań, większość dostępnych narzędzi do notatek AI radzi sobie już dobrze, a wynik w języku pisanym jest wręcz wygodniejszy — nie ma powodu zmieniać narzędzia. Opisane różnice mają realne znaczenie tam, gdzie oryginalne słowa same są informacją.


Jak zdecydować? Krótka lista kontrolna

Proszę zadać sobie trzy pytania:

Po pierwsze: czy ta notatka będzie później cytowana lub weryfikowana? Jeśli tak (dokumentacja spraw, zapisy kliniczne, mediacja, wywiady), potrzebna jest transkrypcja dosłowna oraz pewność, że narzędzie niczego nie przepisuje w tle. Jeśli nie, streszczenie w języku pisanym będzie praktyczniejsze.

Po drugie: jak gęste jest mieszanie języków w rozmowie? Pojedyncze angielskie słowo obsłuży większość narzędzi. Jeśli chodzi o typowe hongkońskie rozmowy z dwoma czy trzema przełączeniami w jednym zdaniu, proszę najpierw przetestować narzędzie na prawdziwym nagraniu, a nie polegać na oficjalnych listach obsługiwanych języków.

Po trzecie: czy treść jest wrażliwa? Przy nagraniach dotyczących dokumentacji medycznej, spraw socjalnych lub kwestii prawnych proszę najpierw ustalić przepływ danych: przetwarzanie lokalne czy w chmurze, okres przechowywania, ewentualne wykorzystanie do trenowania modeli.

Na koniec jedna rada: niezależnie od wybranego narzędzia proszę przetestować je na własnej, prawdziwej rozmowie, a nie na czytanym tekście. Czytany kantoński nie zawiera przełączania kodów, partykuł mowy potocznej ani nakładających się wypowiedzi — nie ujawni więc żadnego z opisanych problemów.


Dowiedz się więcej

W kwestii kantońskich zapisów nie ma narzędzia odpowiedniego do każdej sytuacji. Kluczowe jest, aby najpierw ustalić, czy potrzebny jest „sens”, czy „dosłowne słowa” — ta decyzja bezpośrednio przesądza o wyborze i konfiguracji.

Aby dowiedzieć się, jak Traverba radzi sobie z mieszaniem języków i zachowaniem formy mówionej, zapraszamy na traverba.com lub do pobrania aplikacji z Google Play oraz App Store.


Przytoczone w artykule wskaźniki błędów pochodzą z publicznie dostępnej literatury badawczej dotyczącej rozpoznawania mowy kantońskiej, dane o wielkości korpusów — z oficjalnych informacji publikowanych przez poszczególne korpusy, a dane o ludności i kompetencjach językowych — ze spisu powszechnego rządu Hongkongu z 2021 roku. Wszystkie dane według stanu na połowę 2026 roku; modele i narzędzia stale się zmieniają, a rzeczywista skuteczność zależy od jakości nagrania, akcentu, hałasu otoczenia oraz konkretnej wersji. Wszystkie marki i znaki towarowe należą do ich właścicieli.