Osoby, które po raz pierwszy używają narzędzia AI do sporządzenia notatek z kantońskojęzycznego spotkania, reagują zwykle podobnie: wynik wygląda porządnie, ale sprawia wrażenie „nie do końca takiego”. Nie ma w nim rażących błędów, a jednak przy zestawieniu z pamięcią rozmowy czegoś brakuje.
Ta różnica zwykle nie bierze się stamtąd, gdzie odruchowo jej szukamy — z dokładności rozpoznawania. Przy czystym kantońskim, jednym mówcy i cichym otoczeniu dzisiejsze popularne narzędzia radzą sobie już całkiem dobrze. Problem leży w dwóch innych miejscach — i są to dokładnie te dwie formy, które dominują w codziennych rozmowach w Hongkongu.
Po pierwsze: gdy w jednym zdaniu miesza się chiński z angielskim, jakość rozpoznawania wyraźnie spada. Po drugie: nawet przy poprawnym rozpoznaniu tekst wyjściowy bywa już przepisany na chiński pisany — to nie jest już zdanie, które Pan lub Pani wypowiedzieli.
Obie kwestie mają różne przyczyny i dotyczą różnych sytuacji. Warto omówić je osobno.
Nie dotyczą one zresztą wyłącznie Hongkongu: ten sam schemat powtarza się wszędzie tam, gdzie w codziennej mowie dwa języki funkcjonują w obrębie jednego zdania — polski z angielską terminologią branżową, hindi z angielskim, hiszpański z angielskim. Para kantoński–angielski jest szczególnie dobrze udokumentowana, ale mechanizm błędu pozostaje ten sam.
Wnioski w 30 sekund
- Mieszanie języków ma swoją cenę i da się ją zmierzyć → publikowana literatura badawcza wskazuje dla treści z przełączaniem kodów kantoński–angielski wskaźnik błędu na poziomie znaków rzędu 20 %–26 %, podczas gdy te same systemy przy treściach jednojęzycznych osiągają około 6 %–8 %. To różnica trzy- do czterokrotna.
- „Dobrze usłyszeć” i „dobrze zapisać” to dwie różne rzeczy → wypowiadają Państwo zdanie w języku mówionym, a w notatce pojawia się wariant pisany: sens zostaje, oryginalne słowa znikają.
- W większości sytuacji nie ma to znaczenia, w nielicznych jest kluczowe → przy streszczaniu swobodnej rozmowy nie robi to różnicy; przy wywiadzie lekarskim, dokumentacji pomocy społecznej, protokołach mediacji i wywiadach badawczych — owszem.
- W 2025 roku zasoby danych kantońskich zmieniły się o rząd wielkości → z publicznych korpusów rzędu kilkudziesięciu godzin do 21 800 godzin WenetSpeech-Yue, ale przełączanie kodów pozostaje nierozwiązane.
- Zanim wybiorą Państwo narzędzie, proszę ustalić, czy potrzebny jest „sens”, czy „dosłowne słowa” → wymagają odmiennych ustawień; na końcu artykułu znajduje się krótka lista kontrolna.
Najpierw rozdzielmy dwie rzeczy: rozpoznawanie a prezentacja
W dyskusji o jakości kantońskich notatek łatwo pomieszać dwa niezależne etapy.
Rozpoznawanie (ASR) zamienia dźwięk w tekst. Porażka na tym poziomie to „przesłyszenie” — system nie wychwytuje tego, co zostało powiedziane, albo myli wyraz z podobnie brzmiącym.
Prezentacja decyduje o tym, w jakiej postaci ten tekst ostatecznie się pojawi. Porażka na tym poziomie to „przepisanie” — rozpoznanie było trafne, ale na wyjściu mowa potoczna została wygładzona do języka pisanego.
To, co większość osób zgłasza jako „niedokładne notatki po kantońsku”, w rzeczywistości oznacza problemy na obu poziomach, wymagające zupełnie różnych rozwiązań. Pierwszy poziom to kwestia możliwości modelu i danych treningowych, drugi zaś najczęściej kwestia decyzji projektowej — i to często świadomej.
Linia pęknięcia pierwsza: mieszanie kantońskiego z angielskim
Dlaczego jest to szczególnie trudne
「我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。」
Z grubsza: „Chcę pojechać do Causeway Bay na spotkanie i przy okazji sprawdzić harmonogram”. Po kantońsku są tu 我想去 (chcę pojechać do), 開個 (odbyć), 順便 (przy okazji), 一下 (na chwilę) oraz cała konstrukcja zdania; po angielsku — Causeway Bay, meeting, check i schedule. To właśnie owo wymieszanie w obrębie jednego zdania jest sednem sprawy.
W Hongkongu takie zdanie jest zupełnie zwyczajne, ale od systemu rozpoznawania wymaga czegoś zupełnie innego niż zdanie w czystym kantońskim. System musi w obrębie tego samego zdania, a nawet jednego oddechu, przełączać się w czasie rzeczywistym między dwoma całkowicie odmiennymi systemami fonologicznymi i dwoma zasobami leksykalnymi — a moment przełączenia nie jest w żaden sposób zapowiedziany.
Sprawę pogarsza to, że gdy mieszkańcy Hongkongu używają angielskich słów, wymowa bywa już skantonizowana — struktura sylabiczna i przebieg tonalny zostają zlokalizowane. Takie realizacje nie odpowiadają oczekiwaniom modelu angielskiego ani nie występują w słowniku modelu kantońskiego. Obie strony uznają je za obce.
Różnica w liczbach
Publikowana literatura badawcza daje dość spójny obraz: wskaźnik błędu na poziomie znaków dla treści z przełączaniem kodów kantoński–angielski mieści się mniej więcej w przedziale od 20 % do 26 %, podczas gdy te same systemy przy treściach jednojęzycznych osiągają około 6 %–8 %. Na wyspecjalizowanych zbiorach testowych dla mowy mieszanej kantońsko-angielskiej systemy oparte na Whisperze notują mixed error rate rzędu 22 %.
W przełożeniu na odczucie: przy czystym kantońskim błędny jest mniej więcej jeden znak na kilkanaście, przy treściach mieszanych — jeden na cztery, pięć. To drugie oznacza już konieczność sprawdzania notatki zdanie po zdaniu, zanim da się jej zaufać.
Te błędy mają szczególną postać
Warto zauważyć, że błędy wynikające z przełączania kodów nie są „widocznie błędne” jak zwykłe pomyłki rozpoznawania. System rzadko zostawia puste miejsce albo produkuje zbitki znaków — raczej wstawia chiński wyraz o zbliżonym brzmieniu, gramatycznie prawdopodobny.
W rezultacie powstaje zdanie na pozór całkowicie płynne, którego sens jednak już się przesunął. Jest to znacznie groźniejsze niż oczywista literówka — przy oczywistym błędzie zatrzymują się Państwo i sprawdzają, a po płynnym, lecz błędnym zdaniu prześlizgują się wzrokiem.
Linia pęknięcia druga: kantoński mówiony a chiński pisany
Dwa zapisy tego samego zdania
| Faktycznie wypowiedziane (kantoński, dosłownie) | Typowy zapis (chiński pisany) | Znaczenie po polsku |
|---|---|---|
| 佢哋幾時先搞得掂? | 他們什麼時候才能完成? | Kiedy oni to wreszcie ogarną? |
| 呢單嘢我唔係好清楚 | 這件事我不太清楚 | W tej sprawie nie jestem zbyt zorientowany. |
| 咁我哋而家點算? | 那我們現在怎麼辦? | I co my teraz zrobimy? |
| 頭先個 client 講嘅嗰樣 | 剛才那位客戶說的那件事 | To, co przed chwilą powiedział klient. |
Żaden wiersz w środkowej kolumnie nie jest „błędny”. Znaczenie za każdym razem się zgadza, tekst czyta się nawet gładziej. Problem w tym, że nikt tak nie mówi.
Dlaczego systemy tak postępują
Zwykle nie jest to usterka. Dane treningowe chińszczyzny pisanej to w przytłaczającej większości standardowy chiński pisany; zapis mówionego kantońskiego (znaki takie jak 嘅, 咗, 喺, 哋) stanowi w całym korpusie znikomy ułamek. Bez wyraźnej instrukcji model w naturalny sposób ciąży ku tej odmianie chińskiego, którą zna najlepiej.
W większości przypadków to ustawienie domyślne jest zresztą właściwe. Do streszczeń spotkań, list zadań czy tekstów przekazywanych współpracownikom nieznającym kantońskiego wersja w języku pisanym jest wyraźnie użyteczniejsza.
Ale w pewnych sytuacjach jest dokładnie odwrotnie
Istnieje cała kategoria zastosowań, w których potrzebne są właśnie oryginalne słowa.
- Wywiad lekarski: słowa, którymi pacjent opisuje objawy, same w sobie są informacją kliniczną. Wyrażenia takie jak 「頂住頂住」 (uporczywe uczucie ucisku), 「唧住痛」 (ból ściskający, jakby zaciskało), 「作嘔作悶」 (mdłości połączone z uczuciem osłabienia) po przełożeniu na standardowe terminy tracą dokładnie tę konkretną jakość.
- Dokumentacja pomocy społecznej: własne słowa podopiecznego mają znaczenie dla oceny sprawy; przepisanie dodaje warstwę interpretacji już na etapie rejestrowania.
- Mediacja i rozstrzyganie sporów: kto co powiedział i jakim tonem, jest samo w sobie przedmiotem sporu.
- Wywiady badawcze i historia mówiona: wartość transkrypcji dosłownej zakłada, że jest ona dosłowna.
- Dydaktyka języka i prace korpusowe: tutaj forma mówiona sama jest przedmiotem badania.
Wspólną cechą tych sytuacji jest to, że zapis nie służy jedynie zapamiętaniu, o czym była mowa — może być później cytowany, weryfikowany lub traktowany jako podstawa. Po cichu wygładzona notatka jest w takim zastosowaniu ryzykowna, ponieważ wygląda całkowicie normalnie i nie dowiedzą się Państwo, w którym miejscu coś zmieniono.
Łatwo pomijana przesłanka: sytuacja danych kantońskich
Aby zrozumieć, dlaczego narzędzia do kantońskiego wypadają tak nierówno, warto spojrzeć na skalę dostępnych danych.
| Korpus | Wielkość | Rok |
|---|---|---|
| WenetSpeech-Yue | 21 800 godzin, 10 domen, otwarty | 2025 |
| Common Voice kantoński (yue) | 210,91 godziny (zweryfikowane), 1174 mówców | aktualizowany na bieżąco |
| MDCC | 73,6 godziny | 2022 |
| CantoMap | 12,8 godziny, 40 mówców | 2020 |
| HKCanCor | około 230 000 słów (nagrania z lat 1997–98) | 2015 |
| Words.hk | 56 373 hasła | aktualizowany na bieżąco |
Pojawienie się WenetSpeech-Yue w 2025 roku to zmiana o rząd wielkości — wcześniej publiczne kantońskie dane mowy przez długi czas utrzymywały się na poziomie od kilkudziesięciu do kilkuset godzin, podczas gdy w przypadku języków głównych operuje się swobodnie dziesiątkami tysięcy godzin. To wyjaśnia, dlaczego narzędzia do kantońskiego były dotąd powszechnie w tyle.
Trzeba jednak zaznaczyć, że przyrost danych poprawia przede wszystkim rozpoznawanie jednojęzycznego kantońskiego. Przełączanie kodów wymaga korpusów mieszanych, a te są trudniejsze w anotacji i wciąż skromne objętościowo. Pierwsza linia pęknięcia będzie się więc poprawiać wyraźnie wolniej niż rozpoznawanie czystego kantońskiego.
Jeszcze jeden hongkoński kontekst
Na marginesie zestaw powiązanych liczb. Według spisu powszechnego z 2021 roku w Hongkongu mieszka około 619 568 osób niebędących etnicznymi Chińczykami, co stanowi 8,4 % ludności. Jeśli chodzi o umiejętność mówienia po kantońsku: 17,6 % wśród osób pochodzenia filipińskiego, 25,0 % wśród osób pochodzenia indyjskiego, 34,7 % wśród ogółu osób pochodzenia południowoazjatyckiego — natomiast znajomość angielskiego przekracza zwykle 84 %.
Innymi słowy, codzienna sytuacja językowa Hongkongu to nie scenariusz wyłącznie kantoński, lecz jednoczesna obecność kantońskiego, angielskiego i wielu innych języków. Narzędzie, które dobrze rozpoznaje kantoński, ale nie potrafi tłumaczyć w czasie rzeczywistym, rozwiązuje jedynie połowę problemu.
Jak Traverba radzi sobie z obiema liniami pęknięcia
- Priorytet dla mieszania języków — rozpoznawanie jest dostrojone do hongkońskich zdań mieszających chiński z angielskim, zamiast traktować kantoński i angielski jako dwa wykluczające się tryby.
- Zachowanie formy mówionej — transkrypcja odwzorowuje formę, w jakiej rzeczywiście padły słowa; streszczenie i tłumaczenie powstają osobno. Oryginalna wypowiedź i wersja opracowana współistnieją, zamiast tego, by opracowanie nadpisywało oryginał.
- Transkrypcja i tłumaczenie w czasie rzeczywistym w jednym — jedna rozmowa, jeden mówca, ponad 100 języków: słuchacze skanują kod QR i widzą napisy we własnym języku, bez pobierania aplikacji.
- Najpierw urządzenie — rozpoznawanie mowy działa domyślnie na urządzeniu, sztuczna inteligencja w chmurze jest opcjonalna; przy treściach wrażliwych nic nie musi opuszczać urządzenia.
- Pełna transkrypcja do eksportu — po spotkaniu można wyeksportować dosłowną transkrypcję oraz wersję przetłumaczoną i przechowywać je osobno.
Dla jasności: jeśli chodzi o streszczenia zwykłych spotkań biznesowych, wewnętrzne uzgodnienia czy listy zadań, większość dostępnych narzędzi do notatek AI radzi sobie już dobrze, a wynik w języku pisanym jest wręcz wygodniejszy — nie ma powodu zmieniać narzędzia. Opisane różnice mają realne znaczenie tam, gdzie oryginalne słowa same są informacją.
Jak zdecydować? Krótka lista kontrolna
Proszę zadać sobie trzy pytania:
Po pierwsze: czy ta notatka będzie później cytowana lub weryfikowana? Jeśli tak (dokumentacja spraw, zapisy kliniczne, mediacja, wywiady), potrzebna jest transkrypcja dosłowna oraz pewność, że narzędzie niczego nie przepisuje w tle. Jeśli nie, streszczenie w języku pisanym będzie praktyczniejsze.
Po drugie: jak gęste jest mieszanie języków w rozmowie? Pojedyncze angielskie słowo obsłuży większość narzędzi. Jeśli chodzi o typowe hongkońskie rozmowy z dwoma czy trzema przełączeniami w jednym zdaniu, proszę najpierw przetestować narzędzie na prawdziwym nagraniu, a nie polegać na oficjalnych listach obsługiwanych języków.
Po trzecie: czy treść jest wrażliwa? Przy nagraniach dotyczących dokumentacji medycznej, spraw socjalnych lub kwestii prawnych proszę najpierw ustalić przepływ danych: przetwarzanie lokalne czy w chmurze, okres przechowywania, ewentualne wykorzystanie do trenowania modeli.
Na koniec jedna rada: niezależnie od wybranego narzędzia proszę przetestować je na własnej, prawdziwej rozmowie, a nie na czytanym tekście. Czytany kantoński nie zawiera przełączania kodów, partykuł mowy potocznej ani nakładających się wypowiedzi — nie ujawni więc żadnego z opisanych problemów.
Dowiedz się więcej
W kwestii kantońskich zapisów nie ma narzędzia odpowiedniego do każdej sytuacji. Kluczowe jest, aby najpierw ustalić, czy potrzebny jest „sens”, czy „dosłowne słowa” — ta decyzja bezpośrednio przesądza o wyborze i konfiguracji.
Aby dowiedzieć się, jak Traverba radzi sobie z mieszaniem języków i zachowaniem formy mówionej, zapraszamy na traverba.com lub do pobrania aplikacji z Google Play oraz App Store.
Przytoczone w artykule wskaźniki błędów pochodzą z publicznie dostępnej literatury badawczej dotyczącej rozpoznawania mowy kantońskiej, dane o wielkości korpusów — z oficjalnych informacji publikowanych przez poszczególne korpusy, a dane o ludności i kompetencjach językowych — ze spisu powszechnego rządu Hongkongu z 2021 roku. Wszystkie dane według stanu na połowę 2026 roku; modele i narzędzia stale się zmieniają, a rzeczywista skuteczność zależy od jakości nagrania, akcentu, hałasu otoczenia oraz konkretnej wersji. Wszystkie marki i znaki towarowe należą do ich właścicieli.