Kenapa Minit Mesyuarat Bahasa Kantonis Anda Sentiasa Terasa “Tak Kena”? Dua Jurang: Campuran Kantonis–Inggeris dan Lisan lawan Tulisan

Kali pertama seseorang menggunakan alat AI untuk menyediakan minit mesyuarat dalam bahasa Kantonis, reaksinya lebih kurang sama: hasilnya nampak kemas, namun terasa "tak kena". Pada zahirnya tiada kesilapan yang ketara, tetapi apabila dibandingkan dengan perbualan yang anda ingat, ada sesuatu yang hilang.

Jurang ini lazimnya bukan berpunca daripada perkara yang paling mudah terlintas di fikiran, iaitu ketepatan pengecaman. Bagi bahasa Kantonis tulen, seorang penutur sahaja, dan persekitaran yang senyap, prestasi alat arus perdana hari ini sebenarnya sudah cukup baik untuk digunakan. Masalahnya terletak pada dua tempat lain — dan kebetulan itulah dua bentuk perbualan harian yang paling lazim di Hong Kong.

Pertama, apabila bahasa Inggeris dan Kantonis bercampur dalam satu ayat, mutu pengecaman menurun dengan ketara. Kedua, walaupun didengar dengan betul, teks yang terhasil selalunya sudah ditulis semula menjadi bahasa Cina tulisan baku — bukan lagi ayat yang anda lafazkan.

Punca kedua-duanya berbeza, konteks yang terjejas juga berbeza, jadi wajar dibincangkan secara berasingan.

Ini juga bukan isu Hong Kong semata-mata. Corak yang sama berulang di mana-mana penutur mencampurkan dua bahasa dalam satu ayat — sesiapa yang biasa mendengar perbualan bercampur bahasa Melayu dan Inggeris di tempat kerja akan segera mengenali gejalanya.


Rumusan dalam 30 saat

  • Percampuran bahasa ada kosnya, dan kos itu boleh diukur → Kesusasteraan penyelidikan terbuka menunjukkan character error rate bagi kandungan penukaran kod Kantonis–Inggeris berada dalam lingkungan 20%–26%, manakala sistem yang sama bagi kandungan satu bahasa berada sekitar 6%–8%. Bezanya tiga hingga empat kali ganda.
  • "Betul didengar" dan "betul ditulis" ialah dua perkara berlainan → Anda melafazkan ayat lisan, minit menulisnya dalam bentuk baku: maknanya terpelihara, tetapi kata asalnya lenyap.
  • Dalam kebanyakan konteks ini tidak menjadi hal, dalam segelintir konteks ia amat kritikal → Ringkasan perbualan santai tidak terjejas; sebaliknya konsultasi perubatan, rekod kes kerja sosial, minit pengantaraan dan temu bual penyelidikan amat terjejas.
  • Jumlah data bahasa Kantonis berubah satu tahap magnitud pada 2025 → Daripada korpus awam berskala puluhan jam kepada 21,800 jam dalam WenetSpeech-Yue, namun penukaran kod masih merupakan bahagian yang belum diselesaikan.
  • Sebelum memilih alat, tetapkan dahulu sama ada anda mahukan "makna" atau "kata asal" → Kedua-duanya memerlukan tetapan berbeza; di hujung artikel ada satu senarai semak.

Bezakan dahulu dua perkara: pengecaman lawan persembahan

Apabila membincangkan mutu minit bahasa Kantonis, dua peringkat yang sebenarnya berasingan amat mudah dicampuradukkan.

Pengecaman (ASR) ialah proses menukar bunyi kepada teks. Kegagalan di peringkat ini bermaksud "tersalah dengar" — tidak menangkap apa yang anda ucapkan, atau menganggap sesuatu perkataan sebagai perkataan lain yang bunyinya hampir sama.

Persembahan pula menentukan dalam bentuk apa teks itu akhirnya dipaparkan. Kegagalan di peringkat ini bermaksud "penulisan semula" — pendengarannya amat tepat, tetapi keluarannya melicinkan pertuturan lisan menjadi bahasa tulisan.

Apa yang kebanyakan orang adukan sebagai "minit Kantonis tidak tepat" sebenarnya ialah dua lapisan yang masing-masing bermasalah, dan kedua-duanya menuntut pendekatan yang sama sekali berbeza. Lapisan pertama ialah soal keupayaan model dan data latihan; lapisan kedua kebanyakannya ialah pilihan reka bentuk — dan selalunya pilihan yang disengajakan.


Jurang pertama: campuran Kantonis–Inggeris

Mengapa perkara ini amat sukar

我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。

Maksudnya: "Saya hendak ke Causeway Bay untuk mengadakan satu mesyuarat, sekali gus menyemak jadual." Perkataan Causeway Bay, meeting, check dan schedule dilafazkan dalam bahasa Inggeris, manakala struktur ayat dan perkataan selebihnya (我想去, 開個, 順便, 一下) ialah bahasa Kantonis. Percampuran itulah intipati masalahnya.

Ayat sebegini langsung tidak luar biasa di Hong Kong, tetapi bagi sistem pengecaman ia menuntut keupayaan yang sama sekali berbeza daripada ayat Kantonis tulen. Sistem terpaksa bertukar serta-merta — dalam satu ayat, malah dalam satu tarikan nafas — antara dua sistem fonologi dan dua perbendaharaan kata yang jauh berbeza, tanpa sebarang isyarat awal tentang titik pertukarannya.

Lebih menyusahkan lagi, orang Hong Kong melafazkan perkataan Inggeris dengan sebutan yang sudah dikantoniskan — struktur suku kata dan kontur nadanya sudah disetempatkan. Sebutan begini tidak menepati sepenuhnya jangkaan model bahasa Inggeris, dan juga tiada dalam senarai kata model bahasa Kantonis. Kedua-dua pihak menganggapnya bukan miliknya.

Jurang dari segi angka

Kesusasteraan penyelidikan terbuka memberikan gambaran yang agak konsisten: character error rate bagi kandungan penukaran kod Kantonis–Inggeris berada lebih kurang antara 20% hingga 26%, manakala sistem yang sama bagi kandungan satu bahasa berada sekitar 6% hingga 8%. Pada set penilaian khusus bagi pertuturan campuran Kantonis–Inggeris, mixed error rate sistem berasaskan Whisper berada sekitar 22%.

Diterjemahkan kepada rasa sebenar: kandungan Kantonis tulen tersilap kira-kira satu perkataan bagi setiap belasan perkataan, manakala kandungan bercampur tersilap kira-kira satu bagi setiap empat hingga lima perkataan. Keadaan kedua sudah cukup untuk menjadikan sesuatu minit itu perlu disemak ayat demi ayat sebelum berani digunakan.

Bentuk kesilapan ini amat tersendiri

Perlu diberi perhatian, kesilapan penukaran kod tidak "kelihatan salah" seperti kesilapan pengecaman biasa. Sistem jarang membiarkan ruang kosong atau mengeluarkan aksara bercelaru; sebaliknya ia cenderung meneka satu perkataan Cina yang hampir sama bunyinya dan munasabah dari segi tatabahasa, lalu mengisinya di situ.

Hasilnya ialah ayat yang pada permukaannya lancar sepenuhnya, tetapi maknanya sudah tersasar. Ini jauh lebih berbahaya daripada kesilapan ejaan yang jelas — kesilapan yang jelas membuatkan anda berhenti dan menyemak, manakala ayat salah yang lancar akan anda baca terus tanpa sedar.


Jurang kedua: Kantonis lisan lawan bahasa Cina tulisan

Dua versi bagi ayat yang sama

Yang sebenarnya dilafazkan (Kantonis)Keluaran lazim (Cina tulisan)Maksudnya
佢哋幾時先搞得掂?他們什麼時候才能完成?Bilakah mereka baru dapat menyiapkannya?
呢單嘢我唔係好清楚這件事我不太清楚Perkara ini saya kurang jelas.
咁我哋而家點算?那我們現在怎麼辦?Jadi sekarang apa yang kita nak buat?
頭先個 client 講嘅嗰樣剛才那位客戶說的那件事Perkara yang disebut oleh klien itu sebentar tadi.

Tiada satu pun ayat dalam lajur tengah yang "salah". Maknanya tepat, malah lebih sedap dibaca. Masalahnya: tiada sesiapa bercakap begitu.

Mengapa sistem berbuat demikian

Ini lazimnya bukan pepijat. Data latihan bahasa Cina tulisan didominasi secara mutlak oleh ragam tulisan baku, manakala penulisan Kantonis lisan ( ) hanya mengisi bahagian yang amat kecil dalam keseluruhan korpus. Tanpa arahan yang jelas, model secara semula jadi condong menghasilkan ragam bahasa Cina yang paling dikenalinya.

Dan dalam kebanyakan keadaan, tetapan lalai itu memang betul. Untuk menyediakan ringkasan mesyuarat, menyusun senarai tugasan, atau menghantarnya kepada rakan sekerja yang tidak fasih Kantonis — versi bahasa tulisan jelas lebih berguna.

Tetapi ada konteks yang sebaliknya

Persoalannya, ada satu kategori konteks yang justru memerlukan kata asalnya.

  • Konsultasi perubatan: perkataan yang digunakan pesakit untuk menggambarkan simptom itu sendiri merupakan maklumat klinikal. Ungkapan seperti 頂住頂住 (rasa tertekan atau tersekat berterusan), 唧住痛 (sakit seperti diramas) dan 作嘔作悶 (loya disertai rasa tidak selesa) — sebaik sahaja ditulis semula menjadi istilah baku, tekstur khusus itu hilang.
  • Rekod kes kerja sosial: kata-kata asal penerima perkhidmatan berkait terus dengan penilaian kes; menulis semula bermakna menyisipkan satu lapisan tafsiran sejak peringkat perekodan lagi.
  • Pengantaraan dan penyelesaian pertikaian: siapa berkata apa dan dengan nada bagaimana itulah punca pertikaiannya.
  • Temu bual penyelidikan dan sejarah lisan: nilai transkrip verbatim bergantung pada sifat verbatimnya.
  • Pengajaran bahasa dan penyusunan korpus: bentuk lisan itu sendirilah objek kajiannya.

Persamaan semua konteks ini: rekod bukan sekadar alat untuk mengingati apa yang dibincangkan, tetapi sesuatu yang mungkin dipetik, disemak semula, atau dijadikan sandaran pada masa hadapan. Rekod yang senyap-senyap sudah "dikemaskan" membawa risiko dalam penggunaan sebegini — kerana ia kelihatan normal sepenuhnya, dan anda takkan tahu bahagian mana yang telah diubah.


Satu prasyarat yang mudah terlepas pandang: keadaan data bahasa Kantonis

Untuk memahami mengapa prestasi alat bahasa Kantonis begitu tidak sekata, ada baiknya melihat skala data yang tersedia.

KorpusSkalaTahun
WenetSpeech-Yue21,800 jam, 10 domain, terbuka2025
Common Voice Kantonis (yue)210.91 jam (disahkan), 1,174 penuturDikemas kini berterusan
MDCC73.6 jam2022
CantoMap12.8 jam, 40 penutur2020
HKCanCorkira-kira 230,000 perkataan (dirakam 1997–98)2015
Words.hk56,373 entri kamusDikemas kini berterusan

Kemunculan WenetSpeech-Yue pada 2025 merupakan peralihan satu tahap magnitud — sebelum itu, data pertuturan Kantonis yang terbuka lama terperangkap pada tahap puluhan hingga ratusan jam, sedangkan bahasa arus perdana dikira dalam puluhan ribu jam. Ini menjelaskan mengapa alat bahasa Kantonis pada masa lalu umumnya ketinggalan.

Namun perlu diambil perhatian, pertambahan data terutamanya memperbaiki pengecaman Kantonis satu bahasa. Penukaran kod memerlukan korpus bercampur, dan data jenis ini lebih sukar dianotasi serta skalanya masih tipis. Oleh itu kadar penambahbaikan bagi jurang pertama akan jelas lebih perlahan berbanding kadar penambahbaikan pengecaman Kantonis tulen.


Satu lagi lapisan konteks di Hong Kong

Sekadar menambah satu set angka berkaitan. Menurut banci 2021, penduduk Hong Kong yang bukan berketurunan Cina berjumlah kira-kira 619,568 orang, iaitu 8.4% daripada populasi. Dari segi keupayaan bertutur dalam bahasa Kantonis: keturunan Filipina 17.6%, keturunan India 25.0%, dan keseluruhan keturunan Asia Selatan 34.7%; sebaliknya penguasaan bahasa Inggeris umumnya melebihi 84%.

Dengan kata lain, keadaan bahasa dalam komunikasi harian di Hong Kong bukanlah satu pentas "Kantonis" tunggal, sebaliknya kehadiran serentak bahasa Kantonis, bahasa Inggeris dan pelbagai bahasa lain. Alat yang hanya cekap mengecam bahasa Kantonis tetapi tidak mampu menterjemah secara langsung hanya menyelesaikan separuh daripada masalah itu.


Bagaimana Traverba menangani kedua-dua jurang ini

  • Campuran Kantonis–Inggeris diutamakan — pengecaman ditala untuk ayat bercampur bergaya Hong Kong, bukannya melayan bahasa Kantonis dan Inggeris sebagai dua mod yang perlu dipilih salah satu.
  • Bentuk lisan dikekalkan — transkripsi berpandukan bentuk yang benar-benar anda lafazkan, manakala ringkasan dan terjemahan dijana secara berasingan; kata asal dan versi kemas wujud bersama, bukannya satu menimpa yang lain.
  • Transkripsi langsung dan terjemahan langsung bersepadu — satu perbualan, seorang penutur, 100+ bahasa; hadirin hanya perlu mengimbas QR code untuk melihat sari kata dalam bahasa masing-masing, tanpa memuat turun apa-apa aplikasi.
  • Pemprosesan pada peranti diutamakan — pengecaman pertuturan secara lalai berjalan pada peranti, AI awan bersifat pilihan; bagi kandungan sensitif, tiada apa-apa perlu dihantar keluar.
  • Transkrip verbatim penuh boleh dieksport — selepas sesi, transkrip verbatim asal dan versi terjemahan boleh dieksport dan disimpan secara berasingan.

Perlu dinyatakan dengan jelas: jika penggunaan anda ialah ringkasan mesyuarat perniagaan biasa, penyelarasan dalaman, atau penyusunan senarai tugasan, kebanyakan alat nota AI di pasaran sudah pun berfungsi dengan baik, malah keluaran bahasa tulisan lebih sesuai — tidak perlu bertukar alat kerana perkara ini. Perbezaan di atas hanya benar-benar bermakna dalam konteks di mana "kata asal itu sendiri ialah datanya".


Bagaimana hendak menilai? Satu senarai semak ringkas

Tanya diri anda tiga soalan:

Satu, adakah rekod ini akan dipetik atau disemak semula kelak? Jika ya (rekod kes, rekod klinikal, pengantaraan, temu bual), anda memerlukan transkrip verbatim, dan juga kepastian bahawa alat itu tidak menulis semula di sebalik tabir. Jika tidak, ringkasan bahasa tulisan lebih praktikal.

Dua, sepadat mana percampuran bahasa dalam perbualan itu? Satu dua perkataan Inggeris sekali-sekala masih boleh ditangani kebanyakan alat. Tetapi jika bentuknya ialah perbualan Hong Kong tipikal yang bertukar bahasa dua tiga kali dalam satu ayat, ujilah dahulu dengan rakaman sebenar — jangan bergantung pada senarai bahasa rasmi.

Tiga, adakah kandungannya sensitif? Bagi rakaman yang melibatkan rekod perubatan, fail kes, atau urusan perundangan, pastikan dahulu aliran datanya: diproses pada peranti atau di awan, disimpan berapa lama, dan sama ada digunakan untuk latihan.

Satu nasihat terakhir: apa jua alat yang anda pilih, ujilah dengan petikan perbualan sebenar anda sendiri, bukan skrip yang dibacakan. Bahasa Kantonis yang dibacakan tiada penukaran kod, tiada partikel lisan, tiada pertindihan celahan — dan tidak akan mendedahkan satu pun daripada masalah di atas.


Ketahui lebih lanjut

Dalam soal minit bahasa Kantonis, tiada satu alat yang sesuai untuk semua keadaan. Yang penting ialah menetapkan dahulu sama ada anda mahukan "makna" atau "kata asal" — keputusan itu terus menentukan cara anda memilih dan cara anda menetapkannya.

Untuk mengetahui bagaimana Traverba menangani campuran Kantonis–Inggeris dan pengekalan ragam lisan, layari traverba.com, atau muat turun dan cuba melalui Google Play dan App Store.


Angka error rate yang dipetik dalam artikel ini diambil daripada kesusasteraan penyelidikan terbuka mengenai pengecaman pertuturan bahasa Kantonis, data skala korpus daripada pengumuman rasmi setiap korpus, dan data penduduk serta penguasaan bahasa daripada banci penduduk Kerajaan Hong Kong tahun 2021. Semua data adalah setakat pertengahan tahun 2026; keupayaan model dan alat sentiasa berubah, dan prestasi sebenar bergantung pada kualiti rakaman, loghat, bunyi bising persekitaran serta versi tertentu yang digunakan. Semua jenama dan tanda dagangan adalah milik pemilik masing-masing.