Mengapa Notulen Rapat Bahasa Kanton Anda Selalu Terasa “Kurang Pas”? Dua Patahan: Campur Kanton–Inggris dan Lisan vs Tulisan

Saat pertama kali memakai alat AI untuk membuat notulen rapat berbahasa Kanton, reaksi hampir semua orang mirip: hasilnya kelihatan rapi, tetapi terasa "kurang pas". Secara harfiah tidak ada kesalahan mencolok, namun begitu dibandingkan dengan percakapan yang Anda ingat, selalu ada sesuatu yang hilang.

Kesenjangan ini biasanya bukan berasal dari hal yang paling gampang terlintas di kepala, yaitu akurasi pengenalan. Untuk bahasa Kanton murni, satu pembicara, dan lingkungan yang tenang, kinerja alat-alat arus utama saat ini sebenarnya sudah cukup layak pakai. Persoalannya ada di dua tempat lain — dan kebetulan keduanya justru dua bentuk percakapan sehari-hari yang paling lazim di Hong Kong.

Pertama, ketika bahasa Inggris dan Kanton bercampur dalam satu kalimat, kualitas pengenalan turun secara nyata. Kedua, sekalipun terdengar dengan benar, teks yang keluar sering sudah ditulis ulang menjadi bahasa Tionghoa tulis baku — bukan lagi kalimat yang Anda ucapkan.

Penyebab keduanya berbeda, konteks yang terdampak juga berbeda, jadi keduanya layak dibahas terpisah.

Dan ini bukan persoalan khas Hong Kong saja. Pola yang sama muncul di mana pun penutur mencampur dua bahasa dalam satu kalimat — siapa pun yang terbiasa mendengar percakapan campur bahasa Indonesia dan Inggris di kantor akan langsung mengenali gejalanya.


Kesimpulan dalam 30 detik

  • Mencampur bahasa ada harganya, dan harga itu bisa diukur → Literatur riset terbuka menunjukkan character error rate pada konten alih kode Kanton–Inggris berkisar sekitar 20%–26%, sementara sistem sejenis pada konten satu bahasa berada di kisaran 6%–8%. Selisihnya tiga sampai empat kali lipat.
  • "Terdengar benar" dan "tertulis benar" adalah dua hal berbeda → Anda mengucapkan kalimat lisan, notulen menuliskannya dalam bentuk baku: maknanya selamat, tetapi kata aslinya lenyap.
  • Di sebagian besar konteks ini tidak masalah, di sebagian kecil justru fatal → Ringkasan obrolan santai tidak terpengaruh; konsultasi medis, catatan kasus pekerjaan sosial, berita acara mediasi, dan wawancara riset justru sebaliknya.
  • Volume data bahasa Kanton berubah satu tingkat besaran pada 2025 → Dari korpus publik berskala puluhan jam menjadi 21.800 jam pada WenetSpeech-Yue, tetapi alih kode masih menjadi bagian yang belum terpecahkan.
  • Sebelum memilih alat, pastikan dulu Anda menginginkan "makna" atau "kata asli" → Keduanya membutuhkan pengaturan berbeda; di akhir artikel ada daftar periksa singkat.

Bedakan dulu dua hal ini: pengenalan vs penyajian

Saat membahas mutu notulen bahasa Kanton, dua tahap yang sebenarnya terpisah sangat mudah tercampur aduk.

Pengenalan (ASR) adalah mengubah suara menjadi teks. Kegagalan di tahap ini berarti "salah dengar" — tidak menangkap apa yang Anda ucapkan, atau mengira sebuah kata sebagai kata lain yang bunyinya mirip.

Penyajian menentukan dalam bentuk apa teks itu akhirnya muncul. Kegagalan di tahap ini berarti "penulisan ulang" — pendengarannya sangat akurat, tetapi keluarannya memoles ucapan lisan menjadi bahasa tulis.

Apa yang dikeluhkan kebanyakan orang sebagai "notulen Kanton tidak akurat" sebenarnya adalah dua lapisan yang masing-masing bermasalah, dan keduanya menuntut penanganan yang sama sekali berbeda. Lapisan pertama adalah soal kemampuan model dan data pelatihan; lapisan kedua umumnya adalah pilihan desain — dan sering kali disengaja.


Patahan pertama: campur Kanton–Inggris

Mengapa hal ini sangat sulit

我想去 Causeway Bay 開個 meeting,順便 check 一下 schedule。

Artinya: "Saya mau ke Causeway Bay untuk mengadakan meeting, sekalian mengecek jadwal." Kata Causeway Bay, meeting, check, dan schedule diucapkan dalam bahasa Inggris, sedangkan struktur kalimat dan kata selebihnya (我想去, 開個, 順便, 一下) berbahasa Kanton. Percampuran itulah inti persoalannya.

Kalimat semacam ini sama sekali tidak istimewa di Hong Kong, tetapi bagi sistem pengenalan ia menuntut kemampuan yang sepenuhnya berbeda dari kalimat Kanton murni. Sistem harus beralih seketika — dalam satu kalimat, bahkan dalam satu tarikan napas — antara dua sistem fonologi dan dua kosakata yang sama sekali berlainan, tanpa aba-aba apa pun tentang titik peralihannya.

Yang lebih merepotkan, orang Hong Kong mengucapkan kata-kata Inggris dengan pelafalan yang sudah terkantonisasi — struktur suku kata dan kontur nadanya sudah dilokalkan. Pelafalan seperti ini tidak sepenuhnya sesuai harapan model bahasa Inggris, dan juga tidak ada dalam daftar kata model bahasa Kanton. Kedua belah pihak menganggapnya bukan miliknya.

Kesenjangan dalam angka

Literatur riset terbuka memberi gambaran yang cukup konsisten: character error rate pada konten alih kode Kanton–Inggris berkisar sekitar 20% hingga 26%, sementara sistem sejenis pada konten satu bahasa berada di kisaran 6% hingga 8%. Pada set evaluasi khusus untuk ucapan campuran Kanton–Inggris, mixed error rate sistem berbasis Whisper berada di sekitar 22%.

Diterjemahkan ke pengalaman sehari-hari: konten Kanton murni salah kira-kira satu kata dari setiap belasan kata, sedangkan konten campuran salah sekitar satu dari setiap empat sampai lima kata. Yang kedua sudah cukup untuk membuat sebuah notulen harus diperiksa kalimat demi kalimat sebelum berani dipakai.

Bentuk kesalahannya sangat khas

Perlu dicatat, kesalahan alih kode tidak "kelihatan salah" seperti kesalahan pengenalan pada umumnya. Sistem jarang membiarkan bagian itu kosong atau mengeluarkan karakter kacau; ia cenderung menebak sebuah kata Tionghoa yang bunyinya mirip dan secara tata bahasa masuk akal, lalu menyisipkannya.

Hasilnya adalah kalimat yang di permukaan mengalir mulus, padahal maknanya sudah melenceng. Ini jauh lebih berbahaya daripada salah ketik yang kentara — salah ketik yang kentara membuat Anda berhenti dan memeriksa, sedangkan kalimat salah yang mulus akan Anda lewati begitu saja.


Patahan kedua: Kanton lisan vs Tionghoa tulis

Dua versi dari kalimat yang sama

Yang benar-benar diucapkan (Kanton)Keluaran umum (Tionghoa tulis)Maknanya
佢哋幾時先搞得掂?他們什麼時候才能完成?Kapan mereka baru bisa menyelesaikannya?
呢單嘢我唔係好清楚這件事我不太清楚Soal yang ini saya kurang paham.
咁我哋而家點算?那我們現在怎麼辦?Lalu sekarang kita bagaimana?
頭先個 client 講嘅嗰樣剛才那位客戶說的那件事Hal yang barusan disebut klien itu.

Tidak satu pun kalimat di kolom tengah yang "salah". Maknanya akurat, bahkan lebih enak dibaca. Masalahnya: tidak ada orang yang berbicara seperti itu.

Mengapa sistem melakukannya

Ini umumnya bukan bug. Data pelatihan bahasa Tionghoa tulis didominasi secara telak oleh ragam tulis baku, sedangkan penulisan bahasa Kanton lisan ( ) hanya menempati porsi yang sangat kecil dalam keseluruhan korpus. Tanpa instruksi eksplisit, model secara alami condong menghasilkan ragam bahasa Tionghoa yang paling dikenalnya.

Dan dalam sebagian besar situasi, pengaturan bawaan itu memang tepat. Untuk membuat ringkasan rapat, menyusun daftar tugas, atau mengirimkannya kepada rekan kerja yang tidak berbahasa Kanton — versi ragam tulis jelas lebih berguna.

Tetapi ada konteks yang justru sebaliknya

Persoalannya, ada satu kategori konteks yang justru membutuhkan kata aslinya.

  • Konsultasi medis: kata-kata yang dipakai pasien untuk menggambarkan gejala itu sendiri adalah informasi klinis. Ungkapan seperti 頂住頂住 (rasa tertekan atau mengganjal terus-menerus), 唧住痛 (nyeri seperti diperas) dan 作嘔作悶 (mual disertai rasa tidak enak) — begitu ditulis ulang menjadi istilah baku, tekstur spesifiknya lenyap.
  • Catatan kasus pekerjaan sosial: kata-kata asli penerima layanan berkaitan langsung dengan penilaian kasus; menulis ulang berarti menyisipkan satu lapis tafsir sejak tahap pencatatan.
  • Mediasi dan penyelesaian sengketa: siapa mengatakan apa dan dengan nada seperti apa justru merupakan pokok sengketanya.
  • Wawancara riset dan sejarah lisan: nilai sebuah transkrip verbatim berpijak pada sifat verbatimnya.
  • Pengajaran bahasa dan penyusunan korpus: bentuk lisan itu sendirilah objek kajiannya.

Benang merah semua konteks ini: catatan bukan sekadar alat untuk mengingat apa yang dibahas, melainkan sesuatu yang kelak mungkin dikutip, ditinjau ulang, atau dijadikan dasar. Catatan yang diam-diam sudah "dihaluskan" menyimpan risiko dalam penggunaan seperti ini — karena tampilannya sepenuhnya normal, Anda tidak akan tahu bagian mana yang diubah.


Satu prasyarat yang mudah terlewat: kondisi data bahasa Kanton

Untuk memahami mengapa kinerja alat bahasa Kanton begitu beragam, ada gunanya melihat skala data yang tersedia.

KorpusSkalaTahun
WenetSpeech-Yue21.800 jam, 10 domain, terbuka2025
Common Voice Kanton (yue)210,91 jam (terverifikasi), 1.174 penuturDiperbarui terus
MDCC73,6 jam2022
CantoMap12,8 jam, 40 penutur2020
HKCanCorsekitar 230.000 kata (direkam 1997–98)2015
Words.hk56.373 entri kamusDiperbarui terus

Kemunculan WenetSpeech-Yue pada 2025 adalah pergeseran satu tingkat besaran — sebelum itu, data ucapan bahasa Kanton yang terbuka lama tertahan di kisaran puluhan hingga ratusan jam, sementara bahasa-bahasa arus utama dihitung dalam puluhan ribu jam. Ini menjelaskan mengapa alat bahasa Kanton di masa lalu umumnya tertinggal.

Namun perlu diperhatikan, penambahan data terutama memperbaiki pengenalan bahasa Kanton satu bahasa. Alih kode membutuhkan korpus campuran, dan data semacam itu jauh lebih sulit dianotasi serta skalanya masih tipis. Karena itu laju perbaikan pada patahan pertama akan jelas lebih lambat daripada laju perbaikan pengenalan Kanton murni.


Satu lapis konteks lain di Hong Kong

Sekadar menambahkan satu set angka yang berkaitan. Menurut sensus 2021, penduduk Hong Kong yang bukan beretnis Tionghoa berjumlah sekitar 619.568 orang, atau 8,4% dari populasi. Dalam hal kemampuan berbahasa Kanton: keturunan Filipina 17,6%, keturunan India 25,0%, dan keseluruhan keturunan Asia Selatan 34,7%; sebaliknya kemampuan bahasa Inggris umumnya di atas 84%.

Dengan kata lain, situasi kebahasaan dalam komunikasi sehari-hari di Hong Kong bukanlah panggung tunggal "bahasa Kanton", melainkan kehadiran serentak bahasa Kanton, bahasa Inggris, dan berbagai bahasa lain. Alat yang hanya jago mengenali bahasa Kanton tetapi tidak mampu menerjemahkan secara langsung hanya memecahkan separuh masalah.


Bagaimana Traverba menangani kedua patahan ini

  • Campur Kanton–Inggris sebagai prioritas — pengenalan disesuaikan untuk kalimat campuran bergaya Hong Kong, bukan memperlakukan bahasa Kanton dan Inggris sebagai dua mode yang harus dipilih salah satu.
  • Bentuk lisan dipertahankan — transkripsi mengikuti bentuk yang benar-benar Anda ucapkan, sementara ringkasan dan terjemahan dihasilkan terpisah; kata asli dan versi rapi hidup berdampingan, bukan yang satu menimpa yang lain.
  • Transkripsi langsung dan terjemahan langsung menyatu — satu percakapan, satu pembicara, 100+ bahasa; hadirin cukup memindai QR code untuk melihat subtitel dalam bahasanya sendiri, tanpa mengunduh aplikasi.
  • Mengutamakan pemrosesan di perangkat — pengenalan suara secara bawaan berjalan di perangkat, AI awan bersifat opsional; untuk konten sensitif, tidak ada yang perlu keluar sama sekali.
  • Transkrip verbatim lengkap dapat diekspor — seusai sesi, transkrip verbatim asli dan versi terjemahannya dapat diekspor dan disimpan terpisah.

Perlu ditegaskan: jika penggunaan Anda adalah ringkasan rapat bisnis biasa, sinkronisasi internal, atau penyusunan daftar tugas, sebagian besar alat catatan AI di pasaran sudah bekerja dengan baik, dan keluaran ragam tulis justru lebih cocok — tidak perlu berganti alat untuk itu. Perbedaan di atas baru benar-benar berarti pada konteks di mana "kata aslinya itu sendiri adalah datanya".


Bagaimana menilainya? Daftar periksa singkat

Tanyakan tiga hal pada diri sendiri:

Satu, apakah catatan ini kelak akan dikutip atau ditinjau ulang? Jika ya (catatan kasus, rekam klinis, mediasi, wawancara), Anda memerlukan transkrip verbatim sekaligus kepastian bahwa alatnya tidak diam-diam menulis ulang. Jika tidak, ringkasan ragam tulis lebih praktis.

Dua, seberapa padat percampuran bahasa dalam percakapan itu? Satu-dua kata Inggris sesekali masih bisa ditangani kebanyakan alat. Tetapi jika bentuknya percakapan khas Hong Kong yang berpindah bahasa dua sampai tiga kali dalam satu kalimat, ujilah dulu dengan rekaman nyata — jangan berpatokan pada daftar bahasa resmi.

Tiga, apakah isinya sensitif? Untuk rekaman yang menyangkut rekam medis, berkas kasus, atau urusan hukum, pastikan dulu alur datanya: diproses di perangkat atau di awan, disimpan berapa lama, dan apakah dipakai untuk pelatihan.

Satu saran terakhir: alat mana pun yang Anda pilih, ujilah dengan cuplikan percakapan nyata Anda sendiri, bukan naskah yang dibacakan. Bahasa Kanton yang dibacakan tidak mengandung alih kode, tanpa partikel lisan, tanpa tumpang tindih interupsi — dan tidak akan mengungkap satu pun masalah di atas.


Pelajari lebih lanjut

Dalam urusan notulen bahasa Kanton, tidak ada satu alat yang cocok untuk semua situasi. Kuncinya adalah memastikan lebih dulu apakah yang Anda inginkan itu "makna" atau "kata asli" — keputusan itu langsung menentukan cara memilih dan cara mengaturnya.

Untuk mengetahui bagaimana Traverba menangani campur Kanton–Inggris dan pelestarian ragam lisan, kunjungi traverba.com, atau unduh dan coba lewat Google Play dan App Store.


Angka error rate yang dikutip dalam artikel ini berasal dari literatur riset terbuka tentang pengenalan ucapan bahasa Kanton, data skala korpus berasal dari pengumuman resmi masing-masing korpus, dan data kependudukan serta kemampuan bahasa berasal dari sensus penduduk Pemerintah Hong Kong tahun 2021. Seluruh data berlaku hingga pertengahan 2026; kemampuan model dan alat terus berubah, dan kinerja nyata bergantung pada kualitas rekaman, aksen, derau lingkungan, serta versi yang dipakai. Semua merek dan merek dagang adalah milik pemiliknya masing-masing.