Jika Anda pernah merekam rapat di Hong Kong lalu menjalankannya melalui aplikasi transkripsi, Anda pasti tahu bahwa bahasa Kanton adalah salah satu bahasa yang paling sulit ditangani dengan benar. Kalimat seperti "我想去 Causeway Bay 開會 prepare 一下 個 deck" mencampur Kanton dan Inggris dalam satu napas — dan campuran itulah yang membuat sebagian besar alat transkripsi menunjukkan keterbatasannya.
Ini bukan masalah yang jarang terjadi. Peralihan kode (code-switching) — berpindah antara Kanton dan Inggris di tengah kalimat — adalah ragam bahasa sehari-hari dalam dunia bisnis, teknologi, dan kehidupan sehari-hari di Hong Kong. Ini juga merupakan salah satu masalah paling menantang secara teknis dalam pengenalan suara bahasa Tionghoa.
Kami menyusun perbandingan netral dan praktis dari alat-alat pengenalan suara Kanton utama di tahun 2026 — Google, Apple, Microsoft Azure, OpenAI Whisper, Otter.ai, iFLYTEK, ElevenLabs, dan Speechmatics — dengan melihat akurasi, peralihan kode, privasi, dan seberapa mudah masing-masing alat digunakan oleh pengguna biasa. Setiap alat di sini unggul dalam sesuatu hal; tujuannya adalah membantu Anda mencocokkan alat yang tepat dengan kebutuhan Anda.
Cara Mengukur Akurasi
Akurasi transkripsi biasanya dilaporkan sebagai Word Error Rate (WER) atau Character Error Rate (CER) — persentase kata atau karakter yang berbeda dari referensi yang benar. Semakin rendah semakin baik. Di bawah sekitar 5% dianggap sangat baik; sekitar 20% umumnya berarti diperlukan pembersihan manual yang cukup berarti.
Tolok ukur publik yang paling banyak dikutip untuk bahasa Kanton adalah dataset Common Voice Yue — penutur Kanton nyata yang membaca dengan keras. Pada bahasa Kanton yang dibaca dengan jelas dan bersih tersebut, pengujian independen telah melaporkan tingkat kesalahan karakter sebagai berikut:
| Mesin | CER yang Dilaporkan (Common Voice Yue) | Catatan |
|---|---|---|
| Apple (on-device) | ~7,4% | Berjalan secara lokal di Mac/iPhone |
| Google Cloud Speech-to-Text | ~11,4% | Model "yue-Hant-HK" |
| Microsoft Azure / Cognitive Services | ~22,5% | Alat pengembang yang kuat |
Berdasarkan tolok ukur ini, model Kanton on-device Apple mendapat skor yang baik — CER yang dilaporkannya sekitar 35% lebih rendah dari Google dan 67% lebih rendah dari Microsoft pada dataset tertentu ini, dan berjalan sepenuhnya di perangkat. Bagi seseorang yang mendiktekan Kanton bersih ke Mac, ini adalah pilihan yang benar-benar baik dan gratis.
Satu catatan penting: tolok ukur ini mengukur bahasa Kanton yang dibaca dengan jelas, satu pembicara, tanpa bahasa Inggris di dalamnya. Itulah yang tidak mencerminkan cara sebagian besar orang di Hong Kong benar-benar berbicara.
Mengapa Peralihan Kode Adalah Ujian Sesungguhnya
Common Voice adalah tuturan monolingualnya yang cermat. Bahasa Kanton Hong Kong sehari-hari bersifat percakapan, cepat, dan bercampur dengan Inggris:
"個 user feedback 話 個 flow 唔 make sense, 不如 我哋 sync 一 sync 先。"
Skor tolok ukur pada bahasa Kanton bersih tidak banyak memberi tahu Anda tentang bagaimana suatu alat menangani kalimat seperti itu. Penelitian akademis tentang peralihan kode Kanton-Inggris menunjukkan dua alasan mengapa ini sulit bagi mesin mana pun:
- Bahasa Inggris yang diucapkan dengan aksen Kanton terdengar berbeda dari Inggris "standar", yang dapat membingungkan model bahasa Inggris.
- Data pelatihan peralihan kode yang terbatas — banyak sistem dilatih terutama pada bahasa Kanton monolingualnya atau bahasa Inggris monolingual, bukan campuran alaminya.
Hal ini memengaruhi seluruh bidang, bukan satu merek saja. Dalam pengujian yang lebih luas, audio peralihan kode telah mengurangi akurasi di seluruh alat populer — satu studi yang banyak dilaporkan melihat akurasi turun pada pencampuran Spanyol-Inggris. Kesimpulan praktisnya: untuk audio Hong Kong, bagaimana suatu alat menangani bahasa Inggris dalam Kanton lebih penting daripada skor tolok ukur utamanya.
Alat-Alat, Satu per Satu
Otter.ai
Otter adalah salah satu aplikasi transkripsi paling populer secara keseluruhan, dengan fitur rapat dan ringkasan yang sangat baik. Per 2026, transkripsinya berfokus pada bahasa Inggris dan tidak menawarkan transkripsi Kanton. Jika Anda mencari Kanton secara khusus, Anda akan membutuhkan alat dengan dukungan asli.
OpenAI Whisper
Whisper mendukung berbagai macam bahasa dan dapat mentranskripsikan Kanton. Secara default, ia cenderung menghasilkan bahasa Tionghoa standar tertulis (misalnya "他們" alih-alih ungkapan sehari-hari "佢哋"). Model Kanton yang telah disetel komunitas ada yang mempertahankan keluaran percakapan, tetapi menggunakannya memerlukan beberapa pengaturan teknis, sehingga Whisper paling cocok untuk pengembang dan pengguna mahir daripada seseorang yang hanya ingin membuka aplikasi.
Google Cloud Speech-to-Text
Model "yue-Hant-HK" Google berskala dengan baik dan merupakan pilihan solid untuk draf cepat dan pemrosesan otomatis bervolume besar dalam Google Cloud. Seperti sebagian besar mesin otomatis, keluaran mentahnya biasanya mendapat manfaat dari tinjauan ulang, dan bahasa Inggris dalam peralihan kode mungkin perlu dibersihkan. Ini adalah produk API/pengembang, bukan aplikasi konsumen.
Microsoft Azure AI Speech
Azure menawarkan alat pengembang yang kuat dan integrasi yang bersih dengan alur kerja cloud Microsoft, menjadikannya pilihan populer bagi tim teknik. Dokumentasinya mencatat bahwa keluaran Kanton mendapat manfaat dari tinjauan di mana peralihan kode terlibat. Seperti Google, ini ditujukan untuk pengembang yang membangun aplikasi mereka sendiri.
iFLYTEK (科大訊飛)
iFLYTEK adalah perusahaan AI suara terkemuka dan telah berinvestasi besar di Hong Kong. Kini menawarkan dukungan Kanton yang ditujukan langsung untuk pasar lokal — termasuk Sistem Konferensi Multibahasa iFLYREC (Edisi Hong Kong & Makau) dan solusi rapat yang memungkinkan pengguna beralih di antara Kanton, Putonghua, dan Inggris, ditambah opsi on-premises dan perangkat keras penerjemah. Ini adalah pilihan yang cakap dan serius, terutama untuk penerapan enterprise dan konferensi di mana hosting on-premises atau perangkat keras khusus sesuai dengan alur kerja.
ElevenLabs Scribe & Speechmatics
Keduanya adalah mesin speech-to-text yang kuat dan modern. ElevenLabs menempatkan Kanton di tier akurasi yang lebih tinggi, dan Speechmatics mengiklankan akurasi tinggi dengan latensi rendah. Keduanya terutama merupakan layanan cloud, berbayar, dan mengutamakan API — blok bangunan yang sangat baik untuk pengembang, dengan audio yang diproses di cloud.
Ringkasan Berdampingan
| Alat | Dukungan Kanton | Paling cocok untuk | Berjalan on-device | Akses tipikal |
|---|---|---|---|---|
| Otter.ai | Fokus bahasa Inggris | Rapat bahasa Inggris | Tidak | Aplikasi berlangganan |
| Apple Dictation | Ya (kuat pada audio bersih) | Dikte Mac/iPhone | Ya | Bawaan, gratis |
| Google Cloud STT | Ya | Pengembang, draf massal | Tidak | API / bayar sesuai penggunaan |
| Microsoft Azure | Ya | Pengembang, alur kerja MS | Tidak | API / bayar sesuai penggunaan |
| OpenAI Whisper | Ya (→ Tionghoa tertulis) | Pengembang, pengguna mahir | Ya (teknis) | Open-source / self-host |
| iFLYTEK | Ya (trilingual HK) | Enterprise, konferensi | Opsi on-prem | Enterprise / perangkat keras |
| ElevenLabs / Speechmatics | Ya | Pengembang | Tidak | API berbayar |
| Traverba | Ya (disetel untuk HK) | Pengguna sehari-hari | Ya | Aplikasi gratis |
Tidak ada satu "terbaik" — itu bergantung pada apa yang Anda lakukan. Seorang pengembang yang membangun produk akan menyukai Whisper atau Azure. Penyelenggara konferensi mungkin paling terlayani oleh sistem khusus iFLYTEK. Pengguna Mac yang mendiktekan Kanton bersih sudah memiliki Apple yang bawaan secara gratis.
Tiga Pertanyaan untuk Memilih yang Tepat
1. Seberapa banyak bahasa Inggris dalam audio Anda? Jika rekaman Anda sebagian besar merupakan Kanton bersih, tolok ukur utama adalah panduan yang adil. Jika penuh dengan bahasa Inggris di tengah kalimat — seperti kebanyakan rapat Hong Kong — prioritaskan alat yang secara khusus dibuat atau disetel untuk peralihan kode.
2. Di mana audio Anda diproses? Transkripsi cloud berarti mengunggah rekaman Anda ke server pihak ketiga. Untuk rapat sensitif, audio medis, atau hukum, pemrosesan on-device menyimpan data di ponsel atau komputer Anda.
3. Seberapa teknis Anda? Whisper, Azure, dan mesin API adalah alat pengembang. Sistem konferensi iFLYTEK adalah penerapan enterprise. Jika Anda hanya ingin membuka aplikasi, menekan rekam, dan membaca transkrip, Anda membutuhkan aplikasi konsumen yang dirancang untuk itu.
Di Mana Traverba Cocok
Traverba dibangun untuk kelompok terakhir itu — pengguna sehari-hari yang menginginkan sesuatu yang sederhana. Tanpa kunci API, tanpa akun cloud, tanpa penerapan enterprise. Anda membuka aplikasinya, dan langsung berfungsi.
Fokusnya adalah bahasa yang sebenarnya digunakan orang di Hong Kong: Kanton bercampur bahasa Inggris. Alih-alih memperlakukan bahasa Inggris sebagai sesuatu yang perlu dihilangkan, Traverba disetel pada pola tuturan lokal — bahasa Inggris di tengah kalimat, nama merek, dan slang percakapan nyata. Dan karena diproses on-device, audio Anda tetap bersama Anda, bukan diunggah ke server.
Traverba tidak mencoba menggantikan sistem konferensi enterprise atau transkripsionis manusia profesional — keduanya memiliki tempatnya masing-masing. Ini dibangun untuk momen sehari-hari di mana Kanton dan Inggris bercampur dan Anda hanya butuh teks yang dapat dibaca, cepat, di ponsel Anda sendiri.
Coba Sekarang
Traverba gratis di kedua platform — terjemahan suara, terjemahan kamera, terjemahan layar, dan terjemahan teks semuanya gratis dan tanpa batas.
Tersedia di Google Play dan App Store. Pelajari lebih lanjut di traverba.com.
Setiap alat dalam perbandingan ini unggul dalam sesuatu hal. Jika yang Anda butuhkan adalah aplikasi sederhana, on-device, yang disetel untuk bahasa Kanton-dan-Inggris Hong Kong sehari-hari, Traverba dibangun tepat untuk itu.
Angka akurasi yang dirujuk di atas berasal dari tolok ukur ASR Kanton publik pada dataset Common Voice Yue dan penelitian yang diterbitkan tentang peralihan kode Kanton-Inggris. Dukungan fitur dan bahasa mencerminkan penawaran setiap penyedia per Juni 2026 dan dapat berubah. Akurasi di dunia nyata bervariasi tergantung kualitas audio, aksen, dan jumlah bahasa Inggris dalam percakapan; kami mendorong pembaca untuk menguji alat pada audio mereka sendiri.