Hugging Face luncurkan Open TTS Leaderboard untuk model suara
Hugging Face memperkenalkan Open TTS Leaderboard, papan peringkat untuk model text-to-speech (TTS), yaitu teknologi yang mengubah teks tertulis menjadi suara. Fokusnya model sumber terbuka dan banyak bahasa. Angka dalam pengumuman ini bertanggal 30 September 2026.
Ringkasnya
- Hugging Face memperkenalkan Open TTS Leaderboard, papan peringkat model text-to-speech sumber terbuka dan multibahasa yang dinilai dengan metrik objektif.
- Penilaiannya mencakup kejelasan ucapan, kecepatan, dan kemiripan suara, dan menurut pembuatnya satu model selesai dinilai dalam beberapa jam.
- Papan ini tidak menggantikan penilaian pendengar manusia, karena kealamian dan ekspresi suara belum diukur.
Hugging Face memperkenalkan Open TTS Leaderboard, papan peringkat untuk model text-to-speech (TTS), yaitu teknologi yang mengubah teks tertulis menjadi suara. Fokusnya model sumber terbuka dan banyak bahasa. Angka dalam pengumuman ini bertanggal 30 September 2026.
Kenapa evaluasi jadi masalah
Per 30 September 2026, Hugging Face Hub memuat lebih dari 8.000 model TTS. Penilaiannya, menurut pembuat papan ini, masih terpecah dan belum terstandar.
Standar emasnya adalah penilaian preferensi manusia seperti MOS atau MUSHRA. Sejumlah papan peringkat berbentuk arena memakainya. Pengguna mendengar hasil dari dua model, memilih satu, lalu suara terkumpul dihitung menjadi skor Elo.
Menurut sumber, cara ini sulit mengimbangi laju rilis model. Dari 92 model di Artificial Analysis, hanya 16 (sekitar seperenamnya) yang berbobot terbuka. Penyebab yang disebut: model berbasis API cukup didaftarkan dengan kunci API, sedangkan model terbuka harus dipasang dan dijalankan sendiri oleh pengelola arena. Konsistensi pemilih dari waktu ke waktu juga tidak bisa dijamin.
Apa yang diukur
Open TTS Leaderboard memakai tiga kelompok metrik objektif:
- Kejelasan ucapan: tingkat kesalahan kata (WER) atau karakter (CER). Audio hasil model ditranskripsi ulang dengan Qwen3 ASR, lalu dibandingkan dengan teks awal.
- Kecepatan: RTFx untuk pemrosesan massal, dan TTFA, yaitu waktu tunggu sampai potongan audio pertama bisa diputar. Keduanya diukur pada GPU H200, dan TTFA juga pada CPU untuk sebagian kecil model.
- Kemiripan suara: skor SIM antara suara hasil model dan klip rujukan, relevan untuk fitur kloning suara.
Menurut pembuatnya, waktu evaluasi satu model turun dari beberapa minggu (mengumpulkan suara) menjadi beberapa jam. Ini klaim pembuat papan.
Yang sudah terlihat
Urutan bawaan memakai rata-rata WER bahasa Inggris pada dua himpunan data, Seed TTS Eval dan CV3 Eval. Di posisi teratas ada hexgrad/Kokoro-82M, Supertone/supertonic-3, dan fishaudio/s2-pro. Untuk multibahasa, sumber menyebut k2-fsa/OmniVoice, fishaudio/s2-pro, dan FunAudioLLM/Fun-CosyVoice3-0.5B-2512 sebagai model yang kuat.
Pada mode kloning suara, WER rata-rata bosonai/higgs-tts-3-4b dan openbmb/VoxCPM2 membaik saat audio rujukan diberikan. Di tab streaming, kyutai/pocket-tts disebut baik di GPU maupun CPU.
Yang belum kita ketahui
Sumber menegaskan bahwa WER dan SIM tidak langsung mengukur kealamian, ekspresi, atau preferensi pendengar. Hasilnya pun berasal dari tim pembuat sendiri dan belum tentu sudah diuji pihak independen. Daftar bahasa yang tercakup tidak dirinci di sumber. Skrip evaluasi disebut akan dibuka dalam waktu dekat, tanpa tanggal pasti.
Detail lengkap ada di blog Hugging Face.
Apa artinya buat kamu?
Dampak langsungnya kecil. Papan ini alat bantu untuk pengembang, jadi tidak ada yang berubah di ponselmu dalam waktu dekat. Sumber juga tidak menyebut seberapa baik bahasa Indonesia tercakup.
Tapi ini bisa menjadi sinyal bahwa cara menilai suara buatan sedang dirapikan. Kalau kamu memakai asisten suara, video berdubbing AI, atau layanan pembaca teks, kualitas di balik layar mulai lebih mudah dibandingkan. Dalam jangka lebih panjang, itu mungkin membantu pengembang memilih model.
Yang bisa kamu lakukan: saat menemukan layanan suara AI, dengarkan sendiri hasilnya dan jangan hanya percaya angka.
Kalau angka bisa mengukur kejelasan tetapi belum kealamian, apa yang paling kamu pedulikan dari sebuah suara buatan?
Coba sendiri
- Buka papan peringkat Open TTS Leaderboard lewat tautan di blog Hugging Face.
- Pilih tab Listen, lalu pilih bahasa atau himpunan data, dan tentukan apakah ingin membandingkan kloning suara.
- Dengarkan keluaran beberapa model, atau biarkan sistem memilih acak.
- Untuk memberi suara atau umpan balik, sumber meminta kamu masuk dengan akun Hugging Face. Biaya dan ketersediaan per wilayah tidak disebut sumber.
Sumber
Artikel ini disusun dengan bantuan AI oleh Orion, persona AI Nadi, lalu diperiksa dan disunting oleh redaksi manusia sebelum terbit. Baca cara kerja kami di Kebijakan Redaksi.