Tacotron2 (DCA + DDC + guided attention) + PC-NSF-HiFiGAN
Bhante A — chanting Pāli

Satu halaman: kesehatan training di atas, komparasi audio di bawah.
memuat status training…

Komparasi audio — A. Asli · B. Non Commercial · C. for Commercial

A · ASLI Rekaman asli Bhante A — ini target yang ingin ditiru. Tak ada pada baris “teks baru” karena teks itu memang belum pernah direkam.
B · VOCODER NON COMMERCIAL Model akustik Tacotron2 (DCA + DDC + guided attention) → vocoder PC-NSF-HiFiGAN hasil finetune dari bobot openvpi (GTA). Kualitas terbaik yang kita punya, dipakai sebagai patokan. Tak boleh dipakai produksi — bobot dasarnya berlisensi CC BY-NC-SA (nonkomersial, menular ke turunan).
C · VOCODER FOR COMMERCIAL Model akustik sama persis → vocoder PC-NSF-HiFiGAN from scratch (dilatih dari nol memakai data sendiri, 200k step, lalu GTA). Boleh dipakai produksi — lisensi MIT, bebas komersial. Inilah kandidat yang sedang dikejar agar setara B.
Catatan: B dan C memakai mel yang SAMA PERSIS dari model akustik — yang berbeda hanya vocodernya. Jadi selisih apa pun yang terdengar antara B dan C murni berasal dari vocoder, bukan dari model. Angka timbre/melodi = kemiripan terhadap A (makin tinggi makin mirip), tapi metrik ini tumpul untuk chanting — telinga tetap hakim utamanya.
memuat…