Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder
Di cosa parla
Confucius4 è un sistema di sintesi vocale multilingue progettato per clonare una voce anche quando l'audio di esempio non ha una trascrizione. Opera in due fasi: prima trasforma il testo in una rappresentazione intermedia e poi la converte in suono; include un componente addestrabile che apprende il timbro della voce direttamente dall'audio. Gli autori rilasciano codice, modelli e demo.
Cosa permette di osservare
Permette di esplorare quanto sia pratico ricostruire una voce in lingue diverse partendo da registrazioni non trascritte e quali vantaggi o limiti emergono usando un modulo che impara il timbro dalla sola registrazione audio.
Dalla fonte
Recent advances in zero-shot text-to-speech (TTS) have substantially improved speech quality and voice cloning fidelity. However, many zero-shot TTS systems still depend on audio prompt transcripts at inference time. This dependency limits cross-lingual voice cloning, since in-the-wild reference audio is often untranscribed. In this technical report, we present Confucius4-TTS, a multilingual zero-shot TTS system that supports 14 languages and performs both intra-lingual and cross-lingual reference cloning without requiring transcripts of audio prompts. Confucius4-TTS follows a two-stage architecture, consisting of text-to-semantic (T2S) and semantic-to-acoustic (S2A) modules. The LLM-based T2S module uses a learnable speaker encoder to extract timbre features from self-supervised speech representations, and the conditional flow-matching S2A module converts the predicted semantic tokens…