Marco-Voice Technical Report
Di cosa parla
Si descrive un sistema per creare voce sintetica che unisce clonazione della voce e controllo delle emozioni in un unico strumento. L'approccio insegna al modello a separare l'identità del parlante dall'espressione emotiva, permettendo di cambiare tono ed emozione senza perdere la caratteristica vocale. Gli autori presentano anche un nuovo corpus di registrazioni emotive in mandarino e rendono disponibili codice e dati.
Cosa permette di osservare
Consente di esplorare come si può ottenere una voce sintetica che mantiene l'identità del parlante pur variando l'emozione, e quali scelte emergono nel rendere strumenti e raccolte di voce aperti per ricerca e regolamentazione.
Dalla fonte
This paper presents a multifunctional speech synthesis system that integrates voice cloning and emotion control speech synthesis within a unified framework. The goal of this work is to address longstanding challenges in achieving highly expressive, controllable, and natural speech generation that faithfully preserves speaker identity across diverse linguistic and emotional contexts. Our approach introduces an effective speaker-emotion disentanglement mechanism with in-batch contrastive learning, enabling independent manipulation of speaker identity and eemotional style, as well as rotational emotional embedding integration method for smooth emotion control. To support comprehensive training and evaluation, we construct CSEMOTIONS, a high-quality emotional speech dataset containing 10 hours of Mandarin speech from six professional speakers across seven emotional categories. Extensive exp…