MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques
Di cosa parla
MuseCritic è un sistema che valuta canzoni intere in modo leggibile: prima genera una critica in linguaggio naturale su cinque aspetti estetici della canzone e poi trasforma quella critica in punteggi numerici usati per guidare la generazione musicale. Il modello viene addestrato in due fasi — un insegnante fornisce critiche di riferimento e poi il modello impara anche dalle proprie critiche per ridurre la discrepanza tra addestramento e uso — e i test mostrano che così si ottengono valutazioni più accurate e che questo segnale aiuta a migliorare la generazione delle tracce.
Cosa permette di osservare
Puoi esplorare come spiegazioni umane‑leggibili possano rendere più interpretabili e affidabili le valutazioni automatiche di brani musicali e come una formazione a due fasi affronti la discrepanza tra i dati usati per addestrare il modello e quelli incontrati nel suo uso reale.
Dalla fonte
Long-form song generation models continue to improve in duration, structural integrity, and acoustic complexity, making reliable aesthetic rewards increasingly important for aligning these models with human preferences. However, reward models for complete songs remain limited, and existing evaluators typically predict scores in a single forward pass without providing readable explanations. We introduce MUSECRITIC, a semi-scalar reward model that generates a natural-language critique covering five aesthetic dimensions and uses it as an intermediate representation to predict continuous reward scores. MUSECRITIC follows a two-stage training pipeline: a teacher model first provides high-quality critiques for supervised fine-tuning, after which the fine-tuned model generates its own critiques for reward learning, mitigating distribution shift between training and inference. On an in-domain t…