MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning
Di cosa parla
MOON cambia il modo in cui si aggiornano i parametri nei modelli che apprendono più compiti insieme: invece di appiattire le matrici in vettori, tiene conto della loro struttura a matrice e applica aggiornamenti ortonormalizzati, cioè resi perpendicolari tra loro e con lunghezza uniforme. L'idea è ridurre i conflitti tra compiti ottenendo direzioni di aggiornamento più efficaci; gli autori forniscono risultati teorici sulla convergenza, esperimenti che mostrano miglioramenti e rilasciano il codice.
Cosa permette di osservare
Permette di esplorare se rispettare la forma a matrice dei parametri e usare aggiornamenti ortonormalizzati può rendere più efficiente l'addestramento nei modelli multitask, e quali scelte pratiche aiutano a bilanciare compiti in conflitto senza peggiorare le prestazioni complessive.
Dalla fonte
Multi-objective optimization (MOO) has demonstrated significant success in multi-task learning by mitigating task conflicts through gradient manipulation. However, most existing methods flatten model parameters into vectors and perform gradient manipulation under Euclidean geometry, thereby overlooking the matrix structure prevalent in modern architectures such as Transformers. In this paper, we show that gradient manipulation in Euclidean space does not generally yield the steepest descent direction under matrix geometry, potentially limiting optimization efficiency. Drawing from the theory of steepest descent for matrix-valued parameters, we propose MOON (Multi-Objective OrthoNormalized Updates), which performs gradient manipulation under spectral--nuclear norm geometry and uses the orthonormalized manipulated gradient for parameter updates. Theoretically, for smooth non-convex object…