AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

AWARe: Mitigating Catastrophic Forgetting via Activation-Weighted Adaptive REtention

Di cosa parla

I grandi modelli multimodali spesso «dimenticano» capacità acquisite quando vengono riadattati a nuovi compiti: gli aggiornamenti per il nuovo compito sovrascrivono parti importanti del modello. AWARe calcola quanto si attivano le diverse parti del modello (cioè quanto si «accendono») e usa questi punteggi per limitare gli aggiornamenti delle parti essenziali, permettendo al resto di adattarsi; non richiede cambi nella struttura del modello.

Cosa permette di osservare

Permette di esplorare come riadattare grandi modelli a nuovi compiti senza perdere abilità già apprese e quali strategie interne di aggiornamento bilanciano conservazione e adattamento. Tocca anche la praticità: la soluzione è pensata per funzionare con gli strumenti già usati per mettere in funzione il modello.

modelli linguisticiopen sourceregolamentazionericerca

Dalla fonte

Multimodal Large Language Models (MLLMs) exhibit strong generalization and reasoning abilities due to large-scale multimodal pre-training. However, fine-tuning these models on downstream tasks often leads to catastrophic forgetting, where newly learned task-specific knowledge degrades previously acquired capabilities. This issue arises because gradient updates for new tasks overwrite parameters critical to prior knowledge, limiting the practical deployment of MLLMs. To address this challenge, we propose Activation-Weighted Adaptive REtention (AWARe), a fine-tuning method that mitigates catastrophic forgetting by dynamically controlling parameter updates based on activation patterns. AWARe assigns activation-based importance scores to parameters, selectively freezing those essential for preserving prior capabilities while allowing less important parameters to adapt to new tasks. Importan…