Reducing Per-Sample Interference in Stochastic Optimization
Di cosa parla
Durante l'addestramento, gli aggiornamenti calcolati su gruppi di esempi possono talvolta aumentare l’errore su singoli campioni: questo fenomeno viene chiamato “per-sample interference” (interferenza per campione). Gli autori propongono di ridisegnare l’aggiornamento dei pesi come un piccolo problema che minimizza quell’interferenza e offrono un’approssimazione efficiente che lavora sull’ultimo strato della rete, perché lì si trovano informazioni rappresentative del comportamento complessivo. La procedura si integra nelle pratiche di ottimizzazione standard e mostra costi relativi che diminuiscono al crescere del modello o dei dati.
Cosa permette di osservare
Consente di esplorare se e come intervenire sugli aggiornamenti per singolo campione può migliorare la capacità di generalizzare dei modelli e quali compromessi comporta in termini di tempo e risorse dell’addestramento.
Dalla fonte
Modern optimizers combine gradients from the current mini-batch with historical optimization state, such as momentum or adaptive moments. While effective, this standard practice can produce parameter updates that actively increase the loss of individual samples. We term this phenomenon per-sample interference and propose redefining the parameter update as an optimization problem that explicitly minimizes it. Because the exact formulation of the problem is computationally prohibitive, we introduce a highly efficient surrogate. By reducing the problem's dimensionality to the batch size and restricting the optimization to the last linear layer, we overcome memory and speed bottlenecks. This strategy hinges on our unexpected finding that this layer alone can reliably capture core second-order statistics of the full network. The resulting surrogate problem integrates readily into standard op…