AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation

Di cosa parla

Si propone un modo per velocizzare l'addestramento asincrono dei grandi modelli linguistici che usano apprendimento per rinforzo (una tecnica in cui il modello impara da feedback simile a premi): invece di calcolare esplicitamente una “politica di riferimento” a ogni passo — una copia che serve a mantenere gli aggiornamenti stabili — la sostituiscono con un’approssimazione semplice basata su interpolazione. L'approccio elimina il calcolo aggiuntivo che rallenta l'addestramento e il codice è stato reso disponibile nel sistema open-source AReaL.

Cosa permette di osservare

Permette di esplorare il bilanciamento tra stabilità degli aggiornamenti e costi di calcolo nell'addestramento di grandi modelli con rinforzo, e di valutare se approssimazioni semplici possono sostituire calcoli espliciti mantenendo prestazioni comparabili.

modelli linguisticiopen sourceregolamentazionericerca

Dalla fonte

Decoupled PPO has been a successful reinforcement learning (RL) algorithm to deal with the high data staleness under the asynchronous RL setting. Decoupled loss used in decoupled PPO improves coupled-loss style of algorithms' (e.g., standard PPO, GRPO) learning stability by introducing a proximal policy to decouple the off-policy correction (importance weight) from the policy update constraint (trust region). However, the proximal policy requires an extra forward pass through the model at each training step, creating a computational overhead for large language models training. We observe that since the proximal policy only serves as a trust region anchor between the behavior and target policies, we can approximate it through simple interpolation without explicit computation. We call this approach A-3PO (APproximated Proximal Policy Optimization). A-3PO eliminates this overhead, accelera…