AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

Di cosa parla

Quando si allena un grande modello linguistico su un singolo computer con memoria e larghezza di banda limitate, diventa cruciale decidere cosa tenere in memoria, cosa ricalcolare e quando trasferire i dati. LazyTrain è uno strato di ottimizzazione che traduce queste decisioni in un problema di pianificazione e poi applica la strategia durante l’addestramento; inoltre comprime lo stato dell’ottimizzatore usando numeri meno precisi e aggiunge una tecnica veloce per gestire gli aggiornamenti, in modo da ridurre l’uso di memoria. Nei test su diversi modelli e schede grafiche, LazyTrain ha riportato miglioramenti rispetto ai metodi confrontati; il codice è disponibile su GitHub.

Cosa permette di osservare

Ti permette di esplorare fino a che punto si può addestrare un grande modello su hardware limitato bilanciando memoria, trasferimenti e ricalcoli, e come la compressione dello stato dell’ottimizzatore influisce su questi compromessi.

hardwaremodelli linguisticiopen sourceregolamentazionericerca

Dalla fonte

Training large language models on limited hardware is increasingly a scheduling problem across GPU compute, host memory, PCIe transfer, and storage bandwidth. Existing offloading systems reduce GPU residency, and MegaTrain shows that a CPU-master layer-streaming executor can train large models on a single GPU, but fixed checkpointing and placement heuristics still leave communication exposed on the critical path. We propose LazyTrain, an optimization layer over a layer-streaming executor. LazyTrain formulates checkpoint selection, activation placement, recomputation, and CPU-GPU-NVMe communication overlap as a mixed-integer scheduling problem, then executes the solved policy during training. It further couples 8-bit optimizer states with fast gradient clipping as a single Hybrid 8-bit operator: state compression reduces optimizer-state memory, while fast clipping counteracts the additio…