AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

Di cosa parla

LoRAQuant è una tecnica per ridurre lo spazio occupato dagli adattatori usati per personalizzare i grandi modelli di linguaggio. Scompone ogni adattatore in modo da concentrare l’informazione più rilevante in alcune righe e colonne, poi rappresenta quelle parti con maggiore precisione e il resto con precisione molto bassa. L’obiettivo è mantenere le prestazioni mentre si abbassa il costo complessivo quando molti adattatori vengono caricati insieme.

Cosa permette di osservare

Permette di esplorare come bilanciare personalizzazione del modello e costi di memoria: quali parti degli adattatori conviene preservare più accurate e quando è possibile usare rappresentazioni meno precise senza perdere qualità, in compiti come ragionamento matematico, programmazione e sintesi.

modelli linguisticiregolamentazionericerca

Dalla fonte

Low-Rank Adaptation (LoRA) has become a popular technique for parameter-efficient fine-tuning of large language models (LLMs). In many real-world scenarios, multiple adapters are loaded simultaneously to enable LLM customization for personalized user experiences or to support a diverse range of tasks. Although each adapter is lightweight in isolation, their aggregate cost becomes substantial at scale. To address this, we propose LoRAQuant, a mixed-precision post-training quantization method tailored to LoRA. Specifically, LoRAQuant reparameterizes each adapter by singular value decomposition (SVD) to concentrate the most important information into specific rows and columns. This makes it possible to quantize the important components to higher precision, while quantizing the rest to ultra-low bitwidth. We conduct comprehensive experiments with LLaMA 2-7B, LLaMA 2-13B, and Mistral 7B mode…