AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models

Di cosa parla

CurveFP propone una nuova famiglia di formati numerici pensata per i modelli linguistici: ripensa come si rappresentano i numeri e come si eseguono le moltiplicazioni per ridurre errori e occupazione durante addestramento e uso. I test su diversi modelli mostrano qualità paragonabile o migliore con una rappresentazione più compatta e una riduzione degli errori di calcolo, mentre l'effettiva efficienza a livello di sistema resta da verificare.

Cosa permette di osservare

Permette di esplorare se ripensare insieme la rappresentazione dei numeri e le regole di moltiplicazione può abbassare risorse e rumore numerico nei modelli linguistici, e quali compromessi restano da valutare nelle implementazioni e nell’efficienza di sistema.

modelli linguisticiregolamentazionericerca

Dalla fonte

Low-precision formats usually optimize scalar fidelity while inheriting conventional product arithmetic. We introduce CurveFP, a block-scaled family that distributes magnitudes across interleaved logarithmic curves. Uniform curve indices make every nonzero product an exact sign and integer-index update, while a rational radix exposes the finite phase schedule required for accumulation. We instantiate the algebra as CurveFP8 E4C3/E5C2 for training and CurveFP7 E3C3 for compact inference. On four 7B-9B models, CurveFP7 beats tensorwise FP8 perplexity with one fewer element bit and stays within 1.32% of native quality. CurveFP8 lowers error in all 36 paired training-GEMM comparisons. Across three matched 3B-token pretraining triplets, it reaches mean BF16-inference perplexity 22.5366 versus 22.5407 for FP8 and has a lower format penalty in every seed. Downstream evaluation shows transfer p…