APEX: Adaptive Expert Prefetching for Memory-Efficient Edge MoE Inference
Di cosa parla
APEX propone di ridurre i ritardi nell'esecuzione su dispositivi con poca memoria per modelli composti da molti "esperti" — parti del modello attivate solo per alcuni ingressi — caricando in anticipo quelli probabili prima che servano. Usa un predittore leggero per sovrapporre il caricamento con calcoli utili e offre una modalità che garantisce scelte esatte degli esperti e una modalità che evita attese accettando variazioni trascurabili nelle scelte.
Cosa permette di osservare
Permette di esplorare come bilanciare accuratezza e reattività quando si fanno girare sui dispositivi locali modelli molto grandi ma sparsi, e quali compromessi tra esattezza delle scelte interne e fluidità d'esecuzione si possono accettare.
Dalla fonte
Mixture-of-Experts (MoE) models are attractive for edge deployment because they provide high model capacity while activating only a small subset of parameters per token, improving compute efficiency. However, MoE inference at the edge is fundamentally limited by memory. Expert parameters are large and often reside in off-chip memory due to capacity, cost, and power constraints, putting expert loading to the critical path. We present APEX: Adaptive Expert Prefetching, a predictive resource management framework that overlaps expert loading with useful computation. APEX introduces a lightweight prefetch router that predicts candidate experts before the attention block to dynamically fetch additional experts using a learned confidence model. This adaptive strategy achieves over 99% overlap accuracy, significantly outperforming fixed top-k prefetching techniques. APEX supports two execution…