Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference
Di cosa parla
Si esplora come riprogettare insieme il modo in cui i modelli “guardano” il testo (attenzione, cioè come il modello valuta e pesa parti diverse di una lunga conversazione o documento) e il sistema che li esegue, per ottenere risposte più rapide con contesti molto lunghi. Il problema è che, man mano che conversazioni e compiti con contesti estesi diventano comuni, questo meccanismo di attenzione occupa una quota crescente del tempo di calcolo e rallenta l’interazione.
Cosa permette di osservare
Consente di approfondire quali scelte di progettazione del modello e dell’ambiente di esecuzione possono migliorare la velocità e l’esperienza interattiva quando si lavora con conversazioni o documenti molto lunghi.
Dalla fonte
As agentic and long-context workloads become common, the context lengths increase and attention consumes a larger share of inference time (Figure 1). Because...