AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
contenuto · NVIDIA Developer

Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference

Di cosa parla

Si esplora come riprogettare insieme il modo in cui i modelli “guardano” il testo (attenzione, cioè come il modello valuta e pesa parti diverse di una lunga conversazione o documento) e il sistema che li esegue, per ottenere risposte più rapide con contesti molto lunghi. Il problema è che, man mano che conversazioni e compiti con contesti estesi diventano comuni, questo meccanismo di attenzione occupa una quota crescente del tempo di calcolo e rallenta l’interazione.

Cosa permette di osservare

Consente di approfondire quali scelte di progettazione del modello e dell’ambiente di esecuzione possono migliorare la velocità e l’esperienza interattiva quando si lavora con conversazioni o documenti molto lunghi.

agentiregolamentazione

Dalla fonte

As agentic and long-context workloads become common, the context lengths increase and attention consumes a larger share of inference time (Figure 1). Because...