AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

Di cosa parla

Molti servizi che usano grandi modelli fanno passaggi brevi e ripetitivi tra il modello e strumenti esterni per decidere il passo successivo. Qui si chiede quando quelle piccole operazioni possono essere eseguite direttamente sulla scheda grafica senza tornare al processore principale e cosa cambia se la decisione rimane sul dispositivo: gli autori definiscono il confine tra i gruppi di lavoro “pronti” e confrontano meccanismi che mantengono la decisione sul dispositivo, trovando che questa via è più veloce nelle configurazioni testate e che due condizioni misurabili ne determinano il successo.

Cosa permette di osservare

Consente di esplorare se conviene lasciare le decisioni direttamente sulla scheda grafica per evitare il ritorno al processore principale e come capire se c’è abbastanza lavoro pronto entro i vincoli temporali; aiuta anche a valutare dove collocare l’osservazione o la decisione nel sistema.

agentihardwaremodelli linguisticiregolamentazionericerca

Dalla fonte

LLM-agent services repeatedly execute small deterministic transitions between model and tool calls: route an outcome, update state, and emit the next effect. We ask when this control path exposes enough concurrent work for GPU execution, and what changes when a GPU-computed route decision remains on device. We formalize the ready-cohort boundary using fixed-partition share F, exact offline share P*, local upper bound U, and online achieved share A. Under zero service time, unlimited capacity, and equal relative launch deadlines, a specialized dynamic program computes P* exactly. In a stationary Poisson replay of one pinned 851-session public trace panel, the primary condition at 100,000 target active sessions, K=256, and a 50 ms launch deadline gives F=30.19%, P*=43.00%, and U=45.85%. Exact packing recovers 81.83% of the opportunity lost at fixed window boundaries. The outcome-derived r…