Accelerating Time Series Foundation Models with Speculative Decoding
Di cosa parla
Propongono di accelerare le previsioni su serie temporali facendo prima generare a un modello economico più passi futuri in blocco e poi lasciando a un modello grande il compito di verificarli tutti insieme, correggendo il primo errore rilevato. L'idea affronta il problema per cui prevedere molti passi in avanti costringe il modello potente a calcolare ogni passo uno dopo l'altro, rallentando molto. Gli autori adattano a dati continui una tecnica già usata nei grandi modelli di linguaggio e forniscono analisi e test che mostrano guadagni di velocità mantenendo la qualità delle previsioni.
Cosa permette di osservare
Permette di esplorare fino a che punto si può velocizzare la generazione di previsioni mantenendo una qualità simile, e di capire quali architetture di modelli permettono di verificare più passi in un'unica passata o, al contrario, quando questa strategia non conviene.
Dalla fonte
Time series forecasting drives operational decisions under tight latency budgets, and autoregressive time series foundation models (TSFMs) increasingly deliver the most accurate forecasts. That accuracy is paid for at inference, since a horizon of $H$ steps takes $\lceil H / P\rceil$ sequential forward passes of a large model, so latency grows with exactly the long horizons these models are prized for. Yet a far cheaper model predicts most next patches nearly as well as the large one, and causal models can verify a block of future patches in one parallel pass even though they generate them one at a time. These are precisely the conditions under which speculative decoding thrives in LLMs, but its ingredients are all defined over discrete vocabularies. We therefore develop speculative decoding for continuous patch autoregression. A cheap draft proposes $K$ future patches, and the target v…