RL without TD learning
Di cosa parla
Si propone un modo diverso per far imparare agenti che apprendono da dati registrati: invece di aggiornare il valore passo dopo passo, si spezza una lunga esperienza in segmenti, si valuta ogni segmento e si ricombina il risultato. Gli autori presentano un algoritmo pratico chiamato Transitive RL, pensato per compiti in cui l’obiettivo è raggiungere uno stato da un altro; sfrutta sotto‑obiettivi trovati nelle traiettorie registrate e una selezione più morbida per limitare errori e scalare a orizzonti molto lunghi.
Cosa permette di osservare
Il lavoro apre la domanda se questa strategia di “dividi e conquista” possa essere applicata anche a compiti con ricompense generiche o in ambienti imprevedibili, e su come individuare i sotto‑obiettivi migliori quando lo spazio degli stati è molto grande.
Dalla fonte
In this post, I’ll introduce a reinforcement learning (RL) algorithm based on an “alternative” paradigm: divide and conquer . Unlike traditional methods, this algorithm is not based on temporal difference (TD) learning (which has scalability challenges ), and scales well to long-horizon tasks. We can do Reinforcement Learning (RL) based on divide and conquer, instead of temporal difference (TD) learning. Problem setting: off-policy RL Our problem setting is off-policy RL . Let’s briefly review what this means. There are two classes of algorithms in RL: on-policy RL and off-policy RL. On-policy RL means we can only use fresh data collected by the current policy. In other words, we have to throw away old data each time we update the policy. Algorithms like PPO and GRPO (and policy gradient methods in general) belong to this category. Off-policy RL means we don’t have this restriction: we…