AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

Di cosa parla

Usano un controllore esperto eseguito in simulazione per generare grandi insiemi di dimostrazioni, così un agente può imparare solo dai segnali di successo rari invece di richiedere complessi interventi manuali per definire le ricompense. Integrando questo apprendimento con un controllore a basso livello che mantiene l’equilibrio, ottengono comportamenti allineati agli obiettivi del compito e in alcuni casi superiori al "maestro". Hanno poi trasferito il metodo dai simulatori a robot reali con forme diverse.

Cosa permette di osservare

Consente di esplorare se dati prodotti automaticamente in simulazione possono ridurre il lavoro manuale nella preparazione dei robot per compiti combinati di movimento e manipolazione, e se questa strategia funziona anche quando si passa al robot reale.

agentiregolamentazionericercarobotica

Dalla fonte

Integrating locomotion and manipulation is essential for robot autonomy, but scaling standard Reinforcement Learning (RL) to complex tasks is severely bottlenecked by the slow, manual process of dense reward shaping. To bypass this limitation, we leverage Sample-based Model Predictive Control (SMPC) entirely in simulation as an automated, rapidly tunable expert to generate massive offline datasets. Because this data solves the fundamental exploration problem, we can train an off-policy RL agent using purely sparse task rewards, drastically reducing the time required to learn new skills and eliminating the need for manual tuning. Integrating this high-level agent with a low-level dynamic stability controller yields more optimal behaviors that strictly align with true task objectives, ultimately allowing the learned policies to surpass the original optimal control teacher. We validate the…