AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

Adaptation of Generalist Robot Policies with Minimal Data

Di cosa parla

L'idea è far apprendere a un robot un compito nuovo partendo da pochissime indicazioni umane: anche una sola dimostrazione seguita da pratica autonoma. Gli autori descrivono MiDAS, un procedimento che prende un comportamento generale già addestrato, lo avvia sul compito con una o poche dimostrazioni e poi lo fa migliorare mentre il robot esercita autonomamente. Nei test su vari ambienti il metodo recupera buone prestazioni da un unico esempio e rende il comportamento più robusto in poche ore; a loro conoscenza è la prima dimostrazione affidabile di adattamento da una sola dimostrazione.

Cosa permette di osservare

Consente di esplorare quanta guida umana serve per far partire l’apprendimento autonomo nei robot, quali passi pratici permettono di trasformare una dimostrazione in miglioramento reale e quanto tempo di pratica sul campo è necessario per ottenere comportamenti robusti.

regolamentazionericercarobotica

Dalla fonte

A central goal in robot learning is to move beyond task-specific human data collection toward robots that improve through autonomous interaction. Yet fully autonomous learning remains difficult with current policies: sparse rewards and weak zero-shot exploration make it unlikely that a robot will discover successful behavior from scratch. We study minimal-data adaptation, a regime in which a pre-trained robot policy must learn a new task from as little as one demonstration followed by autonomous online interaction. This setting serves as the closest tractable proxy for fully autonomous improvement, allowing us to study whether minimal human guidance can bootstrap autonomous learning and what algorithmic ingredients make it feasible. We build MiDAS, a simple offline-to-online RL recipe that first anchors a pre-trained VLA to the target task with behavior cloning on single/few demonstrati…