AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

Redistribution-based Cost Inference Improves Sparse Safe Offline RL

Di cosa parla

Quando i supervisori segnalano solo il primo momento in cui qualcosa diventa pericoloso con un singolo 'stop', non si sa quale azione lungo la sequenza abbia causato l'errore. Il lavoro propone di ridistribuire quel segnale sui singoli momenti della traiettoria per ricavare una penalità passo‑per‑passo e addestrare una strategia più sicura su dati già raccolti; gli autori affermano che la trasformazione non perde informazioni in teoria e che nei test sulla guida e sulla manipolazione robotica riduce le violazioni rispetto ad approcci che usano solo segnali sparsi o classificatori.

Cosa permette di osservare

Permette di esplorare come trasformare segnali di sicurezza molto scarni in informazioni utilizzabili per addestrare sistemi senza provarli dal vivo, e quale modo di attribuire la responsabilità lungo la sequenza di azioni porta a comportamenti meno pericolosi quando i dati sono rumorosi o misti.

regolamentazionericercarobotica

Dalla fonte

Safe offline RL typically assumes access to dense per-step cost annotations, but in practice supervisors provide only trajectory-level stop-feedback: a binary signal at the first unsafe transition, with no per-step attribution. We frame this as a temporal credit assignment problem and propose the Redistribution-based Cost Inference (RCI) framework, which converts sparse stop-feedback into dense per-step costs via return decomposition, then trains a constrained offline policy on the augmented dataset. We show that return-equivalent redistribution preserves the feasible policy set and the optimal Lagrangian in a CMDP, establishing that the transformation is lossless in theory while yielding better-conditioned cost critic learning in practice. Experiments on highway driving and robotic manipulation demonstrate substantially lower violation rates than sparse and classifier-based baselines,…