AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

Diffusion-Guided Cooperative Policy Learning for Target Tracking Based on Underwater Mobile Agent Networks

Di cosa parla

Un gruppo di veicoli sottomarini autonomi viene addestrato a inseguire un bersaglio cooperando. Il lavoro affronta tre problemi pratici: i comportamenti che cambiano mentre i robot si aggiornano a vicenda; la qualità varia delle esperienze raccolte durante l’esplorazione; e la discrepanza tra azioni provate in fase di apprendimento e azioni eseguite in condizioni reali con disturbi marini. Per risolverli propongono un’architettura a più livelli e un algoritmo che combina un ramo generativo basato sulla “diffusione” (cioè una tecnica che crea proposte immaginando azioni) con un controllore più stabile, filtra le esperienze migliori per guidare la generazione e trasferisce le azioni immaginate al controllore per allineare esplorazione ed esecuzione.

Cosa permette di osservare

Permette di esplorare se e come un approccio che mescola “immaginazione” guidata da esempi e controllo deterministico può rendere l’apprendimento collettivo di robot più coerente e affidabile in ambienti sottomarini incerti.

agentiimmaginiregolamentazionericerca

Dalla fonte

Multi-agent reinforcement learning (MARL) provides a promising solution for cooperative target tracking in networks of autonomous underwater vehicles (AUVs). However, existing methods still face three major challenges: 1) policy non-stationarity caused by concurrent updates among multiple agents; 2) inefficient policy learning caused by the heterogeneous quality of experiences accumulated during exploration; and 3) policy drift between stochastic exploration and deterministic execution under dynamic underwater disturbances. To address these challenges, this paper develops a four-layer hierarchical MARL architecture comprising global training scheduling, multi-agent coordination, local policy generation, and real-time action execution. Building on this architecture, we propose a Supervised Diffusion-Aided MARL (SDA-MARL) algorithm with three closely coupled mechanisms. First, a dual-deci…