AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)

Di cosa parla

C-Guard usa una "griglia di costituzione" per generare dati di addestramento per un guardiano di sicurezza basato sull'apprendimento per rinforzo, ovvero un sistema che impara per tentativi ed errori. Mira a gestire il conflitto tra intercettare contenuti dannosi e non respingere richieste innocue. C-LIM assegna a ogni cella un punteggio che decide se eliminarla, arricchirla, modificarla o estenderla, individuando dati inutili prima di spendere risorse. Codice e costituzione sono open-source.

Cosa permette di osservare

Permette di esplorare se organizzare regole in una griglia e valutare l'utilità di ciascuna parte può rendere l'addestramento dei guardiani di sicurezza più efficiente e come scegliere quali esempi tenere, modificare o scartare.

open sourceregolamentazionericercasicurezza

Dalla fonte

Conflicting objectives are general in RL alignment, and training on them data-efficiently is hard. Training a safety guard with RL means optimizing two objectives that conflict: catch real harm, and do not refuse benign prompts. Our finding is that over-refusal improves 22.4% to 12.8%, while under-refusal on adversarial attacks silently worsens 0.27 to 0.33. We present C-Guard, a constitution-grid instrument that generates the RL training data, and C-LIM, a per-cell learnability score that decides each cell's move: prune, densify, amend, expand. C-LIM flags the dead-weight data region before any training budget is spent: 187 untargeted rows had bought zero gain, and our method lifts the same region's learning impact 0.733 to 0.80. Code and the constitution are open-sourced.