Asymptotic Risk Calibration for Selective Question Answering
Di cosa parla
Quando i grandi modelli linguistici forniscono risposte fluenti ma sbagliate, questo lavoro propone un metodo per decidere quali risposte accettare in modo da controllare il tasso di errore tra quelle accettate. La procedura si applica dopo che il modello ha risposto e ricalibra i suoi punteggi di fiducia, offrendo un controllo statistico che vale per insiemi molto ampi di domande. È indipendente dal modello, non richiede nuovo addestramento e, nei test, migliora il compromesso tra affidabilità delle risposte accettate e la quantità di risposte mantenute.
Cosa permette di osservare
Consente di esplorare se conviene fidarsi solo delle risposte che il sistema giudica 'sicure', come confrontare diversi modi di valutare quella fiducia e quale compromesso accettare tra maggiore affidabilità e perdita di risposte.
Dalla fonte
Large language models (LLMs) may generate fluent but incorrect answers, making uncertainty quantification important for reliable question answering. However, heuristic uncertainty scores cannot perfectly distinguish correct predictions from incorrect ones, and directly applying a fixed uncertainty threshold provides no statistical control over the error rate among accepted answers. To address this limitation, we propose A-CRC-QA, a post-hoc calibration framework for uncertainty-aware selective question answering. The proposed method reformulates selection-conditioned error control as a linear expectation constraint and applies a monotonized empirical-risk calibration procedure inspired by conformal risk control. Since the resulting instance-wise loss is generally non-monotone with respect to the acceptance threshold, our framework targets asymptotic rather than finite-sample risk contro…