AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

Di cosa parla

Hanno costruito un sistema per etichettare automaticamente registrazioni audio focalizzate sui neonati in contesti domestici, affrontando problemi come pochi dati annotati, registrazioni rumorose e differenze tra famiglie. Combina un modello di riconoscimento vocale adattato con un componente leggero che considera il parlante, usa un semplice meccanismo per rendere le predizioni più coerenti nel tempo e separa la “firma” di ogni famiglia per ridurre la distorsione, permettendo l’analisi efficiente di registrazioni giornaliere molto lunghe.

Cosa permette di osservare

Permette di esplorare come far funzionare modelli audio in ambienti domestici reali: come ottenere coerenza nei risultati nel tempo, come limitare la distorsione dovuta a famiglie diverse e come lavorare con pochi dati annotati.

regolamentazionericercavoce

Dalla fonte

Recent advances in model design and self-supervised audio representations have improved speech and audio understanding, yet infant-centered naturalistic recordings remain challenging due to limited labeled data, low signal-to-noise ratio, and cross-family domain shifts. We present a family-conditioned, multi-tier audio tagger that combines a LoRA-finetuned Whisper encoder with a lightweight, target-speaker-aware Transformer for long-context inference and framewise prediction across tiers. To improve temporal coherence, we incorporate a simple sequence-level smoothing loss, and to enhance robustness across households, we introduce a factorized speaker-token design with a shared tier token and a learned family-specific offset, reducing family bias and promoting generalizable representations. Together, these choices enable efficient and effective infant-centered audio tagging of daylong au…