AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

Di cosa parla

RT-SEMamba è un sistema per migliorare la qualità della voce che funziona in tempo reale, cioè elabora l’audio man mano che arriva. Al posto di accumulare sempre più memoria, ogni strato del modello conserva uno stato di dimensione fissa, permettendo di trattare audio di lunga durata in modo efficiente. I ricercatori comprimono un modello profondo in uno molto più leggero insegnando al modello piccolo a imitare sia l’uscita sonora che le rappresentazioni intermedie del modello grande.

Cosa permette di osservare

Il lavoro permette di esplorare se si può ridurre molto la complessità dei modelli per il miglioramento vocale senza perdere qualità, e quale sia il compromesso pratico tra qualità audio, velocità di esecuzione e uso di memoria quando si lavora in tempo reale.

hardwareregolamentazionericercavoce

Dalla fonte

We present RT-SEMamba, a fully causal speech enhancement (SE) model built upon causal time-frequency Mamba blocks. Unlike Transformer-based architectures that rely on a growing key-value cache, Mamba propagates a fixed-size recurrent state per layer, enabling memory- and bandwidth-efficient long-form inference. We further introduce a progressive knowledge distillation (KD) strategy that compresses an 8-layer teacher into a shallow 1-layer student by jointly distilling complex spectral outputs and intermediate representations. On Voicebank-DEMAND, the 8-layer RT-SEMamba achieves 3.32 PESQ with a 25 ms algorithmic latency constraint, and the distilled 1-layer student improves over a naive 1-layer baseline from 3.06 to 3.18 PESQ while preserving the same steady-state RTF, delivering a 2.75x speedup over the teacher. These results demonstrate that state-space models with progressive KD prov…