Gloss-Free Representation Learning for Cross-Dataset Sign Spotting
Di cosa parla
Si sfruttano video di telegiornali con i loro transcript per addestrare un sistema che riconosca segni della lingua dei segni turca senza usare costose etichette manuali. Al posto delle annotazioni si creano etichette proxy dai testi parlati e si confronta la normalizzazione basata su regole con quella assistita da un moderno modello di testo, per verificare se si ottengono rappresentazioni riutilizzabili su altri dati.
Cosa permette di osservare
Permette di esplorare se dati di trasmissione poco allineati ai testi possono rimpiazzare annotazioni manuali per imparare rappresentazioni trasferibili della lingua dei segni, e se la normalizzazione automatica del linguaggio con un modello di testo supera approcci basati su regole.
Dalla fonte
Sign-language research for resource-constrained languages is often limited by the cost of dense linguistic labels such as glosses, temporal boundaries, and sign order. Broadcast news offers a practical alternative by pairing continuous signing with spoken-language transcripts, but this supervision is weak since text and signing are loosely aligned. Morphologically rich languages such as Turkish add further difficulty, as the same lexical meaning can appear in many inflected forms while some derived forms should remain distinct. We study whether weak transcript-based supervision can pretrain a reusable sign encoder in this setting, where poor text normalization can fragment pseudo-gloss targets and weaken representation learning. Unlike prior pseudo-gloss pipelines designed mainly to improve translation, we test whether the pretrained encoder transfers as a reusable representation for cr…