Synthetic Data Generation for Financial AI Research with NVIDIA NeMo
Di cosa parla
Si esplora l'uso di testi finanziari sintetici per migliorare l'addestramento di grandi modelli che analizzano notizie e documenti economici. L'idea è creare esempi artificiali per colmare la scarsità e lo squilibrio dei dati reali: molte fonti danno troppo risalto a certi temi, come le comunicazioni sugli utili, e questo distorce i dataset usati per l'addestramento.
Cosa permette di osservare
Consente di valutare se i dati sintetici possono ridurre la carenza e la sovrarappresentazione di alcuni argomenti nelle raccolte finanziarie, e quali scelte servono per rendere quei testi artificiali credibili e rappresentativi.
Dalla fonte
Fine-tuning LLMs for financial natural language processing (NLP) is constrained by limited, imbalanced data. Real-world financial news overrepresents earnings...