AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

Di cosa parla

Hanno messo a punto un modo per insegnare ai grandi modelli multimodali a leggere e capire testi nelle immagini in molte lingue, anche quando il testo è piccolo, degradato, coperto o scritto a mano. Il metodo migliora la lettura senza usare uno strumento esterno per riconoscere il testo durante l'uso, tramite molta formazione mirata e prompt che guidano il modello a ragionare; i test mostrano meno errori, meno allucinazioni e traduzioni più accurate.

Cosa permette di osservare

Consente di esplorare se i modelli possono diventare autosufficienti nella lettura multilingue delle immagini senza strumenti esterni e quale sia il peso dei grandi insiemi di dati mirati rispetto ai prompt che guidano il ragionamento.

modelli linguisticiregolamentazionericerca

Dalla fonte

Optical character recognition (OCR) and multilingual scene-text understanding remain challenging for multimodal large language models (MLLMs), particularly in real-world images containing small or degraded text, cluttered layouts, occlusion, handwriting, and complex typography. We present an OCR-aware multilingual post-training framework that improves visual-text grounding in a general-purpose MLLM without requiring an external OCR engine, OCR-extracted text, or text bounding boxes at inference time. The framework combines large-scale multilingual OCR supervision, approximately 5M additional multilingual training samples, controlled synthetic OCR generation and in-image text translation, LoRA-based supervised fine-tuning (SFT), and lightweight OCR-oriented Chain-of-Thought prompting. On a held-out real-world multilingual OCR benchmark, OCR-SFT improves OCR completeness from 71.3 to 84.6…