Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
Di cosa parla
Hanno messo a punto un modo per insegnare ai grandi modelli multimodali a leggere e capire testi nelle immagini in molte lingue, anche quando il testo è piccolo, degradato, coperto o scritto a mano. Il metodo migliora la lettura senza usare uno strumento esterno per riconoscere il testo durante l'uso, tramite molta formazione mirata e prompt che guidano il modello a ragionare; i test mostrano meno errori, meno allucinazioni e traduzioni più accurate.
Cosa permette di osservare
Consente di esplorare se i modelli possono diventare autosufficienti nella lettura multilingue delle immagini senza strumenti esterni e quale sia il peso dei grandi insiemi di dati mirati rispetto ai prompt che guidano il ragionamento.
Dalla fonte
Optical character recognition (OCR) and multilingual scene-text understanding remain challenging for multimodal large language models (MLLMs), particularly in real-world images containing small or degraded text, cluttered layouts, occlusion, handwriting, and complex typography. We present an OCR-aware multilingual post-training framework that improves visual-text grounding in a general-purpose MLLM without requiring an external OCR engine, OCR-extracted text, or text bounding boxes at inference time. The framework combines large-scale multilingual OCR supervision, approximately 5M additional multilingual training samples, controlled synthetic OCR generation and in-image text translation, LoRA-based supervised fine-tuning (SFT), and lightweight OCR-oriented Chain-of-Thought prompting. On a held-out real-world multilingual OCR benchmark, OCR-SFT improves OCR completeness from 71.3 to 84.6…