AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

CORE-3D: Context-aware Open-vocabulary Retrieval by Embeddings in 3D

Di cosa parla

Si propone un modo migliore per trovare e riconoscere oggetti in scene 3D a partire da immagini e descrizioni testuali. Il metodo crea maschere d'oggetto più coerenti per evitare frammentazione e combina più viste di ogni maschera, con pesi differenti, per ottenere un contesto visivo più ricco. In test su compiti di segmentazione e ricerca di oggetti, il metodo mostra miglioramenti rispetto a lavori precedenti.

Cosa permette di osservare

Permette di esplorare quanto la qualità delle maschere e la fusione di più viste influiscano sulla capacità di identificare e ritrovare oggetti in una scena 3D quando si usa il linguaggio naturale per chiederli.

modelli linguisticiregolamentazionericerca

Dalla fonte

Object retrieval from a scene has become a new trend of research due to its numerous applications. Recent approaches achieve zero-shot, open-vocabulary 3D semantic mapping by assigning embedding vectors to 2D class-agnostic masks generated via vision-language models (VLMs) and projecting these into 3D. However, these methods often produce fragmented masks and inaccurate semantic assignments due to the direct use of raw masks, limiting their effectiveness in complex environments. To address this, we leverage SemanticSAM with progressive granularity refinement to generate more accurate and numerous object-level masks, mitigating the over-segmentation commonly observed in mask generation models such as vanilla SAM, and improving downstream 3D semantic segmentation. To further enhance semantic context, we employ a context-aware CLIP encoding strategy that integrates multiple contextual view…