AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
comunicato aziendale · OpenAI

Video generation models as world simulators

Di cosa parla

Si descrive l’addestramento su larga scala di modelli che generano video a partire da testi, addestrati congiuntamente su immagini e filmati di diversa durata, risoluzione e formato. I modelli imparano a produrre sequenze visive trattando insieme porzioni spaziali e temporali dei dati. Il più grande, chiamato Sora, è in grado di creare un minuto di video ad alta qualità e i risultati suggeriscono che ingrandire questi modelli potrebbe avvicinarsi a simulatori generali del mondo fisico.

Cosa permette di osservare

Fa riflettere sulla domanda se aumentare dimensioni e addestramento su immagini e video insieme possa trasformare modelli di generazione in simulatori del mondo fisico, e quali scelte sui dati e sul modo di costruirli siano più efficaci per raggiungere questo obiettivo.

immaginivideo

Dalla fonte

We explore large-scale training of generative models on video data. Specifically, we train text-conditional diffusion models jointly on videos and images of variable durations, resolutions and aspect ratios. We leverage a transformer architecture that operates on spacetime patches of video and image latent codes. Our largest model, Sora, is capable of generating a minute of high fidelity video. Our results suggest that scaling video generation models is a promising path towards building general purpose simulators of the physical world.