Introducing gpt-realtime and Realtime API updates
Di cosa parla
OpenAI ha lanciato gpt-realtime, un nuovo modello pensato per trasformare la voce in voce più avanzato, e ha aggiornato la sua interfaccia per sviluppatori con funzionalità aggiuntive: può ricevere immagini come input, collegarsi a server per comunicazioni e gestire chiamate telefoniche via Internet. L'idea è facilitare la creazione di applicazioni che parlano, ascoltano e usano immagini in tempo reale.
Cosa permette di osservare
Questo annuncio permette di valutare come integrare voce e immagini in servizi interattivi e se usare connessioni a reti telefoniche e server di comunicazione per offrire conversazioni vocali più complete e multimediali.
Dalla fonte
We’re releasing a more advanced speech-to-speech model and new API capabilities including MCP server support, image input, and SIP phone calling support.