Torna alle notizie
ProdottoAI Understanding briefing

OpenAI rilascia l'API del modello vocale GPT-Live-1 per gli sviluppatori

OpenAI ha reso disponibile tramite API il suo modello vocale full-duplex GPT-Live-1, consentendo agli sviluppatori di creare applicazioni in grado di ascoltare e parlare simultaneamente con una migliore gestione delle interruzioni.

4 min readRead the original reporting
Source-provided image accompanying OpenAI releases GPT-Live-1 voice model API for developers
Segnalazione attribuitaFonte registrata
Editore
theregister.com
Collegamento alla fonte
theregister.comhttps://www.theregister.com/ai-and-ml/2026/09/10/openai-arms-devs-with-ai-conversation-tool-that-can-talk-and-listen-at-the-same-time/5295708
Tipo di fonte
Segnalazione da parte di un organo di stampa, non un documento di prima parte.

Ciò che non abbiamo potuto confermare in modo indipendente: Questa affermazione è attribuita al punto vendita indicato. Non lo abbiamo verificato rispetto a un documento di prima parte. (theregister.com)

ContestoComprendilo in 60 secondi

Inizia qui

Termini chiave

API (interfaccia di programmazione dell'applicazione)
Un modo strutturato con cui un sistema software invia richieste e riceve risposte da un altro sistema.
Punto di riferimento
Un test o un set di dati standardizzato utilizzato per misurare e confrontare le prestazioni del modello.
Latenza
Il tempo che intercorre tra l'invio di una richiesta e la ricezione dell'output del modello.
Mettiti alla provaQuiz sulla spiegazione dei modelli di intelligenza artificiale

Cosa è successo

OpenAI ha lanciato l'API per GPT-Live-1, il suo ultimo modello vocale full-duplex in tempo reale, consentendo agli sviluppatori di integrare funzionalità di ascolto e conversazione simultanee nelle loro applicazioni. Il modello, che ha debuttato a luglio all'interno dell'interfaccia ChatGPT, è ora accessibile per lo sviluppo esterno, caratterizzato da una migliore gestione delle interruzioni e da una latenza inferiore rispetto alle precedenti versioni dell'API Realtime.

OpenAI ha rilasciato l'API per GPT-Live-1, un modello vocale full-duplex in tempo reale che consente al software di ascoltare e generare parlato simultaneamente. Questa capacità va oltre i vincoli half-duplex dei sistemi precedenti, in cui gli utenti dovevano attendere che l’intelligenza artificiale finisse di parlare prima di rispondere. Il modello era inizialmente disponibile solo tramite l'interfaccia ChatGPT a luglio, ma ora è aperto agli sviluppatori tramite chiamate API.

L'azienda sottolinea come un punto di forza fondamentale la gestione fluida delle interruzioni, citando le prime valutazioni di un partner chiamato Speak. Queste valutazioni hanno indicato che GPT-Live-1 ha ridotto le interruzioni di quasi l’80% rispetto ai precedenti sistemi a turni, dando agli utenti più tempo per pensare prima che l’intelligenza artificiale risponda. Il modello è progettato per funzionare insieme a modelli backend come GPT-6 Astra per attività complesse come la ricerca di informazioni e l'utilizzo di strumenti.

I delle prestazioni mostrano miglioramenti significativi rispetto alla precedente API Realtime di OpenAI. Nel benchmark Tau3 sull’intelligence degli agenti vocali, che testa le attività parlate del servizio clienti, GPT-Live-1 ha ottenuto un punteggio dell’86,2%, rispetto al 45,7% di GPT-Realtime-2.1. OpenAI afferma inoltre un miglioramento delle prestazioni del 30% nelle metriche Full Duplex Bench e una migliore latenza di turno.

Yelp utilizza attualmente GPT-Live-1 per il suo servizio Yelp Host, un sistema di prenotazione di ristoranti basato sull'intelligenza artificiale. Il Chief Product Officer di Yelp ha affermato che la tecnologia rende le chiamate più colloquiali e reattive, aiutando i ristoranti a cogliere opportunità di guadagno e consentendo al personale di concentrarsi sugli ospiti. Il prezzo specifico per l'API è di 0,05 USD al minuto di utilizzo, escluso il costo del modello backend, con voci personalizzate disponibili tramite il team di vendita di OpenAI.

Dettagli della fonte: theregister.com ↗

Perché è importante

Questa versione riduce le barriere che impediscono agli sviluppatori di creare interazioni vocali naturali e fluide nelle applicazioni aziendali. Abilitando la comunicazione full-duplex, il modello risolve l'attrito dei sistemi a turni, migliorando potenzialmente l'esperienza dell'utente nel servizio clienti, nella formazione e in altri flussi di lavoro conversazionali. I miglioramenti documentati delle prestazioni rispetto ai modelli precedenti suggeriscono un significativo passo avanti nell’implementazione pratica dell’IA vocale.

La disponibilità di un modello vocale full-duplex tramite API rappresenta uno sviluppo significativo per gli sviluppatori che creano interfacce conversazionali. Consente interazioni più naturali, simili a quelle umane, che possono essere fondamentali nelle applicazioni rivolte al cliente in cui la reattività e la fluidità influiscono sulla soddisfazione dell'utente.

I miglioramenti prestazionali riportati, in particolare nella gestione delle interruzioni e nei punteggi di riferimento, suggeriscono che l’intelligenza artificiale vocale sta diventando più solida e affidabile per i casi d’uso aziendali reali. Ciò potrebbe accelerare l’adozione di interfacce vocali in settori come la vendita al dettaglio, l’ospitalità e l’istruzione.

Offrendo una chiara struttura dei prezzi e l'integrazione con la sua piattaforma aziendale, OpenAI posiziona questo strumento come una soluzione pratica per le aziende che desiderano migliorare la propria esperienza digitale del cliente. La collaborazione con Yelp fornisce un esempio concreto di come la tecnologia possa essere applicata per risolvere specifici problemi aziendali, come la gestione delle prenotazioni telefoniche.

Interactive Mechanism

Meccanismo interattivo: come funziona realmente

Esplora la tecnologia alla base di questo sviluppo in modo interattivo.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verifica concettuale interattiva+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Cosa guardare dopo

Monitora il modo in cui i primi utenti come Yelp implementano la tecnologia negli ambienti di produzione e se i parametri prestazionali riportati reggono nei test indipendenti. Tieni d'occhio l'adozione aziendale più ampia e i potenziali aggiornamenti ai prezzi o alle opzioni vocali personalizzate man mano che l'API matura.

La verifica indipendente delle prestazioni dichiarate, in particolare della riduzione dell’80% delle interruzioni e dei punteggi di riferimento, sarà importante per valutare l’impatto del modello nel mondo reale.

La misura in cui altre grandi aziende adotteranno GPT-Live-1 per i propri servizi vocali indicherà la trazione del mercato e il vantaggio competitivo del modello rispetto ad altre soluzioni di intelligenza artificiale vocale.

Potenziali aggiornamenti all'API, come nuove funzionalità, aggiustamenti dei prezzi o supporto linguistico ampliato, potrebbero influenzare ulteriormente il suo tasso di adozione tra sviluppatori e imprese.

Guide e quiz correlati

Spiegazione dei modelli di intelligenza artificialeAgenti dell'intelligenza artificialeCos'è l'intelligenza artificiale?Metti alla prova ciò che sai: prova un quiz gratuito sull'intelligenza artificialeCerca un termine AI nel nostro glossarioSegui il tracker del rilascio del modello AI
Lo hai trovato utile?