Zurück zu den Neuigkeiten
ProduktAI Understanding Briefing

OpenAI veröffentlicht die GPT-Live-1-Sprachmodell-API für Entwickler

OpenAI hat sein Vollduplex-Sprachmodell GPT-Live-1 über die API verfügbar gemacht und ermöglicht es Entwicklern, Anwendungen zu erstellen, die gleichzeitig zuhören und sprechen können, mit verbesserter Unterbrechungsbehandlung.

4 min readRead the original reporting
Source-provided image accompanying OpenAI releases GPT-Live-1 voice model API for developers
Zugeordnete BerichterstattungQuelle aufgezeichnet
Herausgeber
theregister.com
Quelllink
theregister.comhttps://www.theregister.com/ai-and-ml/2026/09/10/openai-arms-devs-with-ai-conversation-tool-that-can-talk-and-listen-at-the-same-time/5295708
Quelltyp
Berichterstattung einer Nachrichtenagentur – kein Dokument von Erstanbietern.

Was wir unabhängig nicht bestätigen konnten: Dieser Anspruch wird der genannten Verkaufsstelle zugerechnet. Wir haben es nicht anhand eines Erstanbieterdokuments überprüft. (theregister.com)

KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

API (Anwendungsprogrammierschnittstelle)
Eine strukturierte Möglichkeit für ein Softwaresystem, Anfragen an ein anderes System zu senden und Antworten von diesem zu empfangen.
Benchmark
Ein standardisierter Test oder Datensatz zum Messen und Vergleichen der Modellleistung.
Latenz
Die Zeit zwischen dem Senden einer Anfrage und dem Empfang der Modellausgabe.
Testen Sie sich selbstKI-Modelle erklärt Quiz

Was ist passiert?

OpenAI hat die API für GPT-Live-1 eingeführt, sein neuestes Echtzeit-Vollduplex-Sprachmodell, das es Entwicklern ermöglicht, gleichzeitige Hör- und Sprechfunktionen in ihre Anwendungen zu integrieren. Das Modell, das im Juli in der ChatGPT-Schnittstelle eingeführt wurde, ist jetzt für die externe Entwicklung zugänglich und zeichnet sich durch eine verbesserte Unterbrechungsbehandlung und geringere Latenz im Vergleich zu früheren Realtime-API-Versionen aus.

OpenAI hat die API für GPT-Live-1 veröffentlicht, ein Echtzeit-Vollduplex-Sprachmodell, das es Software ermöglicht, gleichzeitig zuzuhören und Sprache zu erzeugen. Diese Fähigkeit geht über die Halbduplex-Einschränkungen früherer Systeme hinaus, bei denen Benutzer warten mussten, bis die KI mit dem Sprechen fertig war, bevor sie antworten konnten. Das Modell war im Juli zunächst nur über die ChatGPT-Schnittstelle verfügbar, steht Entwicklern nun aber über API-Aufrufe zur Verfügung.

Das Unternehmen hebt die reibungslose Bewältigung von Unterbrechungen als wesentliche Stärke hervor und beruft sich dabei auf erste Bewertungen eines Partners namens Speak. Diese Auswertungen ergaben, dass GPT-Live-1 die Unterbrechungen im Vergleich zu früheren rundenbasierten Systemen um fast 80 Prozent reduzierte, sodass Benutzer mehr Zeit zum Nachdenken haben, bevor die KI reagiert. Das Modell ist für die Zusammenarbeit mit Backend-Modellen wie GPT-6 Astra für komplexe Aufgaben wie Informationssuche und Werkzeugnutzung konzipiert.

Leistungsbenchmarks zeigen deutliche Verbesserungen gegenüber der vorherigen Echtzeit-API von OpenAI. Beim Tau3 Voice-Agent-Intelligence-, der gesprochene Kundendienstaufgaben testet, erreichte GPT-Live-1 86,2 Prozent, verglichen mit 45,7 Prozent für GPT-Realtime-2.1. OpenAI behauptet außerdem eine 30-prozentige Leistungsverbesserung bei den Vollduplex-Bench-Metriken und eine bessere Turn-Taking-Latenz.

Yelp nutzt derzeit GPT-Live-1 für seinen Yelp Host-Dienst, ein KI-gesteuertes Restaurantreservierungssystem. Der Chief Product Officer von Yelp erklärte, dass die Technologie Anrufe gesprächiger und reaktionsschneller mache, Restaurants dabei helfe, Umsatzchancen zu nutzen und es den Mitarbeitern ermögliche, sich auf die Gäste zu konzentrieren. Der spezifische Preis für die API beträgt 0,05 USD pro Nutzungsminute, zuzüglich der Kosten für das Backend-Modell. Benutzerdefinierte Stimmen sind über das Vertriebsteam von OpenAI erhältlich.

Quellenangaben: theregister.com ↗

Warum es wichtig ist

Diese Version senkt die Hürde für Entwickler, natürliche, flüssige Sprachinteraktionen in Geschäftsanwendungen zu erstellen. Durch die Ermöglichung der Vollduplex-Kommunikation beseitigt das Modell die Reibung rundenbasierter Systeme und verbessert möglicherweise die Benutzererfahrung im Kundenservice, in der Bildung und bei anderen Gesprächsabläufen. Die dokumentierten Leistungssteigerungen gegenüber früheren Modellen deuten auf einen bedeutenden Fortschritt bei der praktischen Bereitstellung von Sprach-KI hin.

Die Verfügbarkeit eines Vollduplex-Sprachmodells über die API ist eine bedeutende Entwicklung für Entwickler, die Konversationsschnittstellen erstellen. Es ermöglicht natürlichere, menschenähnliche Interaktionen, was bei kundenorientierten Anwendungen von entscheidender Bedeutung sein kann, bei denen Reaktionsfähigkeit und Flüssigkeit die Benutzerzufriedenheit beeinflussen.

Die gemeldeten Leistungssteigerungen, insbesondere bei der Unterbrechungsbehandlung und den -Ergebnissen, deuten darauf hin, dass Sprach-KI für reale Geschäftsanwendungsfälle robuster und zuverlässiger wird. Dies könnte die Einführung von Voice-First-Schnittstellen in Branchen wie Einzelhandel, Gastgewerbe und Bildung beschleunigen.

Durch die Bereitstellung einer klaren Preisstruktur und die Integration in seine Unternehmensplattform positioniert OpenAI dieses Tool als praktische Lösung für Unternehmen, die ihr digitales Kundenerlebnis verbessern möchten. Die Zusammenarbeit mit Yelp ist ein konkretes Beispiel dafür, wie die Technologie zur Lösung spezifischer Geschäftsprobleme eingesetzt werden kann, beispielsweise bei der Verwaltung von Telefonreservierungen.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiver Konzeptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Was Sie als nächstes sehen sollten

Überwachen Sie, wie Early Adopters wie Yelp die Technologie in Produktionsumgebungen implementieren und ob die gemeldeten Leistungsmetriken unabhängigen Tests standhalten. Achten Sie auf eine breitere Akzeptanz in Unternehmen und mögliche Preisaktualisierungen oder benutzerdefinierte Sprachoptionen, wenn die API ausgereift ist.

Eine unabhängige Überprüfung der Leistungsansprüche, insbesondere der 80-prozentigen Reduzierung der Unterbrechungen und der -Ergebnisse, wird wichtig sein, um die realen Auswirkungen des Modells zu beurteilen.

Das Ausmaß, in dem andere große Unternehmen GPT-Live-1 für ihre eigenen Sprachdienste übernehmen, zeigt die Marktattraktivität und den Wettbewerbsvorteil des Modells gegenüber anderen Sprach-KI-Lösungen.

Potenzielle Aktualisierungen der API, etwa neue Funktionen, Preisanpassungen oder erweiterte Sprachunterstützung, könnten die Akzeptanzrate bei Entwicklern und Unternehmen weiter beeinflussen.

Verwandte Leitfäden und Quizze

KI-Modelle erklärtKI-AgentenWas ist KI?Testen Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker
Fanden Sie das nützlich?