OpenAI bracht GPT-Live-1 op 10 september uit in zijn API, en de meeste artikelen gingen over benchmarks. Wie een voice-agent aan de telefoon zet, heeft meer aan de architectuur. GPT-Live-1 is niet één model dat hoort, nadenkt en handelt. Het is een spraakmodel dat het gesprek voert en alles waarvoor nagedacht of een tool gebruikt moet worden, doorgeeft aan een tweede model. Die splitsing bepaalt hoe je de prompt schrijft, wat een onderbreking doet, wat er stilletjes misgaat en wat er op de rekening komt.
Het ene model praat, het andere werkt
Een speech-to-speech-model zoals Gemini Live of Grok Voice hoort audio, beslist wat er moet gebeuren, roept je tools aan en antwoordt in audio, allemaal in één model. Doordat die stappen samenvallen, voelen realtime modellen anders aan in plaats van alleen sneller, zoals het latency-budget van een telefoongesprek uitlegt. GPT-Live-1 houdt luisteren en spreken in één model, en is full duplex: hij luistert terwijl hij praat, en bepaalt zelf wanneer hij het woord neemt en wanneer hij stopt. Wat hij bewust niet doet, is het werk.
Vraagt een beller of donderdag om tien uur nog vrij is, dan geeft het spraakmodel die vraag door aan een tekstmodel op de achtergrond. Hij houdt de beller gezelschap terwijl dat achtergrondmodel nadenkt, de agenda raadpleegt en een antwoord teruggeeft, en brengt dat antwoord daarna in zijn eigen woorden. OpenAI raadt aan hem te koppelen aan een snel model zoals GPT-5.6 Luna voor routinewerk als afspraken inplannen, en aan een groter model zoals GPT-6 Astra voor vragen waar echt over nagedacht moet worden.
Dat achtergrondmodel kun je op twee manieren laten draaien. Bij Responses delegation roept GPT-Live via de Responses API van OpenAI een model aan dat je zelf instelt, en voert een framework als LiveKit Agents je tools daarvoor uit. Bij client delegation krijgt je eigen applicatie de taak, draait die elk model, elke agent of elke dienst die je wilt, en bepaalt die wat er terug naar de stem gaat. Voor de meeste telefoonagents is Responses delegation de kortste weg. Client delegation is de extra moeite waard als je resultaten wilt controleren, afschermen of combineren voordat ze worden uitgesproken. Hoe dan ook lopen de verzoeken naar je bedrijfssystemen via het achtergrondmodel, met alle beperkingen uit tool calls naar bedrijfssystemen en de eigenaardigheden per systeem op de koppelingspagina's.
Twee prompts in plaats van één
Door de splitsing verandert wat een prompt is. Het spraakmodel krijgt een korte prompt over het gesprek: wie de assistent is, hoe hij klinkt, hoe hij met onderbrekingen omgaat en wanneer hij werk doorgeeft. Het achtergrondmodel krijgt de bedrijfsregels en de werkwijze voor tools. De prompting-handleiding van OpenAI raadt aan in de prompt van het spraakmodel een delegatiebeleid op te nemen met drie delen: wat het achtergrondmodel kan, wanneer je werk doorgeeft, en wanneer niet. De kopjes in het voorbeeld zijn de Engelse labels uit die handleiding.
Je bent Sam, de receptionist van een tandartspraktijk.
Spreek rustig. Eén of twee zinnen per antwoord.
Onderbreekt de beller je, stop dan en luister.
Delegation policy
Backend tools:
- Afspraken: vrije tijden opzoeken, inplannen, verzetten of annuleren.
Delegate to the backend when:
- De beller vraagt naar een tijd, of wil een afspraak maken, verzetten of annuleren.
- De beller corrigeert een verzoek dat al loopt.
Do not delegate when:
- Je het antwoord uit het gesprek tot nu toe weet.
- De beller groet of vraagt iets te herhalen.Controleer met check_availability of een tijd vrij is voordat je hem aanbiedt.
Plan alleen binnen de openingstijden: maandag tot en met vrijdag, 08:00 tot 17:00.
Vraag naam en geboortedatum voordat je een bestaande afspraak wijzigt.
Mislukt een tool, zeg dat dan en bied aan terug te bellen. Gok nooit een uitkomst.Aan beide kanten ligt een valkuil. Laat de prompt van het achtergrondmodel niet leeg: dat model krijgt de instructies van het spraakmodel niet vanzelf mee, en beslist zonder eigen prompt over tools zonder de regels van het bedrijf te kennen. Zet ook niet alles in de prompt van het spraakmodel. Een spraakmodel met een pagina bedrijfsregels wordt trager en stijver, dezelfde les als bij het prompten van native-audiomodellen. Logica over wie er belt, zoals een beller herkennen aan zijn nummer, hoort bij het achtergrondmodel.
Een onderbreking stopt de stem, niet het werk
Door full duplex voelen onderbrekingen natuurlijk aan, en daar zit een valkuil achter. De handleiding van OpenAI over delegation zegt het expliciet: wie de spraak onderbreekt, breekt het werk op de achtergrond niet af. Zegt een beller “doe toch maar vrijdag” terwijl er een afspraak voor donderdag wordt ingeschoten, dan stopt de stem en past hij zich aan, terwijl het achtergrondmodel donderdag misschien nog gewoon vastlegt.
Een correctie moet het achtergrondmodel dus als correctie bereiken. Je applicatie beslist of de lopende taak wordt afgebroken, aangepast, of mag afronden waarna het resultaat wordt weggegooid, en een verzoek om te annuleren bewijst nog niet dat er iets is geannuleerd. Controleer voordat je een tool opnieuw aanroept die leek te mislukken of de actie al is uitgevoerd, zodat een verloren antwoord geen tweede afspraak oplevert. Het principe is hetzelfde als wanneer doorverbinden mislukt: zeg wat je weet, en verbloem nooit een uitkomst waar je niet zeker van bent.
Het model weet niet wat de beller heeft gehoord
Wat er anders gaat aan de telefoon
De meeste verschillen komen doordat dit model het gesprek vollediger in handen heeft dan de realtime modellen daarvoor.
| Gedrag | Wat het betekent in een gesprek |
|---|---|
| Het model regelt de beurtwisseling | Het bepaalt zelf wanneer de beller klaar is en wanneer het ophoudt met praten. Instellingen voor beurtdetectie uit een pipeline hebben geen effect. |
| Onderbreken vraagt om een detector die je zelf meegeeft | LiveKit laat voor dit model zijn standaard spraakdetectie weg. Zonder detector speelt de audio door tot het model uit zichzelf stopt. |
| Zinnen zijn instructies, geen script | Een begroeting of stiltemelding zegt het model in eigen woorden, en het kan er een overslaan die op dat moment niet past. |
| Stem en instructies liggen per sessie vast | Een van beide wijzigen betekent een nieuwe sessie waarin het gesprek wordt meegenomen. In een gesprek met meerdere stappen duurt die wissel even. |
| Tools kunnen tijdens het gesprek wijzigen | De lijst met tools kun je tijdens een gesprek bijwerken, ook al liggen de stem en beide sets instructies vast. |
De rij over onderbreken weegt aan de telefoon zwaarder dan in een browser. Smalbandige 8 kHz-audio, ruis op de lijn en wachtmuziek brengen detectoren die op schone audio zijn afgesteld van slag, zoals barge-in die wel werkt uitgebreid beschrijft. En gaat een gesprek mis in de telefonie in plaats van in het model, dan staat de oorzaak nog steeds in de SIP-logs.
Vier dingen die stil misgaan bij de inrichting
Geen van deze vier geeft een foutmelding die je in een demo opvalt. Elk ervan levert een gesprek op dat verbinding maakt en zich daarna niet gedraagt.
- 01
Leg het adres vast
Zonder explicietebase_urlhaalt de OpenAI-plugin zijn adres uit de omgevingsvariabeleOPENAI_BASE_URL. Zet iets op de machine die variabele, voor een lokale modelserver of een proxy, dan verbindt GPT-Live daarmee en hoort de beller stilte. Geefhttps://api.openai.com/v1expliciet mee. - 02
Test elke stem voordat je hem aanbiedt
Een stemnaam die je framework accepteert, accepteert OpenAI niet per se. Bij de lancering stondasterin de stemmenlijst van LiveKit, maar OpenAI weigerde hem metforbidden: Voice session access denied, waardoor de agent stil bleef. Start per stem één sessie voordat bellers hem te horen krijgen. - 03
Wissel pas van achtergrondmodel na een tool call
Begin met het standaardmodel en wissel pas na een testgesprek waarin een tool echt wordt uitgevoerd. Een achtergrondmodel dat niet goed meewerkt, klinkt niet kapot: de stem blijft vriendelijk, en er wordt niets ingepland. - 04
Werk de agentpakketten samen bij
GPT-Live wordt ondersteund vanaf LiveKit Agents 1.8.1. Draait je stack op een oudere versie, zet dan alle agentpakketten van LiveKit op dezelfde versie, niet alleen de OpenAI-plugin.
Twee meters op de rekening
De spraaklaag kost $0,05 per minuut, per seconde afgerekend, en levert geen tokens op. Het achtergrondmodel wordt apart afgerekend tegen de gewone tokenprijzen, net als de tools die het gebruikt. Een minuut GPT-Live is daarom een vaste prijs voor de stem plus een wisselend bedrag dat afhangt van hoe vaak de assistent werk doorgeeft en aan welk model.
| Meter | Eenheid | Prijs bij OpenAI |
|---|---|---|
| GPT-Live-1, stem | per minuut, per seconde afgerekend | $0,05 |
| GPT-5.6 Luna, invoer achtergrondmodel | per miljoen tokens | $0,20 |
| GPT-5.6 Luna, uitvoer achtergrondmodel | per miljoen tokens | $1,20 |
| Grotere achtergrondmodellen | per miljoen tokens | hoger, per model |
Dat heeft twee gevolgen in de praktijk. Een kostendashboard dat tokens per onderdeel telt, toont nul voor de stem. Dat klopt en zet je op het verkeerde been, dus houd voor de stem seconden bij en voor het achtergrondmodel tokens. En een assistent die bijna elke beurt iets opzoekt, kost merkbaar meer dan een die vooral praat. De meters die blijven lopen, welk model je ook kiest, staan in wat een voice-agent echt kost per minuut, en hoe een platformvergoeding daarbovenop komt, staat op onze prijzenpagina.
Waar hij past, en waar niet
Hij past bij gesprekken waarin het gesprek zelf het moeilijke deel is: bellers die onderbreken, aarzelen, zich bedenken of over achtergrondgeluid heen praten. OpenAI meldt een reactietijd van 0,798 seconde tegen 1,41 voor GPT-Realtime-2.1. Zie dat als het getal van de leverancier en meet je eigen keten van begin tot eind, want in een telefoongesprek is het model maar één van acht stappen die optellen.
Hij past niet als een zin letterlijk moet worden uitgesproken, zoals een verplichte melding. Een pipeline met spraaksynthese geeft je die garantie; wat die melding moet bevatten, staat in EU AI Act artikel 50. Hij past ook niet als de audio in Europa moet blijven. OpenAI verwerkt dit model standaard buiten de Europese Economische Ruimte, dus een assistent die EU-dataresidentie nodig heeft, hoort op een ander model. Waarom die eis bestaat, staat in waarom voice AI Europese infrastructuur nodig heeft, en hoe wij ermee omgaan op de soevereiniteitspagina.
Vier gesprekken om eerst te voeren
De splitsing is de kern
In onze eigen testgesprekken klinkt GPT-Live-1 aan de telefoon natuurlijker dan de realtime modellen daarvoor, en dat is ook wat elke demo laat zien. Of hij overeind blijft bij echte bellers, hangt ervan af of je hem als twee modellen behandelt: twee prompts, een achtergrondmodel dat zijn eigen taken en correcties beheert, adressen en stemmen die je hebt gecontroleerd, en een rekening die je in seconden én tokens leest. Hoe je dat aan de API-kant inricht, staat in het overzicht voor ontwikkelaars.
Bronnen het lanceringsbericht van OpenAI over GPT-Live-1 in de API, Getting started with GPT-Live, Delegation and tools in GPT-Live, Prompting GPT-Live, de modelpagina en de pluginhandleiding van LiveKit. De valkuilen bij de inrichting komen uit ons eigen integratiewerk.
