Terug naar Insights
Technologie

GPT-Live-1 aan de telefoon: wat we moesten veranderen

Het full-duplex spraakmodel van OpenAI doet het werk niet zelf, maar geeft nadenken en tool calls door aan een tweede model. Wat die splitsing betekent voor een telefoonagent: twee prompts, onderbrekingen die het werk niet stoppen, vier valkuilen bij de inrichting, en twee meters op de rekening.

Gepubliceerd September 11, 2026
9 min leestijd

OpenAI bracht GPT-Live-1 op 10 september uit in zijn API, en de meeste artikelen gingen over benchmarks. Wie een voice-agent aan de telefoon zet, heeft meer aan de architectuur. GPT-Live-1 is niet één model dat hoort, nadenkt en handelt. Het is een spraakmodel dat het gesprek voert en alles waarvoor nagedacht of een tool gebruikt moet worden, doorgeeft aan een tweede model. Die splitsing bepaalt hoe je de prompt schrijft, wat een onderbreking doet, wat er stilletjes misgaat en wat er op de rekening komt.

Het ene model praat, het andere werkt

Een speech-to-speech-model zoals Gemini Live of Grok Voice hoort audio, beslist wat er moet gebeuren, roept je tools aan en antwoordt in audio, allemaal in één model. Doordat die stappen samenvallen, voelen realtime modellen anders aan in plaats van alleen sneller, zoals het latency-budget van een telefoongesprek uitlegt. GPT-Live-1 houdt luisteren en spreken in één model, en is full duplex: hij luistert terwijl hij praat, en bepaalt zelf wanneer hij het woord neemt en wanneer hij stopt. Wat hij bewust niet doet, is het werk.

Vraagt een beller of donderdag om tien uur nog vrij is, dan geeft het spraakmodel die vraag door aan een tekstmodel op de achtergrond. Hij houdt de beller gezelschap terwijl dat achtergrondmodel nadenkt, de agenda raadpleegt en een antwoord teruggeeft, en brengt dat antwoord daarna in zijn eigen woorden. OpenAI raadt aan hem te koppelen aan een snel model zoals GPT-5.6 Luna voor routinewerk als afspraken inplannen, en aan een groter model zoals GPT-6 Astra voor vragen waar echt over nagedacht moet worden.

Dat achtergrondmodel kun je op twee manieren laten draaien. Bij Responses delegation roept GPT-Live via de Responses API van OpenAI een model aan dat je zelf instelt, en voert een framework als LiveKit Agents je tools daarvoor uit. Bij client delegation krijgt je eigen applicatie de taak, draait die elk model, elke agent of elke dienst die je wilt, en bepaalt die wat er terug naar de stem gaat. Voor de meeste telefoonagents is Responses delegation de kortste weg. Client delegation is de extra moeite waard als je resultaten wilt controleren, afschermen of combineren voordat ze worden uitgesproken. Hoe dan ook lopen de verzoeken naar je bedrijfssystemen via het achtergrondmodel, met alle beperkingen uit tool calls naar bedrijfssystemen en de eigenaardigheden per systeem op de koppelingspagina's.

Twee prompts in plaats van één

Door de splitsing verandert wat een prompt is. Het spraakmodel krijgt een korte prompt over het gesprek: wie de assistent is, hoe hij klinkt, hoe hij met onderbrekingen omgaat en wanneer hij werk doorgeeft. Het achtergrondmodel krijgt de bedrijfsregels en de werkwijze voor tools. De prompting-handleiding van OpenAI raadt aan in de prompt van het spraakmodel een delegatiebeleid op te nemen met drie delen: wat het achtergrondmodel kan, wanneer je werk doorgeeft, en wanneer niet. De kopjes in het voorbeeld zijn de Engelse labels uit die handleiding.

Prompt voor het spraakmodel (schets)
Je bent Sam, de receptionist van een tandartspraktijk.
Spreek rustig. Eén of twee zinnen per antwoord.
Onderbreekt de beller je, stop dan en luister.

Delegation policy
Backend tools:
- Afspraken: vrije tijden opzoeken, inplannen, verzetten of annuleren.
Delegate to the backend when:
- De beller vraagt naar een tijd, of wil een afspraak maken, verzetten of annuleren.
- De beller corrigeert een verzoek dat al loopt.
Do not delegate when:
- Je het antwoord uit het gesprek tot nu toe weet.
- De beller groet of vraagt iets te herhalen.
Prompt voor het achtergrondmodel (schets)
Controleer met check_availability of een tijd vrij is voordat je hem aanbiedt.
Plan alleen binnen de openingstijden: maandag tot en met vrijdag, 08:00 tot 17:00.
Vraag naam en geboortedatum voordat je een bestaande afspraak wijzigt.
Mislukt een tool, zeg dat dan en bied aan terug te bellen. Gok nooit een uitkomst.

Aan beide kanten ligt een valkuil. Laat de prompt van het achtergrondmodel niet leeg: dat model krijgt de instructies van het spraakmodel niet vanzelf mee, en beslist zonder eigen prompt over tools zonder de regels van het bedrijf te kennen. Zet ook niet alles in de prompt van het spraakmodel. Een spraakmodel met een pagina bedrijfsregels wordt trager en stijver, dezelfde les als bij het prompten van native-audiomodellen. Logica over wie er belt, zoals een beller herkennen aan zijn nummer, hoort bij het achtergrondmodel.

Een onderbreking stopt de stem, niet het werk

Door full duplex voelen onderbrekingen natuurlijk aan, en daar zit een valkuil achter. De handleiding van OpenAI over delegation zegt het expliciet: wie de spraak onderbreekt, breekt het werk op de achtergrond niet af. Zegt een beller “doe toch maar vrijdag” terwijl er een afspraak voor donderdag wordt ingeschoten, dan stopt de stem en past hij zich aan, terwijl het achtergrondmodel donderdag misschien nog gewoon vastlegt.

Een correctie moet het achtergrondmodel dus als correctie bereiken. Je applicatie beslist of de lopende taak wordt afgebroken, aangepast, of mag afronden waarna het resultaat wordt weggegooid, en een verzoek om te annuleren bewijst nog niet dat er iets is geannuleerd. Controleer voordat je een tool opnieuw aanroept die leek te mislukken of de actie al is uitgevoerd, zodat een verloren antwoord geen tweede afspraak oplevert. Het principe is hetzelfde als wanneer doorverbinden mislukt: zeg wat je weet, en verbloem nooit een uitkomst waar je niet zeker van bent.

Een verwante valkuil

Het model weet niet wat de beller heeft gehoord

Wordt het afspelen midden in een zin afgebroken, dan heeft de beller de helft gehoord, maar staat de hele beurt nog in de context van het model, en GPT-Live kan die niet inkorten. Hij kan later verwijzen naar iets wat de beller nooit heeft gehoord. Korte gesproken antwoorden laten minder te verliezen.

Wat er anders gaat aan de telefoon

De meeste verschillen komen doordat dit model het gesprek vollediger in handen heeft dan de realtime modellen daarvoor.

GedragWat het betekent in een gesprek
Het model regelt de beurtwisselingHet bepaalt zelf wanneer de beller klaar is en wanneer het ophoudt met praten. Instellingen voor beurtdetectie uit een pipeline hebben geen effect.
Onderbreken vraagt om een detector die je zelf meegeeftLiveKit laat voor dit model zijn standaard spraakdetectie weg. Zonder detector speelt de audio door tot het model uit zichzelf stopt.
Zinnen zijn instructies, geen scriptEen begroeting of stiltemelding zegt het model in eigen woorden, en het kan er een overslaan die op dat moment niet past.
Stem en instructies liggen per sessie vastEen van beide wijzigen betekent een nieuwe sessie waarin het gesprek wordt meegenomen. In een gesprek met meerdere stappen duurt die wissel even.
Tools kunnen tijdens het gesprek wijzigenDe lijst met tools kun je tijdens een gesprek bijwerken, ook al liggen de stem en beide sets instructies vast.
Op basis van de pluginhandleiding van LiveKit en de GPT-Live-documentatie van OpenAI.

De rij over onderbreken weegt aan de telefoon zwaarder dan in een browser. Smalbandige 8 kHz-audio, ruis op de lijn en wachtmuziek brengen detectoren die op schone audio zijn afgesteld van slag, zoals barge-in die wel werkt uitgebreid beschrijft. En gaat een gesprek mis in de telefonie in plaats van in het model, dan staat de oorzaak nog steeds in de SIP-logs.

Vier dingen die stil misgaan bij de inrichting

Geen van deze vier geeft een foutmelding die je in een demo opvalt. Elk ervan levert een gesprek op dat verbinding maakt en zich daarna niet gedraagt.

  1. 01

    Leg het adres vast

    Zonder expliciete base_url haalt de OpenAI-plugin zijn adres uit de omgevingsvariabele OPENAI_BASE_URL. Zet iets op de machine die variabele, voor een lokale modelserver of een proxy, dan verbindt GPT-Live daarmee en hoort de beller stilte. Geef https://api.openai.com/v1 expliciet mee.
  2. 02

    Test elke stem voordat je hem aanbiedt

    Een stemnaam die je framework accepteert, accepteert OpenAI niet per se. Bij de lancering stond aster in de stemmenlijst van LiveKit, maar OpenAI weigerde hem met forbidden: Voice session access denied, waardoor de agent stil bleef. Start per stem één sessie voordat bellers hem te horen krijgen.
  3. 03

    Wissel pas van achtergrondmodel na een tool call

    Begin met het standaardmodel en wissel pas na een testgesprek waarin een tool echt wordt uitgevoerd. Een achtergrondmodel dat niet goed meewerkt, klinkt niet kapot: de stem blijft vriendelijk, en er wordt niets ingepland.
  4. 04

    Werk de agentpakketten samen bij

    GPT-Live wordt ondersteund vanaf LiveKit Agents 1.8.1. Draait je stack op een oudere versie, zet dan alle agentpakketten van LiveKit op dezelfde versie, niet alleen de OpenAI-plugin.

Twee meters op de rekening

De spraaklaag kost $0,05 per minuut, per seconde afgerekend, en levert geen tokens op. Het achtergrondmodel wordt apart afgerekend tegen de gewone tokenprijzen, net als de tools die het gebruikt. Een minuut GPT-Live is daarom een vaste prijs voor de stem plus een wisselend bedrag dat afhangt van hoe vaak de assistent werk doorgeeft en aan welk model.

MeterEenheidPrijs bij OpenAI
GPT-Live-1, stemper minuut, per seconde afgerekend$0,05
GPT-5.6 Luna, invoer achtergrondmodelper miljoen tokens$0,20
GPT-5.6 Luna, uitvoer achtergrondmodelper miljoen tokens$1,20
Grotere achtergrondmodellenper miljoen tokenshoger, per model
Lijstprijzen van OpenAI op het moment van schrijven. De limieten tellen gelijktijdige sessies, van 25 in tier 1 tot 500 in tier 5, en de gratis tier wordt niet ondersteund.

Dat heeft twee gevolgen in de praktijk. Een kostendashboard dat tokens per onderdeel telt, toont nul voor de stem. Dat klopt en zet je op het verkeerde been, dus houd voor de stem seconden bij en voor het achtergrondmodel tokens. En een assistent die bijna elke beurt iets opzoekt, kost merkbaar meer dan een die vooral praat. De meters die blijven lopen, welk model je ook kiest, staan in wat een voice-agent echt kost per minuut, en hoe een platformvergoeding daarbovenop komt, staat op onze prijzenpagina.

Waar hij past, en waar niet

Hij past bij gesprekken waarin het gesprek zelf het moeilijke deel is: bellers die onderbreken, aarzelen, zich bedenken of over achtergrondgeluid heen praten. OpenAI meldt een reactietijd van 0,798 seconde tegen 1,41 voor GPT-Realtime-2.1. Zie dat als het getal van de leverancier en meet je eigen keten van begin tot eind, want in een telefoongesprek is het model maar één van acht stappen die optellen.

Hij past niet als een zin letterlijk moet worden uitgesproken, zoals een verplichte melding. Een pipeline met spraaksynthese geeft je die garantie; wat die melding moet bevatten, staat in EU AI Act artikel 50. Hij past ook niet als de audio in Europa moet blijven. OpenAI verwerkt dit model standaard buiten de Europese Economische Ruimte, dus een assistent die EU-dataresidentie nodig heeft, hoort op een ander model. Waarom die eis bestaat, staat in waarom voice AI Europese infrastructuur nodig heeft, en hoe wij ermee omgaan op de soevereiniteitspagina.

Voordat je een echt nummer omzet

Vier gesprekken om eerst te voeren

Onderbreek hem midden in een zin en meet hoe lang het duurt voordat hij weer antwoordt. Voer een gesprek waarin het achtergrondmodel een tool moet gebruiken, en controleer aan jouw kant dat die tool echt is uitgevoerd. Corrigeer een verzoek terwijl het achtergrondmodel er nog mee bezig is, en kijk of alleen de gecorrigeerde versie is doorgevoerd. Lees daarna de rekening en controleer of beide meters erop staan.

De splitsing is de kern

In onze eigen testgesprekken klinkt GPT-Live-1 aan de telefoon natuurlijker dan de realtime modellen daarvoor, en dat is ook wat elke demo laat zien. Of hij overeind blijft bij echte bellers, hangt ervan af of je hem als twee modellen behandelt: twee prompts, een achtergrondmodel dat zijn eigen taken en correcties beheert, adressen en stemmen die je hebt gecontroleerd, en een rekening die je in seconden én tokens leest. Hoe je dat aan de API-kant inricht, staat in het overzicht voor ontwikkelaars.

Bronnen het lanceringsbericht van OpenAI over GPT-Live-1 in de API, Getting started with GPT-Live, Delegation and tools in GPT-Live, Prompting GPT-Live, de modelpagina en de pluginhandleiding van LiveKit. De valkuilen bij de inrichting komen uit ons eigen integratiewerk.