
De persoon achter het platform
Jesper Rietbergen
Oprichter en CEO, Flireo B.V.
Ik heb veel mensen geleerd hoe je een voice-agent bouwt op het platform van een ander. Daarna heb ik de laag eronder gebouwd, want dáár gaan de gesprekken in de praktijk stuk.
Ik run Flireo B.V. vanuit Deventer en ik ben degene die de orchestratiecode schrijft waar VoiceDock op draait. Ik ben geen oprichter die vroeger technisch was. Valt de telefonie van een klant op dinsdagavond uit, dan ben ik degene die de SIP-trunklogs leest, en alles wat op deze site staat is vanuit die stoel geschreven.
Hoe ik hier terechtkwam
Vier verkeerde afslagen die samen de juiste route vormden
Hier zat geen plan achter. Het was een reeks dingen die ophielden te werken, en elk daarvan leerde me iets concreets over waar een verdedigbare positie ligt.
- 01
2023: een chatbot die door een algemeen model overbodig werd gemaakt
Ik begon Flireo in november 2023 vanuit één simpele aanname: AI ging ertoe doen, en de enige manier om kans te maken was om je vanaf dag één te specialiseren. Ons eerste product was een chatbot die arbo- en veiligheidsvragen beantwoordde op basis van een samengestelde kennisbank. Binnen een jaar beantwoordden de algemene modellen die vragen beter dan wij, en verdampte de bestaansreden van het product. Dat is de eerste les waar ik echt voor betaald heb: een dunne laag over het model van iemand anders is geen bedrijf.
- 02
2024: spraak gevonden, en een publiek
Ik ging op zoek naar iets moeilijkers en kwam bij spraak uit. Ik leerde mezelf Vapi aan, met de API's eromheen en het automatiseringswerk dat alles aan elkaar knoopt, en begon op YouTube te publiceren wat ik leerde. Geen korte video's. Het zijn video's van één tot drie uur waarin je een agent van begin tot eind bouwt, live, inclusief de stukken die misgaan. Dat kanaal werd de groeimotor van Flireo voordat er überhaupt een verkoopproces was, en de meeste relaties waar dit bedrijf op draait zijn daar begonnen.
- 03
De twee nevenactiviteiten waar ik bewust mee gestopt ben
Twee dingen verkochten goed, en met allebei ben ik gestopt. Het ging om consultancy voor 125 euro per uur, één of twee uur live meekijken en problemen oplossen, en om kant-en-klare automatiseringssjablonen voor 625 euro per stuk. Die sjablonen zijn de interessante mislukking: mensen kochten de uitkomst zonder te willen begrijpen hoe het werkte, en kwamen daarna terug met frustratie over problemen die zo'n sjabloon nooit zou oplossen. Kant-en-klaar verkopen aan mensen die het systeem niet wilden leren kennen leverde aan beide kanten ontevredenheid op. Uit die conclusie komt done-with-you voort. Het is geen marketingverhaal, maar wat er overbleef nadat het alternatief voor mijn ogen mislukte.
- 04
Een laag dieper, telkens als ik tegen een plafond aanliep
Het gereedschap schoof mee naarmate de problemen zwaarder werden. Eerst no-code frontends, daarna een backend-as-a-service, daarna een low-code automatiseringsengine. Elke stap kwam doordat ik tegen het plafond van de laag erboven aanliep. Dat laatste plafond was het belangrijkste: valt een gesprek weg en zegt het platform alleen dat het mislukte, zonder dat je dieper kunt kijken, dan zit je met een klantprobleem dat je niet kunt oplossen. Dus ben ik gestopt met die laag huren en ben ik hem zelf gaan schrijven.
Wat ik nu doe
Ik bouw het, ik draai het, en ik neem zelf de telefoon op
VoiceDock is een Europees platform voor voice-AI-orchestratie, en ik onderhoud het deel dat andere platformen als een zwarte doos behandelen.
Het draait op Python en LiveKit voor de orchestrator, Next.js voor het dashboard en voor deze site, Hono en Node voor de services, Supabase voor de data, Hetzner en DigitalOcean voor de rekenkracht, en Telnyx voor de telefonie. Europese infrastructuur, en dat is een bewuste keuze.
Schrijfwerk
Wat ik hier publiceer
Alles hieronder is geschreven vanuit productie-ervaring en niet vanuit een contentbriefing. Staat er een getal in een van deze stukken, dan is het gemeten, onderbouwd met een bron of uitdrukkelijk aangemerkt als illustratief.
Het latency-budget van een telefoongesprek
Elk platform noemt één latency-getal. Een beller ervaart een keten van acht stappen, waarvan er maar twee bij het model horen. Waar de milliseconden werkelijk heen gaan, welke daarvan natuurkunde zijn en dus vastliggen, en waarom beurtdetectie meestal meer kost dan de tijd tot het eerste token.
9 min leestijdBarge-in die wel werkt: spraakdetectie afstellen op telefoonaudio
Instellingen voor spraakdetectie die op schone studio-audio zijn afgesteld, begeven het op een 8 kHz-telefoonlijn. De twee taken die één detector moet doen, de valse onderbreking en hoe je daarvan herstelt, en waarom we beurtdetectie weer uit de cloud haalden.
10 min leestijdEU AI Act artikel 50: wat een voice-agent moet melden
Vanaf 2 augustus 2026 moet een beller weten dat hij met een machine praat. Wat artikel 50 echt eist van een telefoonagent, wie de verplichting draagt, en waarom het aantoonbaar maken werk is voor de orchestratielaag.
11 min leestijdWat een voice-agent echt kost per minuut
De platformkosten zijn de kleine helft van de rekening. Component voor component wat een minuut AI-telefoongesprek kost, waar de verborgen vermenigvuldigers zitten, en hoe je het doorrekent vóór je je vastlegt.
12 min leestijdAls het doorverbinden mislukt
In elke demo verbindt de voice-agent in één keer door naar een mens. Productie is geen demo. De faalvormen van een warme overdracht, waarom een stille fallback erger is dan een weigering, en wat je in plaats daarvan bouwt.
10 min leestijdWaarom gesprekken van voice-agents mislukken: de SIP-logs lezen
Een dashboard dat 'fout' zegt vertelt je niets. De vier lagen waarop een telefoongesprek faalt, de SIP-responscodes en Q.850-oorzaken die de oorzaak benoemen, en een triagevolgorde die convergeert in plaats van gokt.
13 min leestijdZelf een voice-stack hosten: wie draagt de pieper?
Zelf hosten om onder een prijs per minuut uit te komen is een serieuze strategie met een serieuze rekening, en die rekening is vooral operationeel. Wat je overneemt op de dag dat de pieper van jou is, en de drie eerlijke uitwegen.
12 min leestijdGemini Live 3.1 prompting guide (voice agents)
Je prompt Gemini 3.1 Flash Live niet als een tekst-LLM of een TTS-engine. Een praktische prompting guide voor native-audio voice agents: instructie-ontwerp, toon, taal, en wat stilletjes misgaat.
9 min leestijdElders
Waar je me verder vindt
Via het lange videowerk kwamen de meeste mensen me voor het eerst tegen, en het is nog steeds het eerlijkste beeld van hoe ik werk.
Wil je de persoon spreken die het bouwt?
Er zit hier geen verkooplaag tussen jou en de engineering. Heb je een spraakvraagstuk dat de moeite waard is om op te lossen, dan spreek je mij.