Ga direct naar de hoofdinhoud
    Cloudax
    Partners
    InloggenLaten we praten
    Nieuws > Branche-inzicht

    De driesecondenregel: waarom latentie de nieuwe nauwkeurigheid is in spraakgestuurde AI.

    Cloudax

    10 april 2026

    Leestijd: 8 minuten

    Deel

    Al het nieuws

    De industrie is geobsedeerd door nauwkeurigheidsnormen. In de wereld van spraakcommunicatie wordt het aantal milliseconden dat bepaalt of een beller uw AI vertrouwt, gemeten.

    De drie drempels die het vertrouwen op de lijn bepalen.

    De nauwkeurigheid wordt gemeten aan de hand van een benchmark. De responstijd wordt gemeten in milliseconden. Als de verkeerde drempelwaarden worden overschreden, maakt het niet uit hoe correct het antwoord is. De beller heeft immers al een oordeel gevormd.

    200 ms

    Gemiddelde tijdsinterval tussen spreekbeurten van een menselijke spreker in verschillende talen.

    < 3 s

    Een harde bovengrens voor de end-to-end latentie voordat bellers het vertrouwen in de AI verliezen.

    ~ 700 ms

    De drempel van de stilte waar luisteraars afwezigheid lezen, geen gedachte.

    Hoe mensen daadwerkelijk beurtelings wisselen

    Bellers beoordelen niet uw foutenpercentage bij het spreken. Ze beoordelen uw uitstraling, en dat doen ze al in de eerste seconde.

    Uit conversatieanalyses in verschillende talen blijkt dat de gemiddelde pauze tussen spreekbeurten van mensen ongeveer ligt. 200 milliseconden Het 90e percentiel ligt rond de 500 ms. Alles langer dan ongeveer 700 ms wordt door de luisteraar als een van de volgende drie dingen geïnterpreteerd: verwarring, onenigheid of afwezigheid.

    Een wachttijd van 900 ms voor het eerste antwoord zorgt ervoor dat elke volgende zin onzeker overkomt, ongeacht hoe correct deze uiteindelijk blijkt te zijn. Een reactietijd van minder dan 500 ms duidt al lang voordat de inhoud arriveert op competentie.

    “Nauwkeurigheid die je niet kunt horen, bestaat niet. Als de beller al heeft opgehangen, is je F1-score van 99% een afrondingsfout.”

    Latentie is een systeemprobleem, geen modelprobleem.

    De totale spraaklatentie is een stapel rekeningen die niemand volledig wil betalen. Tel ze naïef bij elkaar op en je overschrijdt de grens van drie seconden nog voor het ontbijt.

    • Opname & codec: 40–150 ms. Audio van het PSTN, via de codec, naar de stack.
    • Spraakherkenning: 150–350 ms. Het streamen van gedeeltelijke gegevens, plus de overheadkosten voor de finalisatie.
    • Ophaaltijd: 50–400 ms. Vectoropslag, BM25 of kennisgrafiek-hops.
    • Redeneren met LLM: 400–1200 ms. Het eerste bruikbare token, afhankelijk van het model en de prompt.
    • Tekst-naar-spraak: 200-600 ms. Eerste audio-opname via de kabel, inclusief planning van de prosodie.
    • Netwerkuitgang: 30–80 ms. Terug via het mediapad naar de beller.
    De samengestelde kosten

    Als je die grens van drie seconden vaak genoeg overschrijdt, is het merk voorgoed verdwenen.

    Iedere beller die daarna komt, leert (terecht) dat uw AI trager is dan een mens. De reactie op elke volgende beurt is bij voorbaat al afgeprijsd, ongeacht hoe goed de inhoud is.

    Nauwkeurigheid en latentie zijn hetzelfde.

    Productieplatformen voor spraakverwerking die een end-to-end verwerkingstijd van minder dan 1 seconde halen, verdelen de verantwoordelijkheid niet over twee teams. Ze beschouwen snelheid en correctheid als één meetwaarde. De patronen die daadwerkelijk werken, lijken op elkaar bij elke goed presterende implementatie die we hebben onderzocht:

    • Overal te streamen. Het streamen van ASR-fragmenten naar streaming retrieval, vervolgens naar streaming generation en ten slotte naar streaming TTS. Elke blokkerende stap verbruikt het volledige downstream-budget.
    • Speculatieve retrieval. Voer de eerste retrieval uit op het ASR-gedeelte, niet op het volledige transcript. In onze metingen levert dit een tijdsbesparing op van 120-180 ms zonder verlies aan nauwkeurigheid, in combinatie met een confidence gate.
    • Small-first LLM-routering. Route 70-80% van de keren met een snel, getuned kleiner model. Schakel alleen over naar het topmodel op routes waar je weinig vertrouwen in hebt. De beller hoort het kleinere model bijna altijd.
    • Vultokens. "Laat me dat even controleren" is geen tijdverspilling; het is een primitieve techniek om latentie te verbergen. Goed gebruikt, levert het 400-700 ms onzichtbare rekentijd op, terwijl de verbinding wel behouden blijft.

    De enige regel die alle andere functies bepaalt.

    Onze werkregel voor elke roadmap voor spraakgestuurde AI is simpel: als de end-to-end latency van de P90 (van het einde van de eerste spraakuiting tot de eerste audio-uitvoer) niet onder de drie seconden ligt, doet de rest van wat je levert er niet toe.

    • Sub-3 s: product. Hiermee maak je van een demo iets wat je zonder excuses aan echte klanten kunt laten zien.
    • Minder dan 1,5 seconde: gesprek. Het om de beurt spelen begint natuurlijk aan te voelen. Inperkingspercentage en CSAT-verbinding.
    • Sub-1 s: mens. Qua aanwezigheid niet te onderscheiden van een goed opgeleide agent. Operationele voordelen worden ontsloten.

    Als u deze vier getallen deze week niet kunt overleggen…

    …uw spraakgestuurde AI-platform wordt nog niet beoordeeld op de dimensie waarop uw bellers het daadwerkelijk beoordelen. Begin niet met nauwkeurigheid. Begin hier: per beurt, per gesprek, over een willekeurige steekproef van 1.000 gesprekken.

    1. Barge-in vertraging. Hoe snel je detecteert dat de beller is begonnen met spreken. Dit bepaalt de bovengrens van de waargenomen reactiesnelheid.
    2. Tijd tot het eerste token. De afronding van ASR naar het eerste bruikbare token van de LLM. Het meest beheersbare budget in de hele stapel.
    3. Tijd voor de eerste audio. LLM's eerste poging tot hoorbare spraak via de lijn. Gedomineerd door TTS-opwarming en prosodieplanning.
    4. End-to-end P90. Einde van de uitspraak tot de eerste audio-uitvoer. Het enige nummer dat voor de beller van belang is. Bezit dit en de rest volgt vanzelf.

    Bouw voor een indrukwekkende uitstraling.

    Voice AI wordt in de eerste seconde gewonnen of verloren. Houd de P90 onder de drie, ontwikkel voor een tijd onder de één, en de rest van de roadmap volgt vanzelf. Sla dit over en de rest van de roadmap bestaat uit het opnieuw uitbrengen van een demo.

    “De spraakstack van Cloudax is ontworpen met latency als prioriteit. We houden de P90-responstijd van begin tot eind standaard onder de 0,9 seconden voor inkomend verkeer in productieomgevingen, ongeacht accent, codec of provider.”

    Ingenieur voor de eerste seconde.

    De spraakstack van Cloudax is ontworpen met latency als prioriteit. Neem contact op met ons team om te bespreken hoe u P90 end-to-end kunt implementeren in uw huidige omgeving en wat er nodig is om de latency naar minder dan één seconde te verlagen.

    Talk to our teamSee it run live

    Lees verder

    Beleid · 22 JUL 2026

    De EU AI-wetgeving raakt spraak: wat augustus 2026 betekent voor conversationele AI

    De verplichtingen met betrekking tot risicovolle toepassingen in de wet gaan in op 2 augustus 2026. De meeste spraakgestuurde AI die momenteel in productie is, brengt een beperkt risico met zich mee, maar dat geldt niet voor noodhulp, werving en selectie, kredietverlening, verzekeringen, onderwijs en openbare diensten. Wat is nu precies van toepassing op een spraakgestuurde agent? Waar ligt de grens per sector en in welke valkuil kan een koper veranderen in een aanbieder?

    Normen · 28 MEI 2026

    Cloudax publiceert OHP: het Open Handoff Protocol voor spraak-AI

    OHP: het Open Handoff Protocol. Een leveranciersneutrale specificatie voor het doorgeven van live spraakgesprekken tussen AI-agenten, IVR-systemen, contactcenters en mensen, met geverifieerde identiteit, intentie, toestemming en mediacontinuïteit over verschillende platformen heen.

    Partnerschap · 18 MEI 2026

    Cloudax werkt samen met Gamma om spraak-AI naar zakelijke Unified Communications (UC) te brengen

    Cloudax was aanwezig op het hoofdpodium van Gamma tijdens de GX Summit 2026 in Westminster als onderdeel van Gamma's AI-strategie en voerde die dag een live implementatie van spraakgestuurde AI uit. Cloudax integreert naadloos met bestaande Gamma-systemen zonder dat er ingrijpende vervangingen nodig zijn en zonder tijdrovende migraties.

    Ontdek hoe de meer menselijke AI van Cloudax uw bedrijf kan transformeren.

    Geen verplichtingen, inclusief gratis consult.

    Laten we praten
    CloudaxCyber Essentials-gecertificeerdCyber Essentials Plus-gecertificeerdISO 27001-gecertificeerd

    Vind ons

    167-169 Great Portland St.
    Londen W1W 5PF

    1 Hardman Square
    Manchester M3 3EB

    +44 333 011 1190
    [email protected]

    Oplossingen

    • Verbinden
    • Inkomend
    • Uitgaande
    • Chat

    Gebruiksvoorbeelden

    • Eigendom
    • Juridisch
    • Financiën
    • BPO's
    • Nutsbedrijven en energie
    • Automobiel
    • Reizen en gastvrijheid
    • E-commerce en detailhandel

    Bedrijf

    • Over ons
    • Carrières
    • Casestudies
    • Nieuws
    • Pers
    • Contact
    • Beveiliging
    • Merk

    Juridisch

    • Privacybeleid
    • Algemene voorwaarden
    • Cookiebeleid
    • Toegankelijkheidsverklaring
    • Verklaring inzake moderne slavernij
    • Verklaring tegen omkoping
    • Gedragscode
    • Milieu- en duurzaamheidsbeleid
    © 2026 Cloudax Ltd. Alle rechten voorbehouden. Cloudax® is een geregistreerd handelsmerk.