De industrie is geobsedeerd door nauwkeurigheidsnormen. In de wereld van spraakcommunicatie wordt het aantal milliseconden dat bepaalt of een beller uw AI vertrouwt, gemeten.
De drie drempels die het vertrouwen op de lijn bepalen.
De nauwkeurigheid wordt gemeten aan de hand van een benchmark. De responstijd wordt gemeten in milliseconden. Als de verkeerde drempelwaarden worden overschreden, maakt het niet uit hoe correct het antwoord is. De beller heeft immers al een oordeel gevormd.
Gemiddelde tijdsinterval tussen spreekbeurten van een menselijke spreker in verschillende talen.
Een harde bovengrens voor de end-to-end latentie voordat bellers het vertrouwen in de AI verliezen.
De drempel van de stilte waar luisteraars afwezigheid lezen, geen gedachte.
Hoe mensen daadwerkelijk beurtelings wisselen
Bellers beoordelen niet uw foutenpercentage bij het spreken. Ze beoordelen uw uitstraling, en dat doen ze al in de eerste seconde.
Uit conversatieanalyses in verschillende talen blijkt dat de gemiddelde pauze tussen spreekbeurten van mensen ongeveer ligt. 200 milliseconden Het 90e percentiel ligt rond de 500 ms. Alles langer dan ongeveer 700 ms wordt door de luisteraar als een van de volgende drie dingen geïnterpreteerd: verwarring, onenigheid of afwezigheid.
Een wachttijd van 900 ms voor het eerste antwoord zorgt ervoor dat elke volgende zin onzeker overkomt, ongeacht hoe correct deze uiteindelijk blijkt te zijn. Een reactietijd van minder dan 500 ms duidt al lang voordat de inhoud arriveert op competentie.
“Nauwkeurigheid die je niet kunt horen, bestaat niet. Als de beller al heeft opgehangen, is je F1-score van 99% een afrondingsfout.”
Latentie is een systeemprobleem, geen modelprobleem.
De totale spraaklatentie is een stapel rekeningen die niemand volledig wil betalen. Tel ze naïef bij elkaar op en je overschrijdt de grens van drie seconden nog voor het ontbijt.
- Opname & codec: 40–150 ms. Audio van het PSTN, via de codec, naar de stack.
- Spraakherkenning: 150–350 ms. Het streamen van gedeeltelijke gegevens, plus de overheadkosten voor de finalisatie.
- Ophaaltijd: 50–400 ms. Vectoropslag, BM25 of kennisgrafiek-hops.
- Redeneren met LLM: 400–1200 ms. Het eerste bruikbare token, afhankelijk van het model en de prompt.
- Tekst-naar-spraak: 200-600 ms. Eerste audio-opname via de kabel, inclusief planning van de prosodie.
- Netwerkuitgang: 30–80 ms. Terug via het mediapad naar de beller.
Als je die grens van drie seconden vaak genoeg overschrijdt, is het merk voorgoed verdwenen.
Nauwkeurigheid en latentie zijn hetzelfde.
Productieplatformen voor spraakverwerking die een end-to-end verwerkingstijd van minder dan 1 seconde halen, verdelen de verantwoordelijkheid niet over twee teams. Ze beschouwen snelheid en correctheid als één meetwaarde. De patronen die daadwerkelijk werken, lijken op elkaar bij elke goed presterende implementatie die we hebben onderzocht:
- Overal te streamen. Het streamen van ASR-fragmenten naar streaming retrieval, vervolgens naar streaming generation en ten slotte naar streaming TTS. Elke blokkerende stap verbruikt het volledige downstream-budget.
- Speculatieve retrieval. Voer de eerste retrieval uit op het ASR-gedeelte, niet op het volledige transcript. In onze metingen levert dit een tijdsbesparing op van 120-180 ms zonder verlies aan nauwkeurigheid, in combinatie met een confidence gate.
- Small-first LLM-routering. Route 70-80% van de keren met een snel, getuned kleiner model. Schakel alleen over naar het topmodel op routes waar je weinig vertrouwen in hebt. De beller hoort het kleinere model bijna altijd.
- Vultokens. "Laat me dat even controleren" is geen tijdverspilling; het is een primitieve techniek om latentie te verbergen. Goed gebruikt, levert het 400-700 ms onzichtbare rekentijd op, terwijl de verbinding wel behouden blijft.
De enige regel die alle andere functies bepaalt.
Onze werkregel voor elke roadmap voor spraakgestuurde AI is simpel: als de end-to-end latency van de P90 (van het einde van de eerste spraakuiting tot de eerste audio-uitvoer) niet onder de drie seconden ligt, doet de rest van wat je levert er niet toe.
- Sub-3 s: product. Hiermee maak je van een demo iets wat je zonder excuses aan echte klanten kunt laten zien.
- Minder dan 1,5 seconde: gesprek. Het om de beurt spelen begint natuurlijk aan te voelen. Inperkingspercentage en CSAT-verbinding.
- Sub-1 s: mens. Qua aanwezigheid niet te onderscheiden van een goed opgeleide agent. Operationele voordelen worden ontsloten.
Als u deze vier getallen deze week niet kunt overleggen…
…uw spraakgestuurde AI-platform wordt nog niet beoordeeld op de dimensie waarop uw bellers het daadwerkelijk beoordelen. Begin niet met nauwkeurigheid. Begin hier: per beurt, per gesprek, over een willekeurige steekproef van 1.000 gesprekken.
- Barge-in vertraging. Hoe snel je detecteert dat de beller is begonnen met spreken. Dit bepaalt de bovengrens van de waargenomen reactiesnelheid.
- Tijd tot het eerste token. De afronding van ASR naar het eerste bruikbare token van de LLM. Het meest beheersbare budget in de hele stapel.
- Tijd voor de eerste audio. LLM's eerste poging tot hoorbare spraak via de lijn. Gedomineerd door TTS-opwarming en prosodieplanning.
- End-to-end P90. Einde van de uitspraak tot de eerste audio-uitvoer. Het enige nummer dat voor de beller van belang is. Bezit dit en de rest volgt vanzelf.
Bouw voor een indrukwekkende uitstraling.
Voice AI wordt in de eerste seconde gewonnen of verloren. Houd de P90 onder de drie, ontwikkel voor een tijd onder de één, en de rest van de roadmap volgt vanzelf. Sla dit over en de rest van de roadmap bestaat uit het opnieuw uitbrengen van een demo.
“De spraakstack van Cloudax is ontworpen met latency als prioriteit. We houden de P90-responstijd van begin tot eind standaard onder de 0,9 seconden voor inkomend verkeer in productieomgevingen, ongeacht accent, codec of provider.”
Ingenieur voor de eerste seconde.
De spraakstack van Cloudax is ontworpen met latency als prioriteit. Neem contact op met ons team om te bespreken hoe u P90 end-to-end kunt implementeren in uw huidige omgeving en wat er nodig is om de latency naar minder dan één seconde te verlagen.




