Leveranciers noemen nauwkeurigheidspercentages in de hoge negentig procent. In gereguleerde sectoren op grote schaal wordt de economische haalbaarheid van spraakgestuurde AI echter bepaald door de kosten van het resterende percentage.
Drie cijfers die het inkoopgesprek veranderen.
Leveranciers geven een nauwkeurigheid van rond de negentig procent aan. In gereguleerde sectoren op grote schaal zijn de kosten van het resterende percentage niet gering: het is juist daar waar de economische haalbaarheid van spraakgestuurde AI daadwerkelijk wordt bepaald.
Bij 100.000 telefoontjes per maand en een nauwkeurigheid van 98%, zijn dat ongeveer 66 per dag aantoonbaar foute antwoorden. '95% nauwkeurigheid' bij een miljoen telefoontjes betekent 50.000 slechte ervaringen per jaar.
Bij aannemelijke gemiddelde kosteninput (R=£25, L=£180, B=£40, F=£90) heeft een operator met 100.000 telefoontjes maandelijks ongeveer £670.000 aan kosten voor hallucinaties die nooit in het AI-budget voorkomen.
De overstap van een RAG die alleen vectoren gebruikt naar een hybride retrievalmethode met een validatieagent verlaagt de gemodelleerde hallucinatiekosten doorgaans aanzienlijk, veel meer dan de equivalente benchmarkwinsten.
Het nummer dat niemand wil doen
Neem een contactcenter dat 100.000 telefoontjes per maand verwerkt. Ga ervan uit dat het beschikt over een eersteklas spraak-AI met een daadwerkelijke nauwkeurigheid van 98%. Reken het nu maar eens uit.
In dat tempo zal het systeem produceren 2000 feitelijk onjuiste reacties per maand Ongeveer 66 per dag, bijna drie per uur. Dat is geen theoretisch getal. Dat zijn klanten die een antwoord van het systeem hebben ontvangen. vol vertrouwen geloofde was juist, en niet.
In de detailhandel gaat het om een gesprek over een terugbetaling. Bij nutsbedrijven om een klacht. In de gezondheidszorg of financiële dienstverlening soms om een gebeurtenis die verband houdt met regelgeving.
“"95% nauwkeurig" bij een miljoen telefoontjes per jaar betekent vijftigduizend foute antwoorden. Het favoriete getal van de branche is ronduit misleidend.”
Een fout antwoord is vier gelaagde kosten.
De kosten van hallucinaties zijn niet één enkele regel. Het is een gelaagde optelsom van vier zeer verschillende soorten schade, elk met een eigen halfwaardetijd.
- Directe herstelkosten: £8–£60. Doorverwijzing naar een andere agent, opnieuw contact opnemen met de klant, terugbetaling of coulance. Meer dan £200 per incident in gereguleerde B2B-omgevingen.
- Klantwaarde over de gehele levensduur: +3–9%. Eén enkel fout antwoord aan de telefoon kan de kans op klantverlies voor de betreffende klant aanzienlijk vergroten. Gemiddeld neemt het risico op klantverlies jaarlijks met 3-9% toe.
- Verspreiding van reputatie: ~1 op 20. Ongeveer 1 op de 20 negatieve ervaringen met stemgebruik komt uiteindelijk in de openbaarheid. Deze ervaringen stapelen zich op binnen een groep, niet bij het individu.
- Blootstelling aan regelgeving. Een enkele controleerbare onjuistheid in een geregistreerde regel kan leiden tot een herstelmaatregel van vijf- of zescijferige bedragen, nog voordat er een boete wordt opgelegd.
Een nuttige vergelijking: C = P × (R + L + B + F)
Waar P is de kans op een incident, R is directe sanering, L is de levenslange waarde die risico loopt, B is merkverspreiding, F is blootstelling aan regelgeving.
Vul plausibele middenwaarden in voor een gereguleerde B2C-aanbieder (R=£25, L=£180, B=£40, F=£90), en de verwachte kosten per hallucinatie liggen rond de £335 Bij 2.000 hallucinaties per maand komt dat neer op ongeveer £670.000 aan verborgen kosten die niet voorkomen in de winst- en verliesrekeningen van AI-leveranciers.
Goed bestuur is geen kostenpost: het is juist de meest effectieve hefboom.
Architecturen die hybride retrieval, een validatieagent en confidence gating combineren, elimineren geen hallucinaties. Ze doen drie dingen die er veel meer toe doen.
- Verlaag het tarief. Bij hybride methoden voor het ophalen en valideren van antwoorden daalt het percentage onjuiste antwoorden dat eerder als 'zeker dan fout' wordt beschouwd, van 2-4% naar ruim onder de 1% voor antwoorden die gebaseerd zijn op specifieke domeinen.
- Zet mislukte opdrachten om in uitgestelde opdrachten. Onbekende fouten worden bekende uitstelmomenten. Het systeem draagt de verantwoordelijkheid met vertrouwen over, in plaats van met valse zekerheid te beweren.
- Stel een auditlogboek op. De herstelkosten voor de incidenten die erdoorheen glippen, zijn lager, omdat het incidentpad vanaf dag één wordt geregistreerd.
Laat de leverancier niet het scorebord kiezen.
Als u spraakgestuurde AI test in een gereguleerde sector, houd dan maandelijks deze drie cijfers bij. Ze vertellen u meer dan welke nauwkeurigheidsscore dan ook.
- Zelfverzekerd, maar onjuiste score. Het percentage reacties waarbij het systeem een hoge mate van zekerheid had, terwijl het antwoord feitelijk onjuist was. Dit is een gevaarlijk getal, omdat de klant er dan niet aan denkt om het in twijfel te trekken.
- Uitstelpercentage. Het percentage gesprekken waarbij het systeem de doorverwijzing netjes heeft doorgevoerd of een verduidelijkende vraag heeft gesteld. Een stijgend doorverwijzingspercentage is vaak een goed teken, geen zwakte.
- Brontoewijzingspercentage. Percentage van de antwoorden die herleidbaar zijn tot een specifiek document, versie en beleidsregel. Dit is het cijfer waar toezichthouders u als eerste naar zullen vragen.
Bepaal de prijs van de resterende 2% bewust.
De bedrijven die de komende vijf jaar succesvol zullen zijn met spraakgestuurde AI, zullen niet de bedrijven zijn met de hoogste benchmarkscores. Het zullen de bedrijven zijn die de risico's eerlijk hebben ingeschat en die net zo weloverwogen rekening hebben gehouden met de resterende 2% als met de zelfverzekerde 98%.
“De productiestack van Cloudax is gebouwd rond het percentage fouten dat met zekerheid wordt gemeld, niet rond het percentage correcte meldingen. De volledige architectuur is te vinden in onze whitepaper Beyond RAG.”
Prijs de het complete plaatje.
De architectuur van Cloudax is gebouwd rond het 'fair-faal'-percentage, niet rond het benchmarkcijfer. Lees het volledige architectuurraamwerk in Beyond RAG of neem contact op met ons team om de 'hallucinatiehouding' van uw implementatie te bespreken.




