Ga direct naar de hoofdinhoud
    Cloudax
    Partners
    InloggenLaten we praten
    Nieuws > Onderzoek

    De shortlist in minder dan een seconde: het juiste OpenAI-model kiezen voor live spraak

    Cloudax

    1 mei 2026

    Leestijd: 9 minuten

    Deel

    Al het nieuws

    Twaalf OpenAI-modellen, één spraakbudget. Vijf runs per model, zowel warm als koud, standaard en prioriteit. Het juiste antwoord is zelden één enkel model. Het gaat erom het juiste OpenAI-model voor elke beurt te kiezen.

    Drie nummers uit de reeks

    528 ms
    Laagste totale mediaan

    GPT-40 met prioriteit, opgewarmd, vijf runs: de kortste TTFT en p95 in de reeks. GPT-4.1 (iets trager met 783 ms) is de veiligere keuze voor orchestratie, ondanks de latency floor.

    4
    Modellen binnen het live-turn budget

    Vier modellen hebben een mediane totale responstijd van minder dan 700 ms en zijn daarom het meest geschikt voor een live gesprek. De overige modellen zijn niet trager, maar ontworpen voor andere taken.

    −34%
    Beste prioriteitsverbetering

    GPT-4.1 Nano profiteerde het meest van prioriteitsroutering. Redeneringsmodellen lieten nauwelijks verschil zien. Prioriteit dempt de latentie aan het einde van de cyclus, maar zorgt niet voor een uniforme snelheidsverbetering.

    Wat werd er gemeten en hoe?

    Een spraakomwenteling is geen referentiepunt. Het is een reeks processen, en het model is slechts één segment. Deze benchmark isoleert dat segment en belast het op dezelfde manier als live verkeer.

    Elk van de twaalf modellen kreeg dezelfde spraakgestuurde AI-prompt en hetzelfde generatiebudget. Vijf getimede runs per model na een opwarmperiode, gevolgd door een aparte koude start om afwijkend gedrag te detecteren. Waar ondersteund, werden zowel de standaard- als de prioriteitslaag getest; als de prioriteitslaag niet beschikbaar was, viel het verzoek terug op de standaardlaag en werd de betreffende rij dienovereenkomstig gemarkeerd.

    Per model worden drie getallen gerapporteerd: TTFT-mediaan (tijd tot het eerste bruikbare token), TOTALE mediaan (verzoek om het laatste teken van een korte spraakreactie) en TOTAAL p95 (het eindsignaal dat de beller uiteindelijk zal horen). Redeneermodellen (GPT-5.2 / 5.4 / 5.5) werden uitgevoerd met inspanning=geen Niet-redenerende modellen werden uitgevoerd bij temperatuur=0,2 .

    “Bij spraak geeft de mediaan aan hoe je demo zal aanvoelen. De p95 geeft aan wat je klanten zich zullen herinneren.”

    Vijf runs per model, opgewarmd, prioriteitsroutering

    Gesorteerd op totale mediane latentie. Dit is de meest gunstige situatie voor elk model: vooraf opgewarmde verbinding, prioriteitswachtrij, korte spraakbeurt. De vorm van deze tabel laat zien welke modellen direct aan de beurt zijn en welke elders in de pipeline thuishoren.

    Prioriteitscategorie · vijf runs · opgewarmd
    #ModelGeserveerdTTFTTOTAALp95
    01GPT-4oprioriteit351 ms528 ms629 ms
    02GPT-4.1 Nanoprioriteit483 ms657 ms1014 ms
    03GPT-4.1 Miniprioriteit406 ms661 ms687 ms
    04GPT-5.4 Miniprioriteit458 ms703 ms3424 ms*
    05GPT-4o Miniprioriteit478 ms778 ms843 ms
    06GPT-4.1prioriteit464 ms783 ms885 ms
    07GPT-5.4 Nanostandaard427 ms803 ms1233 ms
    08GPT-5 Miniprioriteit570 ms881 ms934 ms
    09GPT-5.2prioriteit544 ms1274 ms1314 ms
    10GPT-5.5prioriteit623 ms1342 ms4220 ms*
    11GPT-5.4prioriteit473 ms1362 ms1559 ms
    12GPT-5.3 Chatstandaard1179 ms1917 ms2102 ms
    * p95-piek als gevolg van een enkel staartgebeurtenis. GPT-5.4 Mini run 4 bereikte een waarde van 3,4 s; GPT-5.5 stuitte op een vergelijkbare staart bij 4,2 s. Exclusief deze uitschieters blijven hun medianen accuraat.

    Prioriteitsroutering leidt niet tot een uniforme snelheidsverbetering.

    Prioriteit wordt verkocht als een standaard upgrade. De data laten echter iets anders zien. De grootste winst werd behaald bij de kleinste, snelste modellen, precies die modellen waarvan de latentie in de standaardlaag al werd gedomineerd door de wachttijd, niet door de rekenkracht. Redeneringsmodellen bespaarden honderden milliseconden in absolute termen, maar hun ondergrens wordt bepaald door het denkproces, niet door de routering.

    Twee modellen (GPT-40 Mini en GPT-5.2) hebben het daadwerkelijk gekregen. langzamer In deze testrun kregen de prioriteitsinstellingen respectievelijk 22% en 16% minder prioriteit. Dat is een sterk signaal dat prioriteit niet per se een gratis verbetering is; test het eerst op je eigen prompt en op je eigen tijdstip voordat je het in een productieomgeving toepast.

    Standaard → Prioriteitsdelta
    ModelStandaardPrioriteitΔ
    GPT-4.1 Nano996 ms657 ms−339 ms · −34%
    GPT-5 Mini1160 ms881 ms−279 ms · −24%
    GPT-5.51756 ms1342 ms−414 ms · −24%
    GPT-4.1877 ms783 ms−94 ms · −11%
    GPT-4.1 Mini726 ms661 ms−65 ms · −9%
    GPT-5.4 Mini770 ms703 ms−67 ms · −9%
    GPT-4o572 ms528 ms−44 ms · −8%
    GPT-5.4 Nano890 ms803 ms— · n/a
    GPT-5.3 Chat2061 ms1917 ms— · n/a
    GPT-5.41292 ms1362 ms+70 ms · flat
    GPT-4o Mini637 ms778 ms+141 ms · +22%
    GPT-5.21095 ms1274 ms+179 ms · +16%

    Dezelfde line-up, maar dan bekeken door de ogen van een koper.

    De latentie bepaalt of een model een beurt kan volhouden. De tokenkosten, het contextvenster en de kennisafkapwaarde bepalen of je het je kunt veroorloven om het model op grote schaal aan de beurt te houden, met de juiste geschiedenis en de juiste feiten.

    Kosten, context, grens
    ModelInvoer/1MUitgang/1MContextAfsnijding
    GPT-4o$2.50$10.00128Koktober 2023
    GPT-4.1 Nano$0.10$0.401,05MJuni 2024
    GPT-4.1 Mini$0.40$1.601,05MJuni 2024
    GPT-5.4 Mini$0.75$4.50400Kaugustus 2025
    GPT-4o Mini$0.15$0.60128Koktober 2023
    GPT-4.1$2.00$8.001,05MJuni 2024
    GPT-5.4 Nano$0.20$1.25400Kaugustus 2025
    GPT-5 Mini$0.25$2.00400KMei 2024
    GPT-5.2$1.75$14.00400Kaugustus 2025
    GPT-5.5$5.00$30.001,05Mdecember 2025
    GPT-5.4$2.50$15.001,05Maugustus 2025
    GPT-5.3 Chat$1.75$14.00128Kaugustus 2025
    Bron: developers.openai.com/api/docs/models, vastgelegd op 1 mei 2026. Tokenprijzen zijn per 1 miljoen teksttokens, in Amerikaanse dollars, standaardtarief.

    Selecteer op basis van gedrag, niet op basis van een benchmark.

    De latentie geeft aan of een model kan communiceren. Het zegt echter niets over de vraag of het model de toolinterface moet vasthouden, een meerstappenproces moet coördineren of het gesprek na afloop moet beoordelen. Elk niveau in het aanbod van OpenAI heeft een specifieke taak; de timing alleen laat niet zien welke taak dat is.

    Nano-klasse: snelste start, beste startpositie

    GPT-4.1 Nano en GPT-5.4 Nano behalen de laagste TTFT-waarden en profiteren het meest van prioriteitsroutering. In de praktijk zijn nano-modellen minder consistent bij opeenvolgende toolaanroepen: JSON-argumenten kunnen soms afwijken en sequenties met meerdere aanroepen kunnen over de beurten heen onderbroken worden. Uitstekend geschikt als intentieclassificatie, taaldetector of betrouwbaarheidspoort voor de eerste doorgang; minder geschikt als model dat de toolinterface beheert in een spraakstroom met meerdere stappen.

    Mini-tier: snel genoeg, het beste voor afgebakende deeltaken.

    GPT-4.1 Mini en GPT-5.4 Mini lijken op het eerste gezicht ideaal: een totale responstijd van ongeveer 700 ms, een p95-tijd van minder dan een seconde en een behoorlijke tokendoorvoer. Waar je echter op moet letten, is de conversatie-ervaring. Bij langere spraakstromen kunnen mini's de draad kwijtraken, voorwaarden overslaan bij toolaanroepen en vragen herhalen die de beller al heeft beantwoord. Ze zijn sterk voor eenmalige taken (samenvatten, extraheren, classificeren), maar niet geschikt voor het orkestreren van lange gesprekken.

    Redeneringsniveau: slim, nauwkeurig, beste resultaat na live-uitzending

    GPT-5.2, GPT-5.4 en GPT-5.5 liggen tussen 1,27 s en 1,36 s op de totale mediaan, met p95-pieken van meer dan 4 s bij staartgebeurtenissen. Deze modellen verbruiken het grootste deel van het beschikbare tijdsbudget, waardoor er weinig ruimte overblijft voor ASR-finalisatie, -opvraging, -validatie en TTS. Ze zijn precies wat je nodig hebt voor analyse, evaluatie, scoring en samenvatting na het gesprek, maar niet tijdens een live-uitzending.

    Volledig modelniveau: GPT-4.1 is de orchestratiekeuze.

    GPT-40 behaalt de laagste TTFT, de laagste totale mediaan en de strakste p95 in deze run. Het is ook het model met de meest gedocumenteerde zwakke punten op het gebied van instructievolging en hallucinatie. GPT-4.1 is ongeveer 250 ms trager met een totale TTFT van 783 ms en een p95 van 885 ms, en is een aanzienlijke verbetering op het gebied van instructievolging, tool-call discipline en feitelijkheid. Voor een live run die betrouwbaar moet functioneren, is dat verschil in latentie het waard.

    “GPT-4o heeft de laagste TTFT in deze reeks, maar ook de meest gedocumenteerde zwakke punten op het gebied van instructievolging en hallucinatie. Het goedkoopste model in deze reeks is zelden het goedkoopste model in de discussie.”

    Het juiste antwoord is een portefeuille per beurt.

    Een reactietijd van minder dan een seconde behalen met OpenAI bereik je niet door één beste model te kiezen, maar door het volledige aanbod van OpenAI te gebruiken, één niveau per taak. per beurt .

    1. GPT-4.1 tijdens de live-beurt. De gespreksregisseur. De keuze van instrumenten, de argumentatie en het gesproken antwoord.
    2. Mini voor gespecialiseerde assistenten. Afgebakende, eenmalige deeltaken: samenvatten, extraheren, classificeren, intentie vormgeven.
    3. GPT-4.1 voor complexe ketens. Wanneer een workflow meerdere toolaanroepen en persistente statusinformatie over verschillende beurten heen moet coördineren, levert dezelfde discipline in het opvolgen van instructies en toolaanroepen een exponentieel rendement op.
    4. Redeneren buiten de gebaande paden. Gesprekken beoordelen, CRM-notities verrijken, evaluaties uitvoeren 's nachts. Nooit binnen het budget voor live-uitvoering.

    Het juiste stemmodel is een portfolio.

    Voor live gesprekken is GPT-4.1 de natuurlijke keuze: iets trager dan GPT-40, maar een aanzienlijke verbetering op het gebied van instructieopvolging en hallucinatie, wat essentieel is voor productiestemmen. Voor gespecialiseerde eenmalige assistenten is mini de juiste keuze. Voor complexe, meerstaps processen verzorgt dezelfde volwaardige GPT-4.1 de orkestratie. Voor evaluatie buiten de lijn zijn redeneermodellen de beste optie.

    De vraag "welk OpenAI-model is het beste voor spraakherkenning?" is de verkeerde. De juiste vraag is "welk OpenAI-model hoort hier thuis?"

    Architect voor Aanwezigheid, geen benchmarks.

    Een spraakstack op OpenAI die prioriteit geeft aan latency bestaat zelden uit één model; het is een portfolio van lagen, die per beurt worden gerouteerd met een vast budget van minder dan een seconde. Neem contact op met ons team om de vier belangrijkste getallen in uw huidige implementatie te laten meten.

    Talk to our teamSee it run live

    Lees verder

    Beleid · 22 JUL 2026

    De EU AI-wetgeving raakt spraak: wat augustus 2026 betekent voor conversationele AI

    De verplichtingen met betrekking tot risicovolle toepassingen in de wet gaan in op 2 augustus 2026. De meeste spraakgestuurde AI die momenteel in productie is, brengt een beperkt risico met zich mee, maar dat geldt niet voor noodhulp, werving en selectie, kredietverlening, verzekeringen, onderwijs en openbare diensten. Wat is nu precies van toepassing op een spraakgestuurde agent? Waar ligt de grens per sector en in welke valkuil kan een koper veranderen in een aanbieder?

    Normen · 28 MEI 2026

    Cloudax publiceert OHP: het Open Handoff Protocol voor spraak-AI

    OHP: het Open Handoff Protocol. Een leveranciersneutrale specificatie voor het doorgeven van live spraakgesprekken tussen AI-agenten, IVR-systemen, contactcenters en mensen, met geverifieerde identiteit, intentie, toestemming en mediacontinuïteit over verschillende platformen heen.

    Partnerschap · 18 MEI 2026

    Cloudax werkt samen met Gamma om spraak-AI naar zakelijke Unified Communications (UC) te brengen

    Cloudax was aanwezig op het hoofdpodium van Gamma tijdens de GX Summit 2026 in Westminster als onderdeel van Gamma's AI-strategie en voerde die dag een live implementatie van spraakgestuurde AI uit. Cloudax integreert naadloos met bestaande Gamma-systemen zonder dat er ingrijpende vervangingen nodig zijn en zonder tijdrovende migraties.

    Ontdek hoe de meer menselijke AI van Cloudax uw bedrijf kan transformeren.

    Geen verplichtingen, inclusief gratis consult.

    Laten we praten
    CloudaxCyber Essentials-gecertificeerdCyber Essentials Plus-gecertificeerdISO 27001-gecertificeerd

    Vind ons

    167-169 Great Portland St.
    Londen W1W 5PF

    1 Hardman Square
    Manchester M3 3EB

    +44 333 011 1190
    [email protected]

    Oplossingen

    • Verbinden
    • Inkomend
    • Uitgaande
    • Chat

    Gebruiksvoorbeelden

    • Eigendom
    • Juridisch
    • Financiën
    • BPO's
    • Nutsbedrijven en energie
    • Automobiel
    • Reizen en gastvrijheid
    • E-commerce en detailhandel

    Bedrijf

    • Over ons
    • Carrières
    • Casestudies
    • Nieuws
    • Pers
    • Contact
    • Beveiliging
    • Merk

    Juridisch

    • Privacybeleid
    • Algemene voorwaarden
    • Cookiebeleid
    • Toegankelijkheidsverklaring
    • Verklaring inzake moderne slavernij
    • Verklaring tegen omkoping
    • Gedragscode
    • Milieu- en duurzaamheidsbeleid
    © 2026 Cloudax Ltd. Alle rechten voorbehouden. Cloudax® is een geregistreerd handelsmerk.