Twaalf OpenAI-modellen, één spraakbudget. Vijf runs per model, zowel warm als koud, standaard en prioriteit. Het juiste antwoord is zelden één enkel model. Het gaat erom het juiste OpenAI-model voor elke beurt te kiezen.
Drie nummers uit de reeks
GPT-40 met prioriteit, opgewarmd, vijf runs: de kortste TTFT en p95 in de reeks. GPT-4.1 (iets trager met 783 ms) is de veiligere keuze voor orchestratie, ondanks de latency floor.
Vier modellen hebben een mediane totale responstijd van minder dan 700 ms en zijn daarom het meest geschikt voor een live gesprek. De overige modellen zijn niet trager, maar ontworpen voor andere taken.
GPT-4.1 Nano profiteerde het meest van prioriteitsroutering. Redeneringsmodellen lieten nauwelijks verschil zien. Prioriteit dempt de latentie aan het einde van de cyclus, maar zorgt niet voor een uniforme snelheidsverbetering.
Wat werd er gemeten en hoe?
Een spraakomwenteling is geen referentiepunt. Het is een reeks processen, en het model is slechts één segment. Deze benchmark isoleert dat segment en belast het op dezelfde manier als live verkeer.
Elk van de twaalf modellen kreeg dezelfde spraakgestuurde AI-prompt en hetzelfde generatiebudget. Vijf getimede runs per model na een opwarmperiode, gevolgd door een aparte koude start om afwijkend gedrag te detecteren. Waar ondersteund, werden zowel de standaard- als de prioriteitslaag getest; als de prioriteitslaag niet beschikbaar was, viel het verzoek terug op de standaardlaag en werd de betreffende rij dienovereenkomstig gemarkeerd.
Per model worden drie getallen gerapporteerd: TTFT-mediaan (tijd tot het eerste bruikbare token), TOTALE mediaan (verzoek om het laatste teken van een korte spraakreactie) en TOTAAL p95 (het eindsignaal dat de beller uiteindelijk zal horen). Redeneermodellen (GPT-5.2 / 5.4 / 5.5) werden uitgevoerd met inspanning=geen Niet-redenerende modellen werden uitgevoerd bij temperatuur=0,2 .
“Bij spraak geeft de mediaan aan hoe je demo zal aanvoelen. De p95 geeft aan wat je klanten zich zullen herinneren.”
Vijf runs per model, opgewarmd, prioriteitsroutering
Gesorteerd op totale mediane latentie. Dit is de meest gunstige situatie voor elk model: vooraf opgewarmde verbinding, prioriteitswachtrij, korte spraakbeurt. De vorm van deze tabel laat zien welke modellen direct aan de beurt zijn en welke elders in de pipeline thuishoren.
| # | Model | Geserveerd | TTFT | TOTAAL | p95 |
|---|---|---|---|---|---|
| 01 | GPT-4o | prioriteit | 351 ms | 528 ms | 629 ms |
| 02 | GPT-4.1 Nano | prioriteit | 483 ms | 657 ms | 1014 ms |
| 03 | GPT-4.1 Mini | prioriteit | 406 ms | 661 ms | 687 ms |
| 04 | GPT-5.4 Mini | prioriteit | 458 ms | 703 ms | 3424 ms* |
| 05 | GPT-4o Mini | prioriteit | 478 ms | 778 ms | 843 ms |
| 06 | GPT-4.1 | prioriteit | 464 ms | 783 ms | 885 ms |
| 07 | GPT-5.4 Nano | standaard | 427 ms | 803 ms | 1233 ms |
| 08 | GPT-5 Mini | prioriteit | 570 ms | 881 ms | 934 ms |
| 09 | GPT-5.2 | prioriteit | 544 ms | 1274 ms | 1314 ms |
| 10 | GPT-5.5 | prioriteit | 623 ms | 1342 ms | 4220 ms* |
| 11 | GPT-5.4 | prioriteit | 473 ms | 1362 ms | 1559 ms |
| 12 | GPT-5.3 Chat | standaard | 1179 ms | 1917 ms | 2102 ms |
Prioriteitsroutering leidt niet tot een uniforme snelheidsverbetering.
Prioriteit wordt verkocht als een standaard upgrade. De data laten echter iets anders zien. De grootste winst werd behaald bij de kleinste, snelste modellen, precies die modellen waarvan de latentie in de standaardlaag al werd gedomineerd door de wachttijd, niet door de rekenkracht. Redeneringsmodellen bespaarden honderden milliseconden in absolute termen, maar hun ondergrens wordt bepaald door het denkproces, niet door de routering.
Twee modellen (GPT-40 Mini en GPT-5.2) hebben het daadwerkelijk gekregen. langzamer In deze testrun kregen de prioriteitsinstellingen respectievelijk 22% en 16% minder prioriteit. Dat is een sterk signaal dat prioriteit niet per se een gratis verbetering is; test het eerst op je eigen prompt en op je eigen tijdstip voordat je het in een productieomgeving toepast.
| Model | Standaard | Prioriteit | Δ |
|---|---|---|---|
| GPT-4.1 Nano | 996 ms | 657 ms | −339 ms · −34% |
| GPT-5 Mini | 1160 ms | 881 ms | −279 ms · −24% |
| GPT-5.5 | 1756 ms | 1342 ms | −414 ms · −24% |
| GPT-4.1 | 877 ms | 783 ms | −94 ms · −11% |
| GPT-4.1 Mini | 726 ms | 661 ms | −65 ms · −9% |
| GPT-5.4 Mini | 770 ms | 703 ms | −67 ms · −9% |
| GPT-4o | 572 ms | 528 ms | −44 ms · −8% |
| GPT-5.4 Nano | 890 ms | 803 ms | — · n/a |
| GPT-5.3 Chat | 2061 ms | 1917 ms | — · n/a |
| GPT-5.4 | 1292 ms | 1362 ms | +70 ms · flat |
| GPT-4o Mini | 637 ms | 778 ms | +141 ms · +22% |
| GPT-5.2 | 1095 ms | 1274 ms | +179 ms · +16% |
Dezelfde line-up, maar dan bekeken door de ogen van een koper.
De latentie bepaalt of een model een beurt kan volhouden. De tokenkosten, het contextvenster en de kennisafkapwaarde bepalen of je het je kunt veroorloven om het model op grote schaal aan de beurt te houden, met de juiste geschiedenis en de juiste feiten.
| Model | Invoer/1M | Uitgang/1M | Context | Afsnijding |
|---|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 128K | oktober 2023 |
| GPT-4.1 Nano | $0.10 | $0.40 | 1,05M | Juni 2024 |
| GPT-4.1 Mini | $0.40 | $1.60 | 1,05M | Juni 2024 |
| GPT-5.4 Mini | $0.75 | $4.50 | 400K | augustus 2025 |
| GPT-4o Mini | $0.15 | $0.60 | 128K | oktober 2023 |
| GPT-4.1 | $2.00 | $8.00 | 1,05M | Juni 2024 |
| GPT-5.4 Nano | $0.20 | $1.25 | 400K | augustus 2025 |
| GPT-5 Mini | $0.25 | $2.00 | 400K | Mei 2024 |
| GPT-5.2 | $1.75 | $14.00 | 400K | augustus 2025 |
| GPT-5.5 | $5.00 | $30.00 | 1,05M | december 2025 |
| GPT-5.4 | $2.50 | $15.00 | 1,05M | augustus 2025 |
| GPT-5.3 Chat | $1.75 | $14.00 | 128K | augustus 2025 |
Selecteer op basis van gedrag, niet op basis van een benchmark.
De latentie geeft aan of een model kan communiceren. Het zegt echter niets over de vraag of het model de toolinterface moet vasthouden, een meerstappenproces moet coördineren of het gesprek na afloop moet beoordelen. Elk niveau in het aanbod van OpenAI heeft een specifieke taak; de timing alleen laat niet zien welke taak dat is.
Nano-klasse: snelste start, beste startpositie
GPT-4.1 Nano en GPT-5.4 Nano behalen de laagste TTFT-waarden en profiteren het meest van prioriteitsroutering. In de praktijk zijn nano-modellen minder consistent bij opeenvolgende toolaanroepen: JSON-argumenten kunnen soms afwijken en sequenties met meerdere aanroepen kunnen over de beurten heen onderbroken worden. Uitstekend geschikt als intentieclassificatie, taaldetector of betrouwbaarheidspoort voor de eerste doorgang; minder geschikt als model dat de toolinterface beheert in een spraakstroom met meerdere stappen.
Mini-tier: snel genoeg, het beste voor afgebakende deeltaken.
GPT-4.1 Mini en GPT-5.4 Mini lijken op het eerste gezicht ideaal: een totale responstijd van ongeveer 700 ms, een p95-tijd van minder dan een seconde en een behoorlijke tokendoorvoer. Waar je echter op moet letten, is de conversatie-ervaring. Bij langere spraakstromen kunnen mini's de draad kwijtraken, voorwaarden overslaan bij toolaanroepen en vragen herhalen die de beller al heeft beantwoord. Ze zijn sterk voor eenmalige taken (samenvatten, extraheren, classificeren), maar niet geschikt voor het orkestreren van lange gesprekken.
Redeneringsniveau: slim, nauwkeurig, beste resultaat na live-uitzending
GPT-5.2, GPT-5.4 en GPT-5.5 liggen tussen 1,27 s en 1,36 s op de totale mediaan, met p95-pieken van meer dan 4 s bij staartgebeurtenissen. Deze modellen verbruiken het grootste deel van het beschikbare tijdsbudget, waardoor er weinig ruimte overblijft voor ASR-finalisatie, -opvraging, -validatie en TTS. Ze zijn precies wat je nodig hebt voor analyse, evaluatie, scoring en samenvatting na het gesprek, maar niet tijdens een live-uitzending.
Volledig modelniveau: GPT-4.1 is de orchestratiekeuze.
GPT-40 behaalt de laagste TTFT, de laagste totale mediaan en de strakste p95 in deze run. Het is ook het model met de meest gedocumenteerde zwakke punten op het gebied van instructievolging en hallucinatie. GPT-4.1 is ongeveer 250 ms trager met een totale TTFT van 783 ms en een p95 van 885 ms, en is een aanzienlijke verbetering op het gebied van instructievolging, tool-call discipline en feitelijkheid. Voor een live run die betrouwbaar moet functioneren, is dat verschil in latentie het waard.
“GPT-4o heeft de laagste TTFT in deze reeks, maar ook de meest gedocumenteerde zwakke punten op het gebied van instructievolging en hallucinatie. Het goedkoopste model in deze reeks is zelden het goedkoopste model in de discussie.”
Het juiste antwoord is een portefeuille per beurt.
Een reactietijd van minder dan een seconde behalen met OpenAI bereik je niet door één beste model te kiezen, maar door het volledige aanbod van OpenAI te gebruiken, één niveau per taak. per beurt .
- GPT-4.1 tijdens de live-beurt. De gespreksregisseur. De keuze van instrumenten, de argumentatie en het gesproken antwoord.
- Mini voor gespecialiseerde assistenten. Afgebakende, eenmalige deeltaken: samenvatten, extraheren, classificeren, intentie vormgeven.
- GPT-4.1 voor complexe ketens. Wanneer een workflow meerdere toolaanroepen en persistente statusinformatie over verschillende beurten heen moet coördineren, levert dezelfde discipline in het opvolgen van instructies en toolaanroepen een exponentieel rendement op.
- Redeneren buiten de gebaande paden. Gesprekken beoordelen, CRM-notities verrijken, evaluaties uitvoeren 's nachts. Nooit binnen het budget voor live-uitvoering.
Het juiste stemmodel is een portfolio.
Voor live gesprekken is GPT-4.1 de natuurlijke keuze: iets trager dan GPT-40, maar een aanzienlijke verbetering op het gebied van instructieopvolging en hallucinatie, wat essentieel is voor productiestemmen. Voor gespecialiseerde eenmalige assistenten is mini de juiste keuze. Voor complexe, meerstaps processen verzorgt dezelfde volwaardige GPT-4.1 de orkestratie. Voor evaluatie buiten de lijn zijn redeneermodellen de beste optie.
De vraag "welk OpenAI-model is het beste voor spraakherkenning?" is de verkeerde. De juiste vraag is "welk OpenAI-model hoort hier thuis?"
Architect voor Aanwezigheid, geen benchmarks.
Een spraakstack op OpenAI die prioriteit geeft aan latency bestaat zelden uit één model; het is een portfolio van lagen, die per beurt worden gerouteerd met een vast budget van minder dan een seconde. Neem contact op met ons team om de vier belangrijkste getallen in uw huidige implementatie te laten meten.




