Douze modèles OpenAI, un seul budget vocal. Cinq exécutions pour chaque modèle : à chaud et à froid, par défaut et prioritaire. La solution idéale réside rarement dans un seul modèle. Il s’agit de choisir le modèle OpenAI le plus adapté à chaque situation.
Trois numéros de la série
GPT-4o en priorité, préchauffé, cinq exécutions : le TTFT et le p95 les plus faibles de la série. GPT-4.1 (légèrement plus lent à 783 ms) est le choix d’orchestration le plus sûr malgré sa latence minimale.
Quatre modèles affichent une médiane totale inférieure à 700 ms, ce qui les rend particulièrement adaptés aux échanges conversationnels en direct. Les autres ne sont pas plus lents ; ils sont conçus pour des tâches différentes.
GPT-4.1 Nano a été le plus avantagé par le routage prioritaire. Les modèles de raisonnement ont à peine progressé. La priorité atténue la latence résiduelle, et non l'accélère de manière uniforme.
Qu’a-t-on mesuré, et comment ?
Un appel vocal n'est pas un test de performance. Il s'agit d'une pile, et le modèle n'en représente qu'une partie. Ce test de performance isole cette partie et la soumet à des contraintes similaires à celles du trafic réel.
Chacun des douze modèles a reçu la même invite vocale (adaptée à l'IA) et le même budget de génération. Cinq exécutions chronométrées ont été effectuées par modèle après une phase d'échauffement, suivies d'une exécution à froid distincte pour analyser le comportement en fin de réponse. Lorsque cela était possible, les niveaux de priorité et par défaut ont été testés ; en l'absence de priorité, la requête a été effectuée avec le niveau par défaut et la ligne correspondante est marquée en conséquence.
Trois chiffres sont rapportés par modèle : TTFT médiane (temps d'obtention du premier jeton utile), Médiane totale (demande du dernier jeton d'une courte réponse vocale) et TOTAL p95 (la fin que l'appelant entendra finalement). Les modèles de raisonnement (GPT-5.2 / 5.4 / 5.5) ont été exécutés avec effort=aucun Des modèles non raisonnants ont été exécutés à temp=0,2 .
“En matière de voix, la médiane vous indique l'impression générale que donnera votre démo. Le p95, quant à lui, vous indique ce dont vos clients se souviendront.”
Cinq cycles par modèle, préchauffés, routage prioritaire
Trié par latence médiane totale. Il s'agit des conditions les plus favorables pour chaque modèle : connexion préchauffée, file d'attente prioritaire et sortie vocale courte. La forme de ce tableau indique quels modèles doivent être traités en direct et lesquels doivent être traités ailleurs dans le processus.
| # | Modèle | Servi | TTFT | TOTAL | p95 |
|---|---|---|---|---|---|
| 01 | GPT-4o | priorité | 351 ms | 528 ms | 629 ms |
| 02 | GPT-4.1 Nano | priorité | 483 ms | 657 ms | 1014 ms |
| 03 | GPT-4.1 Mini | priorité | 406 ms | 661 ms | 687 ms |
| 04 | GPT-5.4 Mini | priorité | 458 ms | 703 ms | 3424 ms* |
| 05 | GPT-4o Mini | priorité | 478 ms | 778 ms | 843 ms |
| 06 | GPT-4.1 | priorité | 464 ms | 783 ms | 885 ms |
| 07 | GPT-5.4 Nano | défaut | 427 ms | 803 ms | 1233 ms |
| 08 | GPT-5 Mini | priorité | 570 ms | 881 ms | 934 ms |
| 09 | GPT-5.2 | priorité | 544 ms | 1274 ms | 1314 ms |
| 10 | GPT-5.5 | priorité | 623 ms | 1342 ms | 4220 ms* |
| 11 | GPT-5.4 | priorité | 473 ms | 1362 ms | 1559 ms |
| 12 | GPT-5.3 Chat | défaut | 1179 ms | 1917 ms | 2102 ms |
Le routage prioritaire n'entraîne pas une accélération uniforme.
La priorité est présentée comme une mise à niveau standard. Les données démontrent le contraire. Les gains les plus importants ont été obtenus par les modèles les plus petits et les plus rapides, précisément ceux dont la latence par défaut était déjà principalement due au temps d'attente, et non au temps de calcul. Les modèles de raisonnement permettent de gagner des centaines de millisecondes en valeur absolue, mais leur latence minimale est déterminée par la capacité de raisonnement, et non par le routage.
Deux modèles (GPT-4o Mini et GPT-5.2) ont effectivement été pris en charge. Ralentissez Dans ce test, la priorité est inférieure de 22 % et 16 % respectivement. Cela indique clairement qu'il ne faut pas considérer la priorité comme une amélioration automatique ; effectuez vos propres tests en fonction de l'heure de la journée avant de l'appliquer à un flux vocal de production.
| Modèle | Défaut | Priorité | Δ |
|---|---|---|---|
| GPT-4.1 Nano | 996 ms | 657 ms | −339 ms · −34% |
| GPT-5 Mini | 1160 ms | 881 ms | −279 ms · −24% |
| GPT-5.5 | 1756 ms | 1342 ms | −414 ms · −24% |
| GPT-4.1 | 877 ms | 783 ms | −94 ms · −11% |
| GPT-4.1 Mini | 726 ms | 661 ms | −65 ms · −9% |
| GPT-5.4 Mini | 770 ms | 703 ms | −67 ms · −9% |
| GPT-4o | 572 ms | 528 ms | −44 ms · −8% |
| GPT-5.4 Nano | 890 ms | 803 ms | — · n/a |
| GPT-5.3 Chat | 2061 ms | 1917 ms | — · n/a |
| GPT-5.4 | 1292 ms | 1362 ms | +70 ms · flat |
| GPT-4o Mini | 637 ms | 778 ms | +141 ms · +22% |
| GPT-5.2 | 1095 ms | 1274 ms | +179 ms · +16% |
La même gamme, vue par l'acheteur
La latence détermine si un modèle peut maintenir un tour. Le coût du jeton, la fenêtre de contexte et le seuil de connaissances déterminent si vous pouvez vous permettre de le maintenir en place à grande échelle, avec l'historique approprié et face aux faits pertinents.
| Modèle | Entrée/1M | Sortie/1M | Contexte | Couper |
|---|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 128K | Octobre 2023 |
| GPT-4.1 Nano | $0.10 | $0.40 | 1,05 M | Juin 2024 |
| GPT-4.1 Mini | $0.40 | $1.60 | 1,05 M | Juin 2024 |
| GPT-5.4 Mini | $0.75 | $4.50 | 400K | Août 2025 |
| GPT-4o Mini | $0.15 | $0.60 | 128K | Octobre 2023 |
| GPT-4.1 | $2.00 | $8.00 | 1,05 M | Juin 2024 |
| GPT-5.4 Nano | $0.20 | $1.25 | 400K | Août 2025 |
| GPT-5 Mini | $0.25 | $2.00 | 400K | Mai 2024 |
| GPT-5.2 | $1.75 | $14.00 | 400K | Août 2025 |
| GPT-5.5 | $5.00 | $30.00 | 1,05 M | Décembre 2025 |
| GPT-5.4 | $2.50 | $15.00 | 1,05 M | Août 2025 |
| GPT-5.3 Chat | $1.75 | $14.00 | 128K | Août 2025 |
Choisir en fonction du comportement, et non des critères de référence
La latence indique si un modèle peut communiquer. Elle ne précise pas s'il doit maintenir la surface de l'outil, orchestrer un flux à plusieurs tours ou évaluer l'appel une fois terminé. Chaque niveau de la gamme OpenAI a une fonction spécifique ; les temps de latence seuls ne permettent pas de déterminer laquelle.
Niveau Nano : départ canon, excellent en tant que porte
GPT-4.1 Nano et GPT-5.4 Nano affichent les temps de réponse les plus courts (TTFT) et tirent le meilleur parti du routage prioritaire. En pratique, les modèles Nano sont moins stables lors d'enchaînements d'appels d'outils : les arguments JSON peuvent parfois dériver et les séquences d'appels multiples peuvent s'interrompre. Ils sont excellents comme classificateur d'intention de première passe, détecteur de langue ou filtre de confiance ; il est déconseillé de les utiliser comme modèle principal gérant l'interface utilisateur dans un flux vocal multi-étapes.
Niveau mini : assez rapide, idéal pour les sous-tâches délimitées
GPT-4.1 Mini et GPT-5.4 Mini semblent idéaux au premier abord : environ 700 ms de latence totale, un p95 inférieur à la seconde et un débit de jetons correct. Le point crucial est leur comportement conversationnel. Lors de longs échanges vocaux, ces mini-processeurs peuvent se perdre, ignorer les préconditions des appels d'outils et reposer des questions auxquelles l'appelant a déjà répondu. Performants pour les tâches ponctuelles (résumer, extraire, classifier), ils ne sont cependant pas adaptés à l'orchestration de conversations longues.
Niveau de raisonnement : intelligent, précis, optimal en direct
Les modèles GPT-5.2, GPT-5.4 et GPT-5.5 affichent une médiane totale comprise entre 1,27 s et 1,36 s, avec des pics de p95 supérieurs à 4 s pour les événements extrêmes. Ces modèles consomment à eux seuls la majeure partie du temps de traitement, laissant peu de marge pour la finalisation, la récupération, la validation et la synthèse vocale automatiques. Ils sont parfaitement adaptés à l'analyse, l'évaluation, la notation et la synthèse post-appel, mais pas à une utilisation en direct.
Niveau de modélisation complet : GPT-4.1 est le choix pour l’orchestration.
GPT-4o affiche le TTFT le plus faible, la médiane totale la plus basse et le p95 le plus précis de cette série. C'est également le modèle présentant le plus grand nombre de faiblesses documentées en matière de suivi d'instructions et d'hallucinations. GPT-4.1 est environ 250 ms plus lent, avec un TTFT total de 783 ms et un p95 de 885 ms, mais représente une amélioration significative en termes de suivi d'instructions, de discipline dans l'appel d'outils et de fiabilité. Pour une application réelle exigeant un comportement fiable, ce léger écart de latence est un compromis acceptable.
“Le GPT-4o possède le TTFT le plus faible de cette sélection, ainsi que les faiblesses les plus documentées en matière de suivi d'instructions et d'hallucinations. Le modèle le moins cher en termes de performances est rarement le moins performant.”
La bonne réponse est un portefeuille par tour
Obtenir un temps de réponse inférieur à une seconde sur OpenAI ne consiste pas à choisir un seul modèle optimal ; cela consiste à exploiter l'ensemble des modèles d'OpenAI, un niveau par tâche. par tour .
- GPT-4.1 en direct. L'orchestrateur de la conversation. Sélection des outils, élaboration de l'argumentation et réponse orale.
- Mini pour assistants spécialisés. Sous-tâches limitées et ponctuelles : résumé, extraction, classification, formulation de l’intention.
- GPT-4.1 pour les chaînes complexes. Lorsqu'un flux doit coordonner plusieurs appels d'outils et un état persistant au fil des tours, la même discipline de suivi des instructions et d'appel d'outils porte ses fruits.
- Raisonnement hors ligne. Noter les appels, enrichir les notes CRM, exécuter les évaluations pendant la nuit. Jamais sur le budget alloué aux délais de livraison.
Le bon modèle de voix est un portefeuille
Pour les conversations en direct, GPT-4.1 est le choix idéal : légèrement plus lent que GPT-4.0, il offre une nette amélioration en matière de suivi d'instructions et d'hallucination, des fonctionnalités essentielles pour la production vocale. Pour les assistants spécialisés et ponctuels, GPT-4.1 est parfaitement adapté. Pour les séquences complexes à plusieurs étapes, GPT-4.1, dans sa version complète, assure l'orchestration. Enfin, pour l'évaluation en temps réel, on utilise des modèles de raisonnement.
La question « Quel modèle OpenAI est le meilleur pour la voix ? » est mal posée. La bonne question est : « Quel modèle OpenAI est le plus adapté à cette tâche ? »
Architecte pour La présence, et non les points de repère.
Une architecture vocale optimisée pour la latence sur OpenAI repose rarement sur un seul modèle ; il s’agit plutôt d’un ensemble de niveaux, routés à chaque tour en fonction d’un budget fixe inférieur à la seconde. Contactez notre équipe pour configurer les quatre indicateurs clés de votre déploiement actuel.




