Doce modelos de OpenAI, un presupuesto para voz. Cinco ejecuciones de cada uno: precalentamiento y precalentamiento, por defecto y por prioridad. La respuesta correcta rara vez es un solo modelo. Se trata de elegir el modelo de OpenAI adecuado para cada turno.
Tres números de la carrera
GPT-4o con prioridad, precalentado, cinco ejecuciones: el TTFT y p95 más ajustados de la selección. GPT-4.1 (ligeramente más lento, 783 ms) es la opción de orquestación más segura a pesar de su latencia mínima.
Cuatro modelos presentan una mediana total inferior a 700 ms en prioridad, siendo estos los candidatos idóneos para la interacción conversacional en tiempo real. El resto no son más lentos, sino que están diseñados para tareas diferentes.
GPT-4.1 Nano fue el que más se benefició del enrutamiento prioritario. Los modelos de razonamiento apenas se modificaron. La prioridad actúa como un amortiguador de latencia de cola, no como una aceleración uniforme.
Qué se midió y cómo
Un turno de voz no es una prueba de rendimiento. Es una pila, y el modelo es una porción. Esta prueba de rendimiento aísla esa porción y la somete a la misma presión que el tráfico real.
A cada uno de los doce modelos se le asignó la misma solicitud de voz con formato de IA y el mismo presupuesto de generación. Se realizaron cinco ejecuciones cronometradas por modelo tras un periodo de calentamiento, seguidas de una pasada de arranque en frío independiente para observar el comportamiento de cola. Cuando fue posible, se probaron tanto los niveles predeterminados como los prioritarios; cuando la prioridad no estaba disponible, la solicitud recurría al nivel predeterminado y la fila se marcaba en consecuencia.
Se informan tres cifras por modelo: TTFT mediana (tiempo hasta el primer token útil), Mediana TOTAL (solicitud hasta el último token de una breve respuesta de turno de voz) y TOTAL p95 (la cola que el emisor finalmente escuchará). Se ejecutaron modelos de razonamiento (GPT-5.2 / 5.4 / 5.5) con esfuerzo=ninguno Los modelos sin razonamiento se ejecutaron en temperatura=0,2 .
“En la voz, la mediana indica cómo se sentirá tu demo. El percentil 95 indica qué recordarán tus clientes.”
Cinco recorridos por modelo, precalentados, enrutamiento prioritario.
Ordenados por latencia mediana total. Esta es la condición más favorable posible para cada modelo: conexión precalentada, cola de prioridad, salida de turno de voz corta. La forma de esta tabla indica qué modelos corresponden al turno en vivo y cuáles a otras etapas del proceso.
| # | Modelo | Servido | TTFT | TOTAL | p95 |
|---|---|---|---|---|---|
| 01 | GPT-4o | prioridad | 351 ms | 528 ms | 629 ms |
| 02 | GPT-4.1 Nano | prioridad | 483 ms | 657 ms | 1014 ms |
| 03 | GPT-4.1 Mini | prioridad | 406 ms | 661 ms | 687 ms |
| 04 | GPT-5.4 Mini | prioridad | 458 ms | 703 ms | 3424 ms* |
| 05 | GPT-4o Mini | prioridad | 478 ms | 778 ms | 843 ms |
| 06 | GPT-4.1 | prioridad | 464 ms | 783 ms | 885 ms |
| 07 | GPT-5.4 Nano | por defecto | 427 ms | 803 ms | 1233 ms |
| 08 | GPT-5 Mini | prioridad | 570 ms | 881 ms | 934 ms |
| 09 | GPT-5.2 | prioridad | 544 ms | 1274 ms | 1314 ms |
| 10 | GPT-5.5 | prioridad | 623 ms | 1342 ms | 4220 ms* |
| 11 | GPT-5.4 | prioridad | 473 ms | 1362 ms | 1559 ms |
| 12 | GPT-5.3 Chat | por defecto | 1179 ms | 1917 ms | 2102 ms |
El enrutamiento prioritario no es una aceleración uniforme.
La prioridad se vende como una mejora sin coste adicional. Sin embargo, los datos indican lo contrario. Las mayores mejoras se observaron en los modelos más pequeños y rápidos, precisamente aquellos cuya latencia en el nivel predeterminado ya estaba dominada por el tiempo de espera en la cola, no por el procesamiento. Los modelos de razonamiento reducen el tiempo en cientos de milisegundos en términos absolutos, pero su límite inferior viene determinado por el razonamiento, no por el enrutamiento.
Dos modelos (GPT-4o Mini y GPT-5.2) de hecho obtuvieron Más lento En esta prueba, la prioridad fue menor, con un aumento del 22 % y del 16 % respectivamente. Esto indica claramente que no se debe asumir que la prioridad es una mejora gratuita; es importante evaluarla en su propio entorno y en su propio horario antes de implementarla en una ruta de voz de producción.
| Modelo | Por defecto | Prioridad | Δ |
|---|---|---|---|
| GPT-4.1 Nano | 996 ms | 657 ms | −339 ms · −34% |
| GPT-5 Mini | 1160 ms | 881 ms | −279 ms · −24% |
| GPT-5.5 | 1756 ms | 1342 ms | −414 ms · −24% |
| GPT-4.1 | 877 ms | 783 ms | −94 ms · −11% |
| GPT-4.1 Mini | 726 ms | 661 ms | −65 ms · −9% |
| GPT-5.4 Mini | 770 ms | 703 ms | −67 ms · −9% |
| GPT-4o | 572 ms | 528 ms | −44 ms · −8% |
| GPT-5.4 Nano | 890 ms | 803 ms | — · n/a |
| GPT-5.3 Chat | 2061 ms | 1917 ms | — · n/a |
| GPT-5.4 | 1292 ms | 1362 ms | +70 ms · flat |
| GPT-4o Mini | 637 ms | 778 ms | +141 ms · +22% |
| GPT-5.2 | 1095 ms | 1274 ms | +179 ms · +16% |
La misma gama de productos, vista desde la perspectiva del comprador.
La latencia determina si un modelo puede mantener un turno. El costo del token, la ventana de contexto y el umbral de conocimiento determinan si se puede permitir mantenerlo en el turno a gran escala, con el historial correcto y en función de los hechos correctos.
| Modelo | Entrada/1M | Salida/1M | Contexto | Cierre |
|---|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 128K | Octubre de 2023 |
| GPT-4.1 Nano | $0.10 | $0.40 | 1,05 millones | Junio de 2024 |
| GPT-4.1 Mini | $0.40 | $1.60 | 1,05 millones | Junio de 2024 |
| GPT-5.4 Mini | $0.75 | $4.50 | 400 mil | Agosto de 2025 |
| GPT-4o Mini | $0.15 | $0.60 | 128K | Octubre de 2023 |
| GPT-4.1 | $2.00 | $8.00 | 1,05 millones | Junio de 2024 |
| GPT-5.4 Nano | $0.20 | $1.25 | 400 mil | Agosto de 2025 |
| GPT-5 Mini | $0.25 | $2.00 | 400 mil | Mayo de 2024 |
| GPT-5.2 | $1.75 | $14.00 | 400 mil | Agosto de 2025 |
| GPT-5.5 | $5.00 | $30.00 | 1,05 millones | Diciembre de 2025 |
| GPT-5.4 | $2.50 | $15.00 | 1,05 millones | Agosto de 2025 |
| GPT-5.3 Chat | $1.75 | $14.00 | 128K | Agosto de 2025 |
Elegir por comportamiento, no por referencia
La latencia indica si un modelo puede comunicarse. No indica si el modelo debe mantener la herramienta activa, orquestar un flujo de varias etapas o evaluar la llamada una vez finalizada. Cada nivel de la gama de OpenAI tiene una función; los tiempos por sí solos no revelan cuál.
Nivel nano: el más rápido en la salida, el mejor como puerta.
GPT-4.1 Nano y GPT-5.4 Nano presentan los valores TTFT más bajos y se benefician más del enrutamiento prioritario. En la práctica, los modelos nano son menos consistentes en llamadas a herramientas encadenadas: los argumentos JSON a veces varían y las secuencias de llamadas múltiples pueden interrumpirse entre turnos. Son excelentes como clasificadores de intención de primera pasada, detectores de idioma o puertas de confianza; es mejor no implementarlos como el modelo que mantiene la interfaz de la herramienta en un flujo de voz de varios pasos.
Nivel Mini: suficientemente rápido, ideal para subtareas limitadas.
GPT-4.1 Mini y GPT-5.4 Mini parecen ideales a primera vista: ~700 ms en total, p95 inferior a un segundo, buen rendimiento de tokens. El problema radica en la interacción conversacional. En flujos de voz prolongados, los Mini pueden perder el hilo, omitir precondiciones en las llamadas a herramientas y volver a formular preguntas que el interlocutor ya ha respondido. Son eficaces para tareas puntuales (resumir, extraer, clasificar); no son la opción adecuada para la orquestación de conversaciones largas.
Nivel de razonamiento: inteligente, preciso, mejor fuera de la ruta en vivo
GPT-5.2, GPT-5.4 y GPT-5.5 se sitúan entre 1,27 s y 1,36 s en la mediana total, con picos p95 superiores a 4 s en eventos de cola. Estos modelos consumen la mayor parte del presupuesto de turnos por sí solos, dejando poco margen para la finalización, recuperación, validación y síntesis de voz del sistema de reconocimiento automático de voz (ASR). Son ideales para el análisis, la evaluación, la puntuación y el resumen posteriores a la llamada, pero no para la transmisión en directo.
Nivel de modelo completo: GPT-4.1 es la opción de orquestación elegida.
GPT-4o registra el TTFT más bajo, la mediana total más baja y el p95 más ajustado en esta ejecución. También es el modelo con las debilidades más documentadas en el seguimiento de instrucciones y la alucinación. GPT-4.1 es aproximadamente 250 ms más lento, con un total de 783 ms y un p95 de 885 ms, y representa una mejora sustancial en el seguimiento de instrucciones, la disciplina en la llamada a herramientas y la precisión. Para un turno real que debe comportarse de manera confiable, vale la pena pagar esa diferencia de latencia.
“GPT-4o tiene el TTFT más bajo de esta gama y las debilidades más documentadas en cuanto a seguimiento de instrucciones y alucinaciones. El modelo más barato del mercado rara vez es el más barato en el mercado.”
La respuesta correcta es una cartera por turno
Mantener un tiempo de respuesta inferior a un segundo en OpenAI no proviene de elegir un único modelo óptimo; proviene de enrutar toda la gama de OpenAI, un nivel por trabajo, por turno .
- GPT-4.1 en el turno en vivo. El orquestador de la conversación. Selección de herramientas, formulación de argumentos y respuesta oral.
- Mini para asistentes especializados. Subtareas delimitadas y de una sola vez: resumen, extracción, clasificación, formulación de intenciones.
- GPT-4.1 para cadenas complejas. Cuando un flujo tiene que coordinar múltiples llamadas a herramientas y un estado persistente a lo largo de varios turnos, la misma disciplina de seguimiento de instrucciones y llamadas a herramientas rinde frutos compuestos.
- Razonamiento fuera de la línea. Calificar llamadas, enriquecer las notas del CRM, ejecutar evaluaciones durante la noche. Nunca dentro del presupuesto de turnos en vivo.
El modelo de voz adecuado es un portafolio
Para la conversación en vivo, GPT-4.1 es la opción natural: ligeramente más lento que GPT-4o, pero una mejora sustancial en el seguimiento de instrucciones y la alucinación, que es lo que realmente necesita la voz en producción. Para asistentes especializados de una sola vez, mini se adapta al rol. Para cadenas complejas de varios pasos, el mismo GPT-4.1 de nivel completo se encarga de la orquestación. Para la evaluación en tiempo real, modelos de razonamiento.
La pregunta "¿qué modelo de OpenAI es el mejor para la voz?" es incorrecta. La correcta es "¿qué modelo de OpenAI corresponde a este turno?".
Arquitecto para Presencia, no puntos de referencia.
En OpenAI, una pila de voz con prioridad a la latencia rara vez se basa en un solo modelo; suele ser un conjunto de niveles, enrutados por turno con un presupuesto fijo inferior a un segundo. Hable con nuestro equipo para instrumentar los cuatro parámetros clave en su implementación actual.




