Saltar al contenido principal
    Cloudax
    Fogonadura
    Iniciar sesiónHablemos
    Noticias > Investigación

    La lista de preseleccionados en fracciones de segundo: elegir el modelo OpenAI adecuado para la voz en directo.

    Cloudax

    1 de mayo de 2026

    9 minutos de lectura

    Compartir

    Todas las noticias

    Doce modelos de OpenAI, un presupuesto para voz. Cinco ejecuciones de cada uno: precalentamiento y precalentamiento, por defecto y por prioridad. La respuesta correcta rara vez es un solo modelo. Se trata de elegir el modelo de OpenAI adecuado para cada turno.

    Tres números de la carrera

    528 ms
    Mediana total más baja

    GPT-4o con prioridad, precalentado, cinco ejecuciones: el TTFT y p95 más ajustados de la selección. GPT-4.1 (ligeramente más lento, 783 ms) es la opción de orquestación más segura a pesar de su latencia mínima.

    4
    Modelos dentro del presupuesto de producción en vivo

    Cuatro modelos presentan una mediana total inferior a 700 ms en prioridad, siendo estos los candidatos idóneos para la interacción conversacional en tiempo real. El resto no son más lentos, sino que están diseñados para tareas diferentes.

    −34%
    Mejora del nivel de prioridad más alto

    GPT-4.1 Nano fue el que más se benefició del enrutamiento prioritario. Los modelos de razonamiento apenas se modificaron. La prioridad actúa como un amortiguador de latencia de cola, no como una aceleración uniforme.

    Qué se midió y cómo

    Un turno de voz no es una prueba de rendimiento. Es una pila, y el modelo es una porción. Esta prueba de rendimiento aísla esa porción y la somete a la misma presión que el tráfico real.

    A cada uno de los doce modelos se le asignó la misma solicitud de voz con formato de IA y el mismo presupuesto de generación. Se realizaron cinco ejecuciones cronometradas por modelo tras un periodo de calentamiento, seguidas de una pasada de arranque en frío independiente para observar el comportamiento de cola. Cuando fue posible, se probaron tanto los niveles predeterminados como los prioritarios; cuando la prioridad no estaba disponible, la solicitud recurría al nivel predeterminado y la fila se marcaba en consecuencia.

    Se informan tres cifras por modelo: TTFT mediana (tiempo hasta el primer token útil), Mediana TOTAL (solicitud hasta el último token de una breve respuesta de turno de voz) y TOTAL p95 (la cola que el emisor finalmente escuchará). Se ejecutaron modelos de razonamiento (GPT-5.2 / 5.4 / 5.5) con esfuerzo=ninguno Los modelos sin razonamiento se ejecutaron en temperatura=0,2 .

    “En la voz, la mediana indica cómo se sentirá tu demo. El percentil 95 indica qué recordarán tus clientes.”

    Cinco recorridos por modelo, precalentados, enrutamiento prioritario.

    Ordenados por latencia mediana total. Esta es la condición más favorable posible para cada modelo: conexión precalentada, cola de prioridad, salida de turno de voz corta. La forma de esta tabla indica qué modelos corresponden al turno en vivo y cuáles a otras etapas del proceso.

    Nivel prioritario · cinco carreras · calentado
    #ModeloServidoTTFTTOTALp95
    01GPT-4oprioridad351 ms528 ms629 ms
    02GPT-4.1 Nanoprioridad483 ms657 ms1014 ms
    03GPT-4.1 Miniprioridad406 ms661 ms687 ms
    04GPT-5.4 Miniprioridad458 ms703 ms3424 ms*
    05GPT-4o Miniprioridad478 ms778 ms843 ms
    06GPT-4.1prioridad464 ms783 ms885 ms
    07GPT-5.4 Nanopor defecto427 ms803 ms1233 ms
    08GPT-5 Miniprioridad570 ms881 ms934 ms
    09GPT-5.2prioridad544 ms1274 ms1314 ms
    10GPT-5.5prioridad623 ms1342 ms4220 ms*
    11GPT-5.4prioridad473 ms1362 ms1559 ms
    12GPT-5.3 Chatpor defecto1179 ms1917 ms2102 ms
    * El valor p95 se disparó debido a un único evento de cola. La ejecución mini 4 de GPT-5.4 alcanzó los 3,4 s; GPT-5.5 se topó con una cola similar a los 4,2 s. Excluyendo esos valores atípicos, sus medianas siguen siendo precisas.

    El enrutamiento prioritario no es una aceleración uniforme.

    La prioridad se vende como una mejora sin coste adicional. Sin embargo, los datos indican lo contrario. Las mayores mejoras se observaron en los modelos más pequeños y rápidos, precisamente aquellos cuya latencia en el nivel predeterminado ya estaba dominada por el tiempo de espera en la cola, no por el procesamiento. Los modelos de razonamiento reducen el tiempo en cientos de milisegundos en términos absolutos, pero su límite inferior viene determinado por el razonamiento, no por el enrutamiento.

    Dos modelos (GPT-4o Mini y GPT-5.2) de hecho obtuvieron Más lento En esta prueba, la prioridad fue menor, con un aumento del 22 % y del 16 % respectivamente. Esto indica claramente que no se debe asumir que la prioridad es una mejora gratuita; es importante evaluarla en su propio entorno y en su propio horario antes de implementarla en una ruta de voz de producción.

    Predeterminado → Delta de prioridad
    ModeloPor defectoPrioridadΔ
    GPT-4.1 Nano996 ms657 ms−339 ms · −34%
    GPT-5 Mini1160 ms881 ms−279 ms · −24%
    GPT-5.51756 ms1342 ms−414 ms · −24%
    GPT-4.1877 ms783 ms−94 ms · −11%
    GPT-4.1 Mini726 ms661 ms−65 ms · −9%
    GPT-5.4 Mini770 ms703 ms−67 ms · −9%
    GPT-4o572 ms528 ms−44 ms · −8%
    GPT-5.4 Nano890 ms803 ms— · n/a
    GPT-5.3 Chat2061 ms1917 ms— · n/a
    GPT-5.41292 ms1362 ms+70 ms · flat
    GPT-4o Mini637 ms778 ms+141 ms · +22%
    GPT-5.21095 ms1274 ms+179 ms · +16%

    La misma gama de productos, vista desde la perspectiva del comprador.

    La latencia determina si un modelo puede mantener un turno. El costo del token, la ventana de contexto y el umbral de conocimiento determinan si se puede permitir mantenerlo en el turno a gran escala, con el historial correcto y en función de los hechos correctos.

    Costo, contexto, límite
    ModeloEntrada/1MSalida/1MContextoCierre
    GPT-4o$2.50$10.00128KOctubre de 2023
    GPT-4.1 Nano$0.10$0.401,05 millonesJunio de 2024
    GPT-4.1 Mini$0.40$1.601,05 millonesJunio de 2024
    GPT-5.4 Mini$0.75$4.50400 milAgosto de 2025
    GPT-4o Mini$0.15$0.60128KOctubre de 2023
    GPT-4.1$2.00$8.001,05 millonesJunio de 2024
    GPT-5.4 Nano$0.20$1.25400 milAgosto de 2025
    GPT-5 Mini$0.25$2.00400 milMayo de 2024
    GPT-5.2$1.75$14.00400 milAgosto de 2025
    GPT-5.5$5.00$30.001,05 millonesDiciembre de 2025
    GPT-5.4$2.50$15.001,05 millonesAgosto de 2025
    GPT-5.3 Chat$1.75$14.00128KAgosto de 2025
    Fuente: developers.openai.com/api/docs/models, consultado el 1 de mayo de 2026. El precio de los tokens es por cada millón de tokens de texto, en dólares estadounidenses, nivel predeterminado.

    Elegir por comportamiento, no por referencia

    La latencia indica si un modelo puede comunicarse. No indica si el modelo debe mantener la herramienta activa, orquestar un flujo de varias etapas o evaluar la llamada una vez finalizada. Cada nivel de la gama de OpenAI tiene una función; los tiempos por sí solos no revelan cuál.

    Nivel nano: el más rápido en la salida, el mejor como puerta.

    GPT-4.1 Nano y GPT-5.4 Nano presentan los valores TTFT más bajos y se benefician más del enrutamiento prioritario. En la práctica, los modelos nano son menos consistentes en llamadas a herramientas encadenadas: los argumentos JSON a veces varían y las secuencias de llamadas múltiples pueden interrumpirse entre turnos. Son excelentes como clasificadores de intención de primera pasada, detectores de idioma o puertas de confianza; es mejor no implementarlos como el modelo que mantiene la interfaz de la herramienta en un flujo de voz de varios pasos.

    Nivel Mini: suficientemente rápido, ideal para subtareas limitadas.

    GPT-4.1 Mini y GPT-5.4 Mini parecen ideales a primera vista: ~700 ms en total, p95 inferior a un segundo, buen rendimiento de tokens. El problema radica en la interacción conversacional. En flujos de voz prolongados, los Mini pueden perder el hilo, omitir precondiciones en las llamadas a herramientas y volver a formular preguntas que el interlocutor ya ha respondido. Son eficaces para tareas puntuales (resumir, extraer, clasificar); no son la opción adecuada para la orquestación de conversaciones largas.

    Nivel de razonamiento: inteligente, preciso, mejor fuera de la ruta en vivo

    GPT-5.2, GPT-5.4 y GPT-5.5 se sitúan entre 1,27 s y 1,36 s en la mediana total, con picos p95 superiores a 4 s en eventos de cola. Estos modelos consumen la mayor parte del presupuesto de turnos por sí solos, dejando poco margen para la finalización, recuperación, validación y síntesis de voz del sistema de reconocimiento automático de voz (ASR). Son ideales para el análisis, la evaluación, la puntuación y el resumen posteriores a la llamada, pero no para la transmisión en directo.

    Nivel de modelo completo: GPT-4.1 es la opción de orquestación elegida.

    GPT-4o registra el TTFT más bajo, la mediana total más baja y el p95 más ajustado en esta ejecución. También es el modelo con las debilidades más documentadas en el seguimiento de instrucciones y la alucinación. GPT-4.1 es aproximadamente 250 ms más lento, con un total de 783 ms y un p95 de 885 ms, y representa una mejora sustancial en el seguimiento de instrucciones, la disciplina en la llamada a herramientas y la precisión. Para un turno real que debe comportarse de manera confiable, vale la pena pagar esa diferencia de latencia.

    “GPT-4o tiene el TTFT más bajo de esta gama y las debilidades más documentadas en cuanto a seguimiento de instrucciones y alucinaciones. El modelo más barato del mercado rara vez es el más barato en el mercado.”

    La respuesta correcta es una cartera por turno

    Mantener un tiempo de respuesta inferior a un segundo en OpenAI no proviene de elegir un único modelo óptimo; proviene de enrutar toda la gama de OpenAI, un nivel por trabajo, por turno .

    1. GPT-4.1 en el turno en vivo. El orquestador de la conversación. Selección de herramientas, formulación de argumentos y respuesta oral.
    2. Mini para asistentes especializados. Subtareas delimitadas y de una sola vez: resumen, extracción, clasificación, formulación de intenciones.
    3. GPT-4.1 para cadenas complejas. Cuando un flujo tiene que coordinar múltiples llamadas a herramientas y un estado persistente a lo largo de varios turnos, la misma disciplina de seguimiento de instrucciones y llamadas a herramientas rinde frutos compuestos.
    4. Razonamiento fuera de la línea. Calificar llamadas, enriquecer las notas del CRM, ejecutar evaluaciones durante la noche. Nunca dentro del presupuesto de turnos en vivo.

    El modelo de voz adecuado es un portafolio

    Para la conversación en vivo, GPT-4.1 es la opción natural: ligeramente más lento que GPT-4o, pero una mejora sustancial en el seguimiento de instrucciones y la alucinación, que es lo que realmente necesita la voz en producción. Para asistentes especializados de una sola vez, mini se adapta al rol. Para cadenas complejas de varios pasos, el mismo GPT-4.1 de nivel completo se encarga de la orquestación. Para la evaluación en tiempo real, modelos de razonamiento.

    La pregunta "¿qué modelo de OpenAI es el mejor para la voz?" es incorrecta. La correcta es "¿qué modelo de OpenAI corresponde a este turno?".

    Arquitecto para Presencia, no puntos de referencia.

    En OpenAI, una pila de voz con prioridad a la latencia rara vez se basa en un solo modelo; suele ser un conjunto de niveles, enrutados por turno con un presupuesto fijo inferior a un segundo. Hable con nuestro equipo para instrumentar los cuatro parámetros clave en su implementación actual.

    Talk to our teamSee it run live

    Sigue leyendo

    Política · 22 JUL 2026

    La Ley de IA de la UE afecta a la voz: qué significa agosto de 2026 para la IA conversacional

    Las obligaciones de alto riesgo de la Ley entran en vigor el 2 de agosto de 2026. La mayoría de las IA de voz en producción presentan un riesgo limitado, pero no así los servicios de triaje de emergencia, reclutamiento, crédito, seguros, educación y servicios públicos. Se analiza qué se aplica realmente a un agente de voz, dónde se sitúa el límite según el sector y la trampa del rol que convierte a un comprador en proveedor.

    Estándares · 28 MAY 2026

    Cloudax publica OHP: el protocolo de transferencia abierta para IA de voz

    OHP: Protocolo de Transferencia Abierta. Una especificación independiente del proveedor para transferir conversaciones de voz en directo entre agentes de IA, sistemas IVR, centros de contacto y personas, con identidad, intención, consentimiento y continuidad de medios verificados en plataformas competitivas.

    Asociación · 18 MAY 2026

    Cloudax se asocia con Gamma para llevar la IA de voz a las comunicaciones unificadas empresariales

    Cloudax se unió al escenario principal de Gamma en GX Summit 2026 en Westminster como parte de la visión estratégica de IA de Gamma, y realizó una demostración en vivo de IA de voz ese mismo día. Cloudax se integra con los sistemas existentes de Gamma sin necesidad de reemplazarlos ni realizar largas migraciones.

    Descubre cómo la IA más humana de Cloudax puede transformar tu negocio.

    Sin compromiso, consulta gratuita incluida.

    Hablemos
    CloudaxCertificado en Cyber EssentialsCertificado Cyber Essentials PlusCertificación ISO 27001

    Encuéntranos

    167-169 Great Portland St.
    Londres W1W 5PF

    1 Hardman Square
    Manchester M3 3EB

    +44 333 011 1190
    [email protected]

    Soluciones

    • Conectar
    • Entrante
    • Salida
    • Charlar

    Casos de uso

    • Propiedad
    • Legal
    • Finanzas
    • BPO
    • Servicios públicos y energía
    • Automotor
    • Viajes y hostelería
    • Comercio electrónico y venta minorista

    Compañía

    • Sobre nosotros
    • Carreras profesionales
    • Estudios de caso
    • Noticias
    • Prensa
    • Contacto
    • Seguridad
    • Marca

    Legal

    • política de privacidad
    • Términos y condiciones
    • Política de cookies
    • Declaración de accesibilidad
    • Declaración sobre la esclavitud moderna
    • Declaración contra el soborno
    • Código de conducta
    • Política medioambiental y de sostenibilidad
    © 2026 Cloudax Ltd. Todos los derechos reservados. Cloudax® es una marca registrada.