Doze modelos da OpenAI, um orçamento de voz. Cinco execuções para cada modelo, com dados aquecidos e frios, com dados padrão e prioritários. A resposta correta raramente é um único modelo. O segredo é escolher o modelo certo da OpenAI para cada situação.
Três números da sequência
GPT-4o com prioridade, aquecido, cinco execuções: o TTFT e p95 mais precisos da seleção. O GPT-4.1 (ligeiramente mais lento, com 783 ms) é a opção de orquestração mais segura, apesar da latência mínima.
Quatro modelos apresentam uma mediana total inferior a 700 ms na prioridade, sendo os candidatos adequados para a interação em tempo real em conversas. Os demais não são mais lentos, mas sim projetados para tarefas diferentes.
O GPT-4.1 Nano foi o que mais se beneficiou do roteamento prioritário. Os modelos de raciocínio praticamente não sofreram alterações. A prioridade atenua a latência de cauda, não proporciona um aumento de velocidade uniforme.
O que foi medido e como?
A mudança de voz não é um parâmetro de avaliação. É uma pilha, e o modelo é uma fatia dela. Este parâmetro de avaliação isola essa fatia e a submete a testes de estresse da mesma forma que o tráfego real faria.
Cada um dos doze modelos recebeu o mesmo comando de IA de voz e o mesmo orçamento de geração. Foram realizadas cinco execuções cronometradas por modelo após um aquecimento, seguidas de uma inicialização a frio separada para expor comportamentos de cauda. Quando disponíveis, os níveis padrão e prioritário foram testados; quando o nível prioritário não estava disponível, a solicitação foi feita usando o nível padrão e a linha foi marcada de acordo.
Três números relatados por modelo: Mediana do TTFT (tempo até o primeiro token útil), Mediana TOTAL (solicitação ao último token de uma breve resposta de voz) e TOTAL p95 (a cauda que o chamador eventualmente ouvirá). Os modelos de raciocínio (GPT-5.2 / 5.4 / 5.5) foram executados com esforço=nenhum Modelos não racionais foram executados em temp=0,2 .
“Em termos de voz, a mediana indica como será a percepção do seu público-alvo. O percentil 95 indica o que seus clientes se lembrarão.”
Cinco execuções por modelo, aquecidas, roteamento prioritário
Ordenado pela latência mediana total. Esta é a condição mais favorável possível para cada modelo: conexão pré-aquecida, fila prioritária, saída de voz curta. O formato desta tabela mostra quais modelos pertencem à execução em tempo real e quais pertencem a outras etapas do pipeline.
| # | Modelo | Servido | TTFT | TOTAL | p95 |
|---|---|---|---|---|---|
| 01 | GPT-4o | prioridade | 351 ms | 528 ms | 629 ms |
| 02 | GPT-4.1 Nano | prioridade | 483 ms | 657 ms | 1014 ms |
| 03 | GPT-4.1 Mini | prioridade | 406 ms | 661 ms | 687 ms |
| 04 | GPT-5.4 Mini | prioridade | 458 ms | 703 ms | 3424 ms* |
| 05 | GPT-4o Mini | prioridade | 478 ms | 778 ms | 843 ms |
| 06 | GPT-4.1 | prioridade | 464 ms | 783 ms | 885 ms |
| 07 | GPT-5.4 Nano | padrão | 427 ms | 803 ms | 1233 ms |
| 08 | GPT-5 Mini | prioridade | 570 ms | 881 ms | 934 ms |
| 09 | GPT-5.2 | prioridade | 544 ms | 1274 ms | 1314 ms |
| 10 | GPT-5.5 | prioridade | 623 ms | 1342 ms | 4220 ms* |
| 11 | GPT-5.4 | prioridade | 473 ms | 1362 ms | 1559 ms |
| 12 | GPT-5.3 Chat | padrão | 1179 ms | 1917 ms | 2102 ms |
O roteamento prioritário não proporciona um aumento de velocidade uniforme.
A prioridade é vendida como uma atualização direta. Os dados mostram o contrário. Os maiores ganhos foram observados nos modelos menores e mais rápidos, exatamente aqueles cuja latência padrão já era dominada pelo tempo de espera na fila, e não pelo poder computacional. Os modelos de raciocínio reduzem a latência em centenas de milissegundos em termos absolutos, mas seu limite mínimo é definido pelo raciocínio, não pelo roteamento.
Dois modelos (GPT-4o Mini e GPT-5.2) foram realmente obtidos. Mais devagar Nesta execução, a prioridade foi reduzida em 22% e 16%, respectivamente. Isso indica fortemente que não se deve presumir que a prioridade seja uma melhoria gratuita; teste-a em seu próprio prompt e em seu próprio horário antes de implementá-la em um fluxo de voz de produção.
| Modelo | Padrão | Prioridade | Δ |
|---|---|---|---|
| GPT-4.1 Nano | 996 ms | 657 ms | −339 ms · −34% |
| GPT-5 Mini | 1160 ms | 881 ms | −279 ms · −24% |
| GPT-5.5 | 1756 ms | 1342 ms | −414 ms · −24% |
| GPT-4.1 | 877 ms | 783 ms | −94 ms · −11% |
| GPT-4.1 Mini | 726 ms | 661 ms | −65 ms · −9% |
| GPT-5.4 Mini | 770 ms | 703 ms | −67 ms · −9% |
| GPT-4o | 572 ms | 528 ms | −44 ms · −8% |
| GPT-5.4 Nano | 890 ms | 803 ms | — · n/a |
| GPT-5.3 Chat | 2061 ms | 1917 ms | — · n/a |
| GPT-5.4 | 1292 ms | 1362 ms | +70 ms · flat |
| GPT-4o Mini | 637 ms | 778 ms | +141 ms · +22% |
| GPT-5.2 | 1095 ms | 1274 ms | +179 ms · +16% |
A mesma seleção de produtos, vista pela perspectiva do comprador.
A latência determina se um modelo consegue manter uma rodada ativa. O custo do token, a janela de contexto e o limite de conhecimento determinam se você pode se dar ao luxo de mantê-lo na rodada em grande escala, com o histórico correto e considerando os fatos adequados.
| Modelo | Entrada/1M | Saída/1M | Contexto | Cortar |
|---|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 128 mil | Outubro de 2023 |
| GPT-4.1 Nano | $0.10 | $0.40 | 1,05M | Junho de 2024 |
| GPT-4.1 Mini | $0.40 | $1.60 | 1,05M | Junho de 2024 |
| GPT-5.4 Mini | $0.75 | $4.50 | 400 mil | Agosto de 2025 |
| GPT-4o Mini | $0.15 | $0.60 | 128 mil | Outubro de 2023 |
| GPT-4.1 | $2.00 | $8.00 | 1,05M | Junho de 2024 |
| GPT-5.4 Nano | $0.20 | $1.25 | 400 mil | Agosto de 2025 |
| GPT-5 Mini | $0.25 | $2.00 | 400 mil | Maio de 2024 |
| GPT-5.2 | $1.75 | $14.00 | 400 mil | Agosto de 2025 |
| GPT-5.5 | $5.00 | $30.00 | 1,05M | Dezembro de 2025 |
| GPT-5.4 | $2.50 | $15.00 | 1,05M | Agosto de 2025 |
| GPT-5.3 Chat | $1.75 | $14.00 | 128 mil | Agosto de 2025 |
Escolha com base no comportamento, não em parâmetros de comparação.
A latência indica se um modelo consegue se comunicar. Ela não indica se o modelo deve manter a superfície da ferramenta, orquestrar um fluxo de múltiplas interações ou avaliar a chamada após o término. Cada nível na linha de produtos da OpenAI tem uma função; os tempos, por si só, não revelam qual delas.
Nível Nano: o mais rápido na largada, o melhor como portão.
O GPT-4.1 Nano e o GPT-5.4 Nano apresentam os menores valores de TTFT (Tempo até a Primeira Fase) e são os que mais se beneficiam do roteamento prioritário. Na prática, os modelos Nano são menos consistentes em chamadas de ferramentas encadeadas: os argumentos JSON ocasionalmente sofrem deriva e sequências de múltiplas chamadas podem ser interrompidas entre as etapas. Excelentes como classificadores de intenção iniciais, detectores de idioma ou controladores de confiança; melhor não os utilizar como o modelo que mantém a interface da ferramenta em um fluxo de voz com várias etapas.
Mini nível: suficientemente rápido, ideal para subtarefas delimitadas.
À primeira vista, o GPT-4.1 Mini e o GPT-5.4 Mini parecem ideais: tempo de resposta total de aproximadamente 700 ms, pontuação p95 abaixo de um segundo e boa taxa de transferência de tokens. O problema reside na comunicação em conversas. Em fluxos de voz mais longos, os Minis podem perder o controle da situação, ignorar pré-condições em chamadas de ferramentas e repetir perguntas já respondidas pelo interlocutor. São excelentes para tarefas pontuais (resumir, extrair, classificar), mas não são adequados para orquestração de conversas longas.
Nível de raciocínio: inteligente, preciso, melhor fora do caminho real
Os modelos GPT-5.2, GPT-5.4 e GPT-5.5 atingem valores medianos entre 1,27 s e 1,36 s, com picos no percentil 95 acima de 4 s em eventos de cauda. Esses modelos consomem a maior parte do orçamento de tempo de resposta, deixando pouco espaço para finalização, recuperação, validação e síntese de tempo de resposta (TTS) do reconhecimento automático de fala (ASR). Eles são ideais para análise pós-chamada, avaliação, pontuação e sumarização, porém não para uso em tempo real.
Nível de modelo completo: GPT-4.1 é a opção de orquestração.
O GPT-4o apresenta o menor TTFT, a menor mediana total e o p95 mais preciso nesta execução. É também o modelo com as deficiências mais documentadas em relação ao seguimento de instruções e à alucinação. O GPT-4.1 é cerca de 250 ms mais lento, com 783 ms de tempo total e 885 ms de p95, e representa uma melhoria significativa no seguimento de instruções, na disciplina de chamadas de ferramentas e na factualidade. Para uma operação em tempo real que precisa se comportar de forma confiável, essa diferença de latência vale a pena.
“O GPT-4o tem o menor TTFT (Tempo até a Primeira Fase) desta seleção, e as deficiências mais documentadas em relação ao seguimento de instruções e alucinações. O modelo mais barato raramente é o mais barato na conversa.”
A resposta correta é um portfólio por turno.
Conseguir um tempo de resposta inferior a um segundo no OpenAI não se resume a escolher o melhor modelo; resulta de utilizar toda a gama de ferramentas do OpenAI, uma para cada tarefa. por turno .
- GPT-4.1 na curva ao vivo. O orquestrador da conversa. Seleção de ferramentas, formulação de argumentos e resposta verbal.
- Mini para assistentes especializados. Subtarefas delimitadas e de execução única: sumarização, extração, classificação, modelagem de intenção.
- GPT-4.1 para cadeias complexas. Quando um fluxo precisa coordenar múltiplas chamadas de ferramentas e estados persistentes ao longo das etapas, a mesma disciplina de seguir instruções e chamar ferramentas se torna ainda mais valiosa.
- Raciocinando sem pensar muito. Classificar chamadas, enriquecer anotações no CRM, executar avaliações durante a noite. Nunca no orçamento de plantão ao vivo.
O modelo de voz ideal é um portfólio.
Para conversas ao vivo, o GPT-4.1 é a escolha natural: um pouco mais lento que o GPT-40, mas uma melhoria significativa no seguimento de instruções e na capacidade de reproduzir alucinações, que é exatamente o que a voz profissional precisa. Para assistentes especializados para gravações pontuais, o GPT-4.1 Mini é a opção ideal. Para sequências complexas de várias etapas, o GPT-4.1 completo realiza a orquestração. Para avaliações em tempo real, utilize modelos de raciocínio.
A pergunta "qual modelo da OpenAI é o melhor para voz?" está errada. A pergunta certa é "qual modelo da OpenAI é o mais adequado para esta função?".
Arquiteto para Presença, não parâmetros de referência.
Uma pilha de voz com foco na latência na OpenAI raramente se resume a um único modelo; trata-se de um conjunto de camadas, roteadas a cada turno, com um orçamento fixo de menos de um segundo. Converse com nossa equipe sobre como instrumentar os quatro números que importam para sua implementação atual.




