Dodici modelli OpenAI, un budget vocale. Cinque esecuzioni per ciascun modello, preimpostato e non preimpostato, predefinito e prioritario. La risposta corretta raramente è un singolo modello. La chiave è scegliere il modello OpenAI più adatto per ogni turno.
Tre numeri della corsa
GPT-40 in priorità, riscaldato, cinque esecuzioni: il TTFT e il p95 più stretti della gamma. GPT-4.1 (leggermente più lento a 783 ms) è la scelta di orchestrazione più sicura nonostante la latenza minima.
Quattro modelli presentano una mediana totale inferiore a 700 ms in modalità prioritaria, ovvero i candidati più adatti per un intervento in tempo reale durante una conversazione. Gli altri non sono più lenti, ma sono progettati per compiti diversi.
GPT-4.1 Nano ha tratto il massimo vantaggio dal routing prioritario. I modelli di ragionamento hanno registrato variazioni minime. La priorità attenua la latenza di coda, non accelera in modo uniforme.
Cosa è stato misurato e come
Un singolo passaggio vocale non è un parametro di riferimento. È un insieme complesso, e il modello ne rappresenta una singola porzione. Questo benchmark isola tale porzione e la sottopone a stress simulando il traffico reale.
A ciascuno dei dodici modelli è stato assegnato lo stesso prompt generato dall'IA vocale e lo stesso budget di generazione. Cinque esecuzioni cronometrate per modello dopo un periodo di riscaldamento, seguite da una fase di avvio a freddo separata per evidenziare il comportamento di coda. Ove supportato, sono stati testati sia il livello predefinito che quello prioritario; laddove la priorità non era disponibile, la richiesta è stata reindirizzata al livello predefinito e la riga è stata contrassegnata di conseguenza.
Vengono riportati tre valori per ciascun modello: TTFT mediana (tempo al primo token utile), TOTALE mediana (richiesta all'ultimo token di una breve risposta vocale) e TOTALE p95 (la coda che il chiamante alla fine sentirà). I modelli di ragionamento (GPT-5.2 / 5.4 / 5.5) sono stati eseguiti con sforzo=nessuno . I modelli non razionali sono stati eseguiti a temp=0,2 .
“Nel campo della voce, la mediana ti dice che impressione farà il tuo pubblico di riferimento. Il p95 ti dice cosa ricorderanno i tuoi clienti.”
Cinque corse per modello, riscaldate, instradamento prioritario
Ordinati in base alla latenza mediana totale. Questa è la condizione più favorevole possibile per ogni modello: connessione preriscaldata, coda prioritaria, output di breve durata del turno vocale. La forma di questa tabella mostra quali modelli appartengono al turno live e quali ad altre fasi della pipeline.
| # | Modello | Servito | TTFT | TOTALE | p95 |
|---|---|---|---|---|---|
| 01 | GPT-4o | priorità | 351 ms | 528 ms | 629 ms |
| 02 | GPT-4.1 Nano | priorità | 483 ms | 657 ms | 1014 ms |
| 03 | GPT-4.1 Mini | priorità | 406 ms | 661 ms | 687 ms |
| 04 | GPT-5.4 Mini | priorità | 458 ms | 703 ms | 3424 ms* |
| 05 | GPT-4o Mini | priorità | 478 ms | 778 ms | 843 ms |
| 06 | GPT-4.1 | priorità | 464 ms | 783 ms | 885 ms |
| 07 | GPT-5.4 Nano | predefinito | 427 ms | 803 ms | 1233 ms |
| 08 | GPT-5 Mini | priorità | 570 ms | 881 ms | 934 ms |
| 09 | GPT-5.2 | priorità | 544 ms | 1274 ms | 1314 ms |
| 10 | GPT-5.5 | priorità | 623 ms | 1342 ms | 4220 ms* |
| 11 | GPT-5.4 | priorità | 473 ms | 1362 ms | 1559 ms |
| 12 | GPT-5.3 Chat | predefinito | 1179 ms | 1917 ms | 2102 ms |
L'instradamento prioritario non garantisce un aumento uniforme della velocità.
La priorità viene venduta come un upgrade a prezzo fisso. I dati dicono il contrario. I maggiori miglioramenti si sono registrati sui modelli più piccoli e veloci, proprio quelli la cui latenza di base era già dominata dal tempo di attesa in coda, non dal calcolo. I modelli di ragionamento hanno guadagnato centinaia di millisecondi in termini assoluti, ma il loro limite minimo è determinato dal ragionamento, non dal routing.
Due modelli (GPT-4o Mini e GPT-5.2) hanno effettivamente ottenuto Più lentamente In questa prova, la priorità è stata del 22% e del 16% rispettivamente. Questo è un segnale forte per non dare per scontato che la priorità sia un miglioramento gratuito; valutatela con i vostri parametri e nel vostro orario di lavoro prima di assegnarle un percorso vocale di produzione.
| Modello | Predefinito | Priorità | Δ |
|---|---|---|---|
| GPT-4.1 Nano | 996 ms | 657 ms | −339 ms · −34% |
| GPT-5 Mini | 1160 ms | 881 ms | −279 ms · −24% |
| GPT-5.5 | 1756 ms | 1342 ms | −414 ms · −24% |
| GPT-4.1 | 877 ms | 783 ms | −94 ms · −11% |
| GPT-4.1 Mini | 726 ms | 661 ms | −65 ms · −9% |
| GPT-5.4 Mini | 770 ms | 703 ms | −67 ms · −9% |
| GPT-4o | 572 ms | 528 ms | −44 ms · −8% |
| GPT-5.4 Nano | 890 ms | 803 ms | — · n/a |
| GPT-5.3 Chat | 2061 ms | 1917 ms | — · n/a |
| GPT-5.4 | 1292 ms | 1362 ms | +70 ms · flat |
| GPT-4o Mini | 637 ms | 778 ms | +141 ms · +22% |
| GPT-5.2 | 1095 ms | 1274 ms | +179 ms · +16% |
La stessa gamma di prodotti, vista attraverso gli occhi di un acquirente.
La latenza determina se un modello può mantenere un turno. Il costo del token, la finestra di contesto e il cutoff di conoscenza determinano se puoi permetterti di mantenerlo al turno su larga scala, con la cronologia corretta e in base ai fatti corretti.
| Modello | Ingresso/1M | Uscita/1M | Contesto | Tagliare |
|---|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 128K | Ottobre 2023 |
| GPT-4.1 Nano | $0.10 | $0.40 | 1,05 milioni | Giugno 2024 |
| GPT-4.1 Mini | $0.40 | $1.60 | 1,05 milioni | Giugno 2024 |
| GPT-5.4 Mini | $0.75 | $4.50 | 400.000 | Agosto 2025 |
| GPT-4o Mini | $0.15 | $0.60 | 128K | Ottobre 2023 |
| GPT-4.1 | $2.00 | $8.00 | 1,05 milioni | Giugno 2024 |
| GPT-5.4 Nano | $0.20 | $1.25 | 400.000 | Agosto 2025 |
| GPT-5 Mini | $0.25 | $2.00 | 400.000 | Maggio 2024 |
| GPT-5.2 | $1.75 | $14.00 | 400.000 | Agosto 2025 |
| GPT-5.5 | $5.00 | $30.00 | 1,05 milioni | Dicembre 2025 |
| GPT-5.4 | $2.50 | $15.00 | 1,05 milioni | Agosto 2025 |
| GPT-5.3 Chat | $1.75 | $14.00 | 128K | Agosto 2025 |
Scegliere in base al comportamento, non in base ai parametri di riferimento.
La latenza indica se un modello è in grado di comunicare. Non indica se il modello debba mantenere la superficie dell'utensile, orchestrare un flusso a più fasi o valutare la chiamata al termine della stessa. Ogni livello della suite OpenAI ha una funzione specifica; i soli tempi non permettono di stabilire quale.
Livello Nano: il più veloce in partenza, il migliore come cancello
GPT-4.1 Nano e GPT-5.4 Nano presentano i valori TTFT più bassi e traggono maggior vantaggio dal routing prioritario. In pratica, i modelli Nano sono meno coerenti nelle chiamate di strumenti concatenate: gli argomenti JSON a volte presentano delle discrepanze e le sequenze di chiamate multiple possono interrompersi tra un turno e l'altro. Sono eccellenti come classificatori di intenti, rilevatori di lingua o gate di confidenza di primo passaggio; è meglio non utilizzarli come modello che gestisce l'interfaccia dello strumento in un flusso vocale a più fasi.
Mini livello: abbastanza veloce, ideale per sotto-attività circoscritte
GPT-4.1 Mini e GPT-5.4 Mini sembrano ideali a prima vista: circa 700 ms totali, p95 inferiore al secondo, throughput dei token discreto. Il problema si presenta nelle conversazioni. Durante flussi vocali più lunghi, i mini possono perdere il filo del discorso, saltare le precondizioni nelle chiamate agli strumenti e riproporre domande a cui l'interlocutore ha già risposto. Sono ottimi per attività singole (riassumere, estrarre, classificare); non sono adatti per l'orchestrazione di conversazioni lunghe.
Livello di ragionamento: intelligente, accurato, migliore fuori dal percorso live
GPT-5.2, GPT-5.4 e GPT-5.5 si attestano tra 1,27 e 1,36 secondi sulla mediana totale, con picchi p95 superiori a 4 secondi sugli eventi di coda. Questi modelli consumano la maggior parte del budget di turni da soli, lasciando poco spazio per la finalizzazione, il recupero, la validazione e il TTS dell'ASR. Sono esattamente ciò che serve per l'analisi, la valutazione, l'assegnazione dei punteggi e la sintesi post-chiamata, ma non in tempo reale.
Livello modello completo: GPT-4.1 è la scelta per l'orchestrazione
In questa simulazione, GPT-40 registra il TTFT più basso, la mediana totale più bassa e il p95 più stretto. È anche il modello con le debolezze più documentate in termini di esecuzione delle istruzioni e allucinazioni. GPT-4.1 risulta circa 250 ms più lento, con un tempo totale di 783 ms e un p95 di 885 ms, e rappresenta un miglioramento sostanziale in termini di esecuzione delle istruzioni, disciplina nell'utilizzo degli strumenti e veridicità. Per un turno in tempo reale che deve comportarsi in modo affidabile, vale la pena pagare quel divario di latenza.
“GPT-4o ha il TTFT più basso in questa gamma e le debolezze più documentate in termini di esecuzione delle istruzioni e allucinazioni. Il modello più economico in termini di tempo raramente è il più economico in termini di conversazione.”
La risposta corretta è un portafoglio per turno
Mantenere un tempo di rotazione inferiore al secondo su OpenAI non deriva dalla scelta di un modello migliore; deriva dall'instradamento dell'intera gamma di OpenAI, un livello per ogni lavoro, per turno .
- GPT-4.1 in tempo reale. Il orchestratore della conversazione. Selezione degli strumenti, formulazione degli argomenti e risposta orale.
- Mini per assistenti specializzati. Sotto-attività circoscritte e da svolgere una sola volta: riassunto, estrazione, classificazione, definizione dell'intento.
- GPT-4.1 per catene complesse. Quando un flusso deve coordinare più chiamate di strumenti e uno stato persistente tra i vari turni, la stessa disciplina nel seguire le istruzioni e nel chiamare gli strumenti genera interessi composti.
- Ragionamento basato sul filo. Valutare le chiamate, arricchire le note del CRM, eseguire le valutazioni durante la notte. Mai nel budget di turno in tempo reale.
Il modello vocale giusto è un portfolio
Per le conversazioni dal vivo, GPT-4.1 è la scelta ideale: leggermente più lento di GPT-40, ma con un notevole miglioramento in termini di capacità di seguire le istruzioni e di simulare allucinazioni, proprio ciò di cui ha bisogno la voce in produzione. Per gli assistenti specializzati per interventi singoli, la versione mini è adatta. Per le sequenze complesse a più fasi, lo stesso GPT-4.1 a livello completo si occupa dell'orchestrazione. Per la valutazione in tempo reale, si utilizzano modelli di ragionamento.
La domanda "quale modello OpenAI è il migliore per il riconoscimento vocale?" è sbagliata. Quella giusta è "quale modello OpenAI è più adatto in questo caso?".
Architetto per presenza, non parametri di riferimento.
Una soluzione di elaborazione vocale a bassa latenza su OpenAI raramente si basa su un singolo modello; si tratta piuttosto di un insieme di livelli, instradati per ogni turno entro un budget fisso inferiore al secondo. Contatta il nostro team per monitorare i quattro parametri fondamentali della tua implementazione attuale.




