La desconexión de la red telefónica pública conmutada (PSTN) no supone el fin del problema de banda estrecha en Gran Bretaña. Apenas es el principio. El Reino Unido está reconstruyendo su infraestructura telefónica en torno a un códec de 1972, y todos los sistemas de inteligencia artificial de voz del país pagarán las consecuencias.
Tres números de una red diseñada para teléfonos de disco
Gran Bretaña está construyendo una IA de voz de clase mundial y enrutándola toda a través de una banda de frecuencia diseñada para una central de cobre en el año El Padrino Se publicó. El costo lo pagan todas las empresas y todos los ciudadanos que hablarán con una máquina por teléfono en la próxima década.
El estándar G.711 (diseñado para centrales telefónicas de cobre y terminales de baquelita) seguirá siendo el mínimo común denominador en la telefonía del Reino Unido en 2026, incluso después de la migración a la tecnología totalmente IP.
La mayor parte de la energía consonántica que los modelos de voz modernos están entrenados para detectar se encuentra entre 1,5 y 8 kHz. Un canal de calidad PSTN elimina la mayor parte de esta energía antes de que cualquier IA pueda percibir la señal.
Los estudios comparativos del sector demuestran que el audio telefónico G.711 provoca un aumento del 10-20% en la tasa de errores de palabras en comparación con el audio de banda ancha del mismo discurso.
Una red diseñada para teléfonos con carcasa de baquelita.
El códec se llama G.711. Este sistema muestrea la voz humana 8.000 veces por segundo y descarta todo lo que supere los 3,4 kHz aproximadamente. Dicha norma se redactó cuando el hogar británico promedio contaba con un único teléfono de disco conectado a una caja de madera en la pared.
En 2026, sigue siendo el códec de facto de la Red Telefónica Pública Conmutada y el mínimo común denominador de la telefonía en el Reino Unido. Según datos de Openreach, es el formato al que probablemente se transcodificará su llamada en el momento en que se conecte con un operador, incluso si su softphone, sus auriculares y su teléfono son capaces de ofrecer un servicio mucho mejor.
Gran Bretaña está haciendo algo realmente extraño. Estamos construyendo inteligencia artificial de voz de primera clase (grandes modelos de lenguaje que razonan en tiempo real, transcriptores entrenados con cientos de miles de horas de habla de alta fidelidad, conversión neuronal de texto a voz que respira) y luego lo estamos enrutando todo a través de una banda de frecuencia diseñada para el ancho de banda de una central telefónica de cobre.
“Estamos mejorando la carretera y manteniendo el carro tirado por caballos.”
El apagado de la PSTN resuelve el problema equivocado.
La reforma principal es sencilla. La infraestructura de cobre está fallando gravemente: Ofcom registró un aumento del 45 % en los incidentes de redundancia significativos en la red telefónica pública conmutada (PSTN) en 2024. El problema radica en los resultados reales de la migración.
Tras múltiples retrasos, la fecha límite impuesta por el sector es ahora finales de enero de 2027. Openreach ha confirmado que la fecha es definitiva. La prohibición de venta de líneas antiguas está vigente en la mayoría de las centrales telefónicas desde 2023, y los aumentos de precios del 20%, y posteriormente del 40%, están dejando fuera de la red a los clientes restantes hasta 2026.
La sustitución de la PSTN no supone una mejora sustancial en la calidad de voz. Se trata de la misma llamada, en el mismo formato de banda estrecha de 8 kHz, transmitida a través de IP en lugar de cobre. La mayoría de los servicios de voz totalmente IP en el Reino Unido siguen utilizando por defecto el códec G.711 (el mismo de 1972) encapsulado en un paquete SIP. Los cables cambian. El audio no.
Existen alternativas de banda ancha. G.722 duplica la frecuencia de muestreo a 16 kHz. EVS alcanza los 20 kHz y cubre todo el rango de audición humana. Opus (utilizado en WhatsApp, Teams y Google Meet) se adapta dinámicamente hasta 48 kHz. Ninguna de ellas es la predeterminada en las troncales SIP del Reino Unido. En el instante en que una llamada atraviesa una puerta de enlace PSTN, una interconexión o un servicio de traducción de números, se transcodifica de nuevo a G.711 y la mejora desaparece.
La "reducción de velocidad de la red telefónica pública conmutada" es la norma, no la excepción.
Los códecs a los que se trasladó el resto del mundo
Ninguna de estas opciones es teórica. Todas están estandarizadas, implementadas en producción y compatibles con todos los dispositivos modernos. El Reino Unido simplemente no las negocia como opción predeterminada en la red que reemplaza a la PSTN.
| Códec | Año | Muestra | Ancho de banda | En producción |
|---|---|---|---|---|
| G.711 | 1972 | 8 kHz | ≤ 3.4 kHz | Código predeterminado de la red telefónica pública conmutada del Reino Unido (PSTN). Sigue siendo el códec de facto en la telefonía totalmente IP. |
| G.722 | 1988 | 16 kHz | ≤ 7 kHz | Banda ancha. Disponible en todos los terminales SIP modernos, pero rara vez es la opción predeterminada. |
| AMR-WB | 2001 | 16 kHz | ≤ 7 kHz | Voz móvil HD. Estándar en redes 3G+ desde principios de la década de 2010. |
| EVS | 2014 | up to 48 kHz | ≤ 20 kHz | Banda ultraancha para VoLTE / VoNR. Nativo en voz 5G. |
| Opus | 2012 | up to 48 kHz | Full hearing range | Por defecto en WhatsApp, Microsoft Teams, Google Meet y la mayoría de los servicios de voz web. |
¿Cuánto te cuesta realmente la tecnología de 8 kHz?
Los argumentos técnicos en contra de la telefonía de banda estrecha no son estéticos. Son matemáticos y resultan brutales para los oyentes, que ahora se encuentran al otro lado de cada línea.
El habla humana contiene información acústica útil muy por encima del límite de 3,4 kHz que impone la norma G.711. Las frecuencias fundamentales, el tono que te permite reconocer a tu madre por teléfono, se sitúan entre 85 y 250 Hz. Las vocales transmiten la energía desde 350 Hz hasta 2 kHz. Hasta aquí, todo compatible con la red telefónica pública conmutada (PSTN).
Las consonantes (las sibilantes, las fricativas y las oclusivas sordas) viven entre 1,5 kHz y 4 kHz Con una energía significativa que se extiende hasta los 8 kHz y más allá. Estos son los sonidos que distinguen "quince" de "dieciséis", "Smith" de "Smyth", "F" de "S" y "Th". Contienen aproximadamente el 5% de la potencia de la voz y contribuyen con cerca del 60% de su inteligibilidad.
Los modelos modernos de reconocimiento de voz (Whisper, Deepgram Nova, Chirp de Google, los modelos propios que se ejecutan en las principales plataformas de IA de voz) se entrenan casi exclusivamente con audio de 16 kHz. Whisper requiere una entrada de 16 kHz por diseño. Si se le proporciona audio telefónico de 8 kHz, se está sobremuestreando información con pérdidas y presentando al modelo una distribución de frecuencia que nunca ha visto durante el entrenamiento.
“La información se eliminó del audio antes de que la IA la procesara. Ningún método de inferencia puede recuperar lo que el códec descartó en el extremo de la portadora.”
Los ingenieros que desarrollan agentes de voz en Twilio suelen reportar una precisión del 50 % en conversaciones que, por lo demás, son claras, justo cuando la llamada llega a un códec de 8 kHz, mientras que la misma conversación se transcribe sin problemas a través del micrófono del navegador. Este problema no se solucionará con un mensaje más inteligente ni con un modelo más complejo. Es un problema de física.
Es fácil pasarlo por alto en una presentación de diapositivas. Un desastre en la producción.
El audio de banda estrecha degrada la IA de voz en al menos seis aspectos: individualmente resulta molesto, en conjunto es catastrófico. Las consecuencias económicas de estos fallos no son teóricas; se pagan cada minuto, en cada llamada mal dirigida, en cada sector regulado que intenta implementar un agente de voz en la red existente.
- Alucinaciones. Los códecs con pérdida introducen ruido metálico y burbujeante que los modelos de IA pueden interpretar como ruido de fondo o habla real. Si un hablante no dice nada, el modelo inventa una palabra. Cada error de transcripción alimenta el modelo LLM, que debe razonar sobre una entrada corrupta.
- Colapso en la toma de turnos. Los agentes de voz detectan cuándo una persona que llama ha dejado de hablar mediante señales acústicas de alta frecuencia. Si se eliminan estas señales, el sistema de reconocimiento de voz se vuelve poco fiable: el agente interrumpe, espera demasiado o habla por encima de la persona que llama.
- La identificación del altavoz se degrada. El audio de banda ancha es aproximadamente el doble de eficaz que el de banda estrecha para los sistemas de reconocimiento de voz, lo cual es importante para la detección de fraudes, la biometría de voz y la verificación del consentimiento.
- Pérdida por transcodificación. Un agente de IA genera Opus a 48 kHz, lo transcodifica a G.711 en la puerta de enlace SIP, lo vuelve a transcodificar a AMR-WB o EVS en la transferencia móvil y llega como una aproximación con múltiples degradaciones.
- Discriminación por multilingüismo y acento. El filtrado de banda estrecha agrava las debilidades de los modelos existentes en el inglés no nativo, los dialectos regionales y las lenguas tonales. Las señales de alta frecuencia que permiten desambiguar fonemas similares son precisamente las que se descartan en primer lugar.
- La cola económica. La transcripción inexacta provoca llamadas IVR mal dirigidas, un aumento de 3 a 5 minutos en el tiempo de atención, tasas de devolución de llamada de aproximadamente el 30 % en la conversión de mensajes de voz a texto y tasas de falsos positivos de aproximadamente el 60 % en los sistemas de análisis de sentimiento. Cuando un centro de contacto indica una tasa de desvío de IA del 12 % mientras que su competidor indica un 35 %, la respuesta a menudo no reside en el modelo, sino en el códec.
Por qué la posición del Reino Unido es excepcionalmente mala
Gran Bretaña no es el único país que utiliza redes telefónicas públicas de banda estrecha. Sin embargo, nos encontramos en una situación peor que la mayoría de nuestros pares, por razones que dependen enteramente de las decisiones políticas tomadas.
La migración en el Reino Unido se ha retrasado dos veces (de diciembre de 2025 a enero de 2027), principalmente debido a dudas sin resolver sobre los usuarios vulnerables de dispositivos de teleasistencia. Estas preocupaciones son legítimas. Los 1,8 millones de británicos que dependen de alarmas personales conectadas mediante líneas de cobre merecen una migración segura.
Pero la industria ha aprovechado la demora como excusa para priorizar la actualización más barata en lugar de la más adecuada. El nuevo servicio digital ofrece una calidad de voz idéntica, no una mejora. Además, el marco regulatorio considera la calidad de audio como una cuestión de preferencia del consumidor.
| País | Posición | Estado |
|---|---|---|
| Estonia | La red telefónica pública conmutada (PSTN) se desconectó en 2017. | Ahead of UK |
| Países Bajos | Se desconectó poco después de Estonia. | Ahead of UK |
| Francia | AMR-WB en redes móviles desde 2010. | Ahead of UK |
| Alemania | Aventajando notablemente al Reino Unido en la migración a IP absoluta. | Ahead of UK |
| Estados Unidos | La cobertura móvil de banda ancha está prácticamente completa; EVS está implementando la tecnología 5G. | Ahead of UK |
| Reino Unido | El apagado se ha pospuesto hasta enero de 2027. El reemplazo será idéntico en cuanto a calidad de audio. | Behind |
Una red troncal de telefonía construida en torno a una especificación de códec de 1972, el mismo año en que el Reino Unido declaró la IA como una prioridad nacional.
Tienen que suceder tres cosas y la ventana se está cerrando.
El apagón de 2027 se está gestionando como un proyecto de ingeniería de red. Debería gestionarse como una actualización de la infraestructura nacional con mínimos explícitos de calidad de voz, porque lo que se especifique ahora será la base para los próximos treinta años.
- Establecer la banda ancha como la opción predeterminada para sistemas totalmente IP. Ofcom debería exigir que todos los servicios de voz basados en IP que se comercialicen como sustitutos de la red telefónica pública conmutada (PSTN) negocien el códec G.722 o superior como preferido, permitiendo el G.711 únicamente como alternativa para interconexiones heredadas. Todos los terminales SIP modernos ya lo admiten. El obstáculo reside en la inercia comercial, no en la dificultad técnica.
- Establecer una hoja de ruta hacia la banda ultraancha. EVS ya está estandarizado, implementado en redes móviles de todo el mundo y representa el estándar natural para la calidad de voz en IP. El Reino Unido debería fijar como objetivo (2030 es factible) que EVS sea el códec predeterminado en todos los nuevos servicios de voz para empresas.
- Considere el audio de la telefonía como infraestructura crítica. Cuando una línea de triaje del NHS, un servicio 101 o una línea directa de prestaciones se ven colapsados por un códec de 1972 que impide que la IA de voz moderna entienda a quienes llaman, se trata del mismo tipo de fallo de infraestructura que la caída de una línea de alarma contra incendios, solo que más lento y generalizado.
“El coste de no hacer nada no es cero. Es el impuesto lento y acumulativo que supone que cada sistema de IA de voz en el Reino Unido tenga un rendimiento inferior al de su equivalente en el extranjero porque el audio que recibe ha sido deliberadamente modificado en el extremo de la red.”
Un límite para todo el sector de la IA de voz del Reino Unido.
El audio que llega a cualquier modelo de voz se configura en el borde de la red, no en la capa de aplicación. Todos los productos de IA de voz que se ejecutan en la telefonía del Reino Unido comparten el mismo límite, y superarlo es una cuestión de infraestructura nacional, no de proveedores.
Independientemente de la IA de voz que se encuentre al otro extremo de la línea (Cloudax, el agente de voz de un proveedor de servicios en la nube, otra plataforma especializada o el módulo de IA de un centro de contacto tradicional), todas heredan el mismo audio. El operador decide qué se conserva del códec; la capa de aplicación hereda lo que queda.
Esto convierte este problema en una solución excepcionalmente manejable. Una red de banda ancha predeterminada en el Reino Unido mejoraría simultáneamente el rendimiento de todas las implementaciones de IA de voz en el país, sin necesidad de coordinación a nivel de aplicación. El mismo modelo de conversión de voz a texto que funciona con una precisión del 88 % en G.711, funciona habitualmente con más del 95 % en G.722, de forma gratuita, en el momento en que la red deja de degradar la llamada.
La calidad de la voz es una propiedad que depende del nivel de la red. Está determinado por lo que ofrecen los operadores, lo que exigen los reguladores y las configuraciones predeterminadas que se incluyan en los estándares que adopte Gran Bretaña durante la migración a la red telefónica pública conmutada (PSTN). Las decisiones que se tomen en 2026 establecerán ese límite para la próxima generación: para cada producto de IA de voz desarrollado en el Reino Unido, cada servicio público que lo adquiera y cada ciudadano que interactúe con uno.
Dejando atrás el siglo XX del cobre y entrando en el siglo XX de la propiedad intelectual.
La desconexión de la red telefónica pública conmutada (PSTN) debería haber sido una oportunidad para que Gran Bretaña avanzara hacia el siglo XXI en materia de voz. Ahora mismo, es una oportunidad para dejar atrás el siglo XX de la tecnología de cobre y adentrarnos en el siglo XX de la tecnología IP, sin que la calidad de audio se haya visto afectada. Eso no es suficiente. Nunca lo ha sido.
A medida que la IA de voz se convierte en la interfaz principal entre los ciudadanos, los servicios públicos y las empresas de las que dependen, el coste de pretender lo contrario se medirá en llamadas de personas no comprendidas, automatización fallida, pérdida de productividad y un país que construyó una IA de primera clase y luego la paralizó en el último momento.
“Podemos hacerlo mejor. Tenemos que hacerlo.”
La plataforma de IA de voz para empresas del Reino Unido.
Cloudax gestiona la clasificación de llamadas entrantes, las campañas salientes y las conversaciones en directo con los clientes en los centros de contacto del Reino Unido. Prueba con un agente en directo o ven a conocer a nuestro equipo.




