OpenAI lanza Ultrafast: GPT-5.6 Sol a 14x su velocidad habitual gracias a los chips de Cerebras

Publicado el

OpenAI lanza Ultrafast: GPT-5.6 Sol a 14x su velocidad habitual gracias a los chips de Cerebras

Hay dos formas de hacer que un asistente de IA sea más útil en tiempo real: entrenarlo mejor o hacerlo responder más rápido. OpenAI ha decidido que la segunda opción merecía un producto propio. El 13 de agosto de 2026, la empresa anunció Ultrafast, un nuevo nivel de servicio de su API que corre GPT-5.6 Sol hasta 14 veces más rápido que el modo de procesamiento estándar.

La métrica clave: hasta 750 tokens de salida por segundo. Para contexto: en modo estándar, GPT-5.6 Sol genera en torno a 50-60 tokens por segundo.

Qué es Ultrafast y cómo funciona técnicamente

Ultrafast no es un modelo nuevo. Es el mismo GPT-5.6 Sol — el modelo de frontera más avanzado de OpenAI — ejecutado sobre una infraestructura diferente. La clave es el hardware: OpenAI trabaja con Cerebras para este servicio, usando los chips «wafer-scale» de esa empresa que se distinguen por su arquitectura radicalmente diferente a las GPUs convencionales de Nvidia.

Los chips de Cerebras son literalmente las obleas de silicio más grandes que se fabrican: cada chip es del tamaño de una oblea entera de silicio (en lugar de los chips que se cortan de esa oblea), lo que permite interconexiones de altísimo ancho de banda dentro del chip sin los cuellos de botella que crean los enlaces entre chips separados. Eso los hace especialmente eficientes para tareas de inferencia de alta velocidad donde el tiempo entre tokens es crítico.

750 tokens por segundo equivalen a generar texto a una velocidad que supera en varias veces la velocidad de lectura humana. En la práctica, para un usuario que pregunta algo simple, la respuesta llega casi instantáneamente. Para aplicaciones de código donde un agente genera bloques largos de código sin parar, la aceleración es el factor que puede cambiar si la herramienta se siente «instantánea» o «tiene lag».

Por qué la velocidad importa más de lo que parece

La síntesis del anuncio de OpenAI es esta frase: «Hasta ahora, conseguir velocidad en tiempo real típicamente significaba elegir un modelo más pequeño o más especializado. Ultrafast apunta en una nueva dirección: más trabajo útil por segundo».

Eso describe un trade-off real. En producción, cuando una app necesita respuesta en menos de dos segundos, los equipos de ingeniería han optado históricamente por usar modelos más pequeños (que responden más rápido pero son menos capaces) o modelos especializados para tareas concretas (que responden rápido en su dominio pero no en otros). Ultrafast ofrece la alternativa de usar el modelo más capaz sin ese compromiso.

El programa Daybreak Red de OpenAI y la expansión de las capacidades empresariales de GPT-5.6 siguen el mismo patrón: la empresa está apostando por llegar a producción en los entornos más exigentes, no solo en los demos de laboratorio. Ultrafast es la capa de velocidad que faltaba para que GPT-5.6 sea viable en los casos de uso más sensibles a la latencia.

Los casos de uso que OpenAI cita explícitamente:

  • Respuesta a incidentes de ciberseguridad: cuando un sistema detecta una anomalía, cada segundo entre la detección y la respuesta importa. Un agente que puede analizar logs, identificar el patrón de ataque y proponer mitigación en tiempo real — no en 30 segundos — cambia el modelo operativo del equipo de seguridad.
  • Customer service: los sistemas de atención al cliente con IA basada en LLMs grandes son percibidos como lentos cuando el tiempo de respuesta es similar al de un humano pensando. A 750 tokens por segundo, la respuesta llega antes de que el usuario haya terminado de leer la pregunta anterior.
  • Análisis de mercados financieros: para los traders algorítmicos que integran inteligencia basada en lenguaje natural en sus estrategias, el lag de los LLMs estándar era un bloqueador estructural. A velocidad Ultrafast, eso cambia.
  • Comercio electrónico: la personalización en tiempo real durante una sesión de compra, generando recomendaciones mientras el usuario navega, requiere velocidad de respuesta sub-segundo.

La evolución de OpenAI hacia modelos propios de hardware va en paralelo al partnership con Cerebras: la empresa está construyendo su pila de infraestructura de inferencia en múltiples capas, reduciendo gradualmente la dependencia de proveedores únicos. Cerebras para velocidad máxima, Nvidia para volumen, chips propios en desarrollo para eficiencia a largo plazo.

La comparación con alternativas como los modelos acelerados de Anthropic es relevante porque ambas empresas están moviendo el campo de competencia de «qué modelo es más inteligente en benchmarks» hacia «qué modelo puedo integrar de forma real en mi producción». La velocidad es una variable de producción más que una variable de investigación.

Mi valoración

Lo que más me convence de Ultrafast es que resuelve un problema real de ingeniería que tiene cara de cliente concreto. La latencia de los LLMs de frontera es el obstáculo más citado por los equipos que los integran en producción. Que OpenAI no haya tenido que reducir la inteligencia del modelo para conseguir la velocidad — que sea el mismo GPT-5.6 Sol en modo diferente — es el titular correcto.

Lo que más me preocupa es el precio. OpenAI no publicó cuánto costará Ultrafast. Ejecutar el modelo de frontera más avanzado a 14x la velocidad en chips wafer-scale de Cerebras no es barato. Si el precio es prohibitivo para startups y empresas medianas, Ultrafast queda reservado para los casos de uso donde la latencia justifica un coste premium muy alto — lo que limita su impacto en la democratización de la IA de velocidad.

La pregunta a 12 meses es si Ultrafast pasa de «preview» a acceso general con precios públicos que permiten a la comunidad evaluar si compite con otras opciones de inferencia rápida como los servicios de Groq (que usa LPUs para alta velocidad) o Fireworks AI.