OpenAI quiere reducir uno de los principales límites de los modelos de razonamiento: el tiempo de espera. Su nueva infraestructura permite ejecutar GPT-5.6 Sol a una velocidad pensada para aplicaciones que necesitan respuestas prácticamente en tiempo real.
📌 En resumen
- Ultrafast ejecuta GPT-5.6 Sol hasta 14 veces más rápido que el procesamiento Standard.
- El sistema puede alcanzar hasta 750 tokens de salida por segundo.
- La infraestructura está impulsada por Cerebras y se estrena inicialmente en la API de OpenAI.
- El acceso está limitado a un grupo seleccionado de clientes mientras OpenAI amplía la capacidad.
OpenAI ha presentado Ultrafast, un nuevo nivel de servicio de su API diseñado para ejecutar GPT-5.6 Sol hasta 14 veces más rápido que el procesamiento Standard. La compañía asegura que el sistema puede alcanzar hasta 750 tokens de salida por segundo, una velocidad orientada a aplicaciones donde la latencia condiciona directamente la experiencia del usuario.
La principal diferencia frente a otras estrategias de aceleración es que Ultrafast no parte de un modelo más pequeño. OpenAI está utilizando su modelo insignia GPT-5.6 Sol sobre infraestructura de Cerebras para aumentar drásticamente la velocidad de inferencia.
GPT-5.6 Sol alcanza 750 tokens por segundo
OpenAI sitúa el techo de Ultrafast en 750 tokens de salida por segundo. La cifra representa hasta 14 veces la velocidad del procesamiento Standard utilizada como referencia por la compañía.
La mejora tiene una consecuencia especialmente relevante para los modelos capaces de realizar tareas complejas. Una mayor velocidad de generación reduce el tiempo que necesita cada etapa de un flujo de trabajo, algo que puede resultar determinante cuando un agente tiene que analizar información, utilizar herramientas, comprobar resultados y volver a razonar antes de continuar.
El objetivo no es simplemente conseguir respuestas más rápidas en un chatbot. OpenAI está planteando Ultrafast como una infraestructura para productos y servicios en los que una espera de varios segundos puede perjudicar el funcionamiento de toda la experiencia.
Cerebras es la clave para acelerar el modelo
La aceleración se basa en la colaboración de OpenAI con Cerebras, compañía especializada en hardware para inteligencia artificial. En lugar de limitarse a utilizar una configuración convencional de procesamiento, Ultrafast utiliza la infraestructura de Cerebras para ejecutar GPT-5.6 Sol a velocidades muy superiores.
Esto permite mantener el acceso al modelo insignia de la familia GPT-5.6 en lugar de sustituirlo por una alternativa más pequeña diseñada específicamente para responder rápido. La diferencia es importante porque hasta ahora velocidad e inteligencia han obligado con frecuencia a establecer un equilibrio entre ambos factores.
OpenAI busca precisamente reducir ese compromiso: utilizar un modelo de máxima capacidad y, al mismo tiempo, acercar su respuesta a una experiencia de tiempo real.
Estas son las aplicaciones que más pueden beneficiarse
La compañía está orientando Ultrafast especialmente hacia trabajos en los que la latencia tiene un impacto directo. Entre ellos se encuentran la respuesta a incidentes, los agentes de desarrollo, la atención al cliente, las aplicaciones de voz, el comercio electrónico y la investigación financiera.
En una incidencia técnica, por ejemplo, un sistema puede analizar registros, cambios recientes en el código y conversaciones de los ingenieros mientras el problema continúa activo. Una respuesta más rápida permite repetir ese proceso de análisis con mayor frecuencia y tomar decisiones antes.
Algo similar ocurre con los agentes de programación. Cuando un agente genera código, ejecuta una herramienta, recibe un resultado y vuelve a razonar, cada etapa añade tiempo al proceso. Aumentar la velocidad de generación puede reducir considerablemente la duración total de una tarea con múltiples iteraciones.
La voz y el soporte al cliente son otros escenarios clave
Las aplicaciones de voz pueden beneficiarse especialmente de esta tecnología. En una conversación hablada, una pausa demasiado larga entre la pregunta y la respuesta resulta mucho más perceptible que en una interfaz tradicional.
Ultrafast también puede utilizarse para sistemas de soporte capaces de resolver solicitudes complejas mientras mantienen una conversación activa con el cliente. La velocidad adicional permite consultar diferentes sistemas y procesar sus resultados sin introducir pausas tan prolongadas.
En comercio electrónico, OpenAI apunta a otros usos como responder preguntas sobre productos, comprobar inventario, personalizar recomendaciones o solucionar problemas durante el proceso de pago.
OpenAI ya está probando Ultrafast internamente
La compañía también está utilizando esta tecnología dentro de sus propios equipos. En investigación, la mayor velocidad permite consultar fuentes, cruzar información y trabajar con diferentes herramientas en ciclos mucho más cortos.
Esto puede cambiar la forma de realizar determinados experimentos. Procesos que anteriormente requerían lanzar un trabajo, esperar durante horas y revisar los resultados al día siguiente pueden convertirse en ciclos interactivos con varias iteraciones durante la misma jornada.
Los equipos de ingeniería también pueden emplear la velocidad adicional durante incidentes técnicos para analizar registros y conversaciones, investigar posibles causas y validar soluciones mientras el problema sigue desarrollándose.
Ultrafast no llega todavía a todos los usuarios
La principal limitación del lanzamiento es su disponibilidad. Ultrafast se presenta inicialmente como un nivel de servicio de la API de OpenAI y el acceso está restringido a un grupo seleccionado de clientes.
OpenAI explica que ampliará el acceso a medida que aumente su capacidad de infraestructura. Por tanto, los 750 tokens por segundo no deben interpretarse como una velocidad que todos los usuarios de ChatGPT puedan seleccionar actualmente.
Este matiz es especialmente importante porque Ultrafast no es, por ahora, simplemente un nuevo botón de velocidad dentro de ChatGPT. Se trata de una infraestructura orientada inicialmente a desarrolladores y empresas que integran GPT-5.6 Sol en productos y flujos de trabajo.
La velocidad empieza a ser tan importante como la inteligencia
El lanzamiento de Ultrafast muestra cómo está cambiando la competición entre modelos de inteligencia artificial. Durante años, la atención se concentró principalmente en los benchmarks, la capacidad de razonamiento, el contexto y el precio por token.
Con la expansión de los agentes de IA, la latencia adquiere otra dimensión. Un sistema que necesita completar muchas operaciones consecutivas puede perder gran parte de su utilidad si cada paso exige esperar varios segundos.
La apuesta de OpenAI con Ultrafast consiste en llevar un modelo de máxima capacidad hacia ese escenario de tiempo real. Los hasta 750 tokens por segundo no significan que todas las tareas terminen automáticamente 14 veces antes, pero sí reducen uno de los principales cuellos de botella de los flujos de trabajo basados en agentes.
Por ahora, el acceso limitado deja abierta la cuestión más importante: cuánto costará esta velocidad cuando Ultrafast llegue a un público más amplio y qué rendimiento mantendrá cuando la infraestructura tenga que soportar un volumen de usuarios mucho mayor.