El 8 de octubre de 2026, OpenAI añadió Ultrafast para GPT-6.1 Sol a la API Responses. Según el registro oficial, reduce el intervalo entre los tokens que genera el modelo. La contrapartida es concreta: cuesta seis veces la tarifa estándar. La documentación consultada no permite prometer una reducción determinada del tiempo total de una tarea.
Es un nivel de servicio adicional del modelo anunciado anteriormente, disponible para todos los usuarios de la API y sujeto a límites. Esta novedad corresponde a la API; no anuncia una opción nueva de ChatGPT.
Qué cambia en la integración
La configuración utiliza model: "gpt-6.1-sol" y service_tier: "ultrafast" en Responses. Admite peticiones HTTP. OpenAI recomienda una conexión persistente mediante WebSockets, especialmente para agentes con llamadas frecuentes a herramientas, porque la sobrecarga de red puede reducir la ventaja de latencia.
Los límites de uso de Ultrafast son independientes de Standard y Fast. Conviene comprobar los de la organización antes de aumentar tráfico. GPT-6.1 Sol admite procesamiento global y residencia de datos en Estados Unidos y la Unión Europea con este modo; activar service_tier no configura por sí solo la residencia regional.
El coste, con un ejemplo
Por millón de tokens en contexto corto, las tarifas en dólares son:
- Standard: 2 USD de entrada y 10 USD de salida.
- Ultrafast: 12 USD de entrada y 60 USD de salida.
Ejemplo hipotético, no ejecutado: una petición con 1.000 tokens de entrada sin caché y 500 de salida facturables costaría 0,007 USD en Standard y 0,042 USD en Ultrafast. Diez mil peticiones iguales representarían 70 frente a 420 USD. Esos 500 tokens incluyen el razonamiento facturable si lo hay; no equivalen necesariamente a 500 tokens de texto visible.
El cálculo supone contexto corto y excluye escrituras de caché, herramientas, primas regionales y otros cargos. Para entradas de más de 272.000 tokens, la petición completa utiliza las tarifas de contexto largo. Hay precios específicos para caché y una prima del 10 % para procesamiento regional cuando corresponde: revisa la tabla antes de presupuestar.
Cuándo merece una prueba
Nuestra recomendación es empezar por tareas interactivas donde una persona espera la respuesta. Compara tiempo hasta el primer token, tiempo total y coste con la misma tarea antes de extenderlo. Si un agente tarda sobre todo en consultar servicios externos, acelerar la generación puede reducir poco la duración del trabajo: es una consideración de diseño, no una medición de Puntoes.
Ultrafast ofrece otra opción para intercambiar coste por velocidad. Los precios sí están documentados; el ahorro real de tiempo en tu aplicación requiere medirlo.