OpenAI publicó una guía de la familia GPT-6 el 2 de octubre de 2026. Reúne la elección del modelo, las instrucciones, las tareas prolongadas y las comprobaciones de despliegue. Un equipo de software aún debe encontrar la combinación que supere sus propias pruebas de tareas dentro de sus límites de coste y tiempo de respuesta.
Las opciones actuales de la familia que recoge la guía son GPT-6 Astra, GPT-6.1 Sol y GPT-6 Luna. Comprobamos la documentación y los precios de la API de OpenAI el 3 de octubre. El método de selección y la hoja de trabajo que siguen son propuestas; no ejecutamos los modelos ni medimos una carga de trabajo de producción.
El gran cambio
- Qué ha cambiado: OpenAI presenta ahora la familia GPT-6 como un conjunto de opciones según la carga de trabajo, con un nivel de razonamiento ajustable y herramientas para tareas de varios pasos. Los equipos pueden configurar cada parte de un flujo de trabajo en vez de hacer que un único ajuste del modelo resuelva todas las tareas.
- Por qué importa: Un equipo puede medir si un paso específico de extracción necesita Luna, si una tarea de programación o investigación justifica Sol y en qué casos las capacidades adicionales de Astra compensan su precio. La respuesta depende de las tareas completadas, la latencia y el coste total del flujo, incluido el uso de herramientas y los intentos fallidos.
- Qué conviene seguir: Las ejecuciones prolongadas necesitan traspasos explícitos y comprobaciones. Los ajustes durante la ejecución permiten actualizar las instrucciones; los resultados asíncronos de herramientas y el trabajo delegado también deben conciliarse antes de aceptar la respuesta final.
Elige según la tarea y mide el flujo completo
Empieza con un conjunto representativo de tareas reales y un criterio de aceptación para cada una. OpenAI recomienda la API de Responses para consultar el comportamiento actual de los modelos, el uso de herramientas y el trabajo con estado. Para empezar, se necesitan un proyecto de API, credenciales, acceso a facturación y un modelo disponible para ese proyecto. Las páginas de los modelos no indican compatibilidad con el nivel gratuito; los límites de solicitudes dependen del nivel de uso. Comprueba el acceso y los límites reales de la cuenta antes de dimensionar un despliegue.
Trabajo asignado al modelo | Candidato inicial | Esfuerzo inicial | Cuándo subir de nivel o cambiar |
|---|---|---|---|
Extracción, clasificación o resumen estructurado repetidos con una respuesta clara | | Low para el trabajo rutinario; compáralo con su valor predeterminado, Medium | La tasa de error o el tiempo de revisión superan el umbral del equipo |
Programación, investigación, uso de herramientas o una tarea que requiere criterio profesional | | Medium, el valor predeterminado; prueba High con los casos difíciles | Las tareas representativas fallan incluso con datos de entrada e instrucciones adecuados |
La tarea de razonamiento o revisión más difícil, donde la calidad es decisiva | | Compara Medium y High con los mismos casos | Mantenlo solo si la mejora medida justifica el coste y el tiempo adicionales |
La tabla convierte las recomendaciones sobre los modelos y las páginas de los modelos en puntos de partida para una evaluación. Comprueba los identificadores de modelo de la API y los niveles de esfuerzo admitidos: Astra y GPT-6.1 Sol admiten de Low a Max; Luna también admite None. GPT-6.1 Sol no admite None ni Minimal. OpenAI recomienda probar Extra High o Max, cuando estén disponibles, si High no basta. Compara los niveles de esfuerzo con el mismo conjunto de tareas, porque la calidad, la duración y el uso de tokens pueden variar a la vez.
Para el procesamiento estándar y las solicitudes de hasta 272.000 tokens de entrada, las tarifas actuales de texto por millón de tokens son:
Modelo | Entrada | Entrada en caché | Escritura en caché | Salida |
|---|---|---|---|---|
GPT-6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
GPT-6.1 Sol | $2,00 | $0,10 | $2,50 | $10,00 |
GPT-6 Astra | $10,00 | $1,00 | $12,50 | $50,00 |
Fuentes: las páginas de los modelos Luna, GPT-6.1 Sol y Astra. Las solicitudes con más de 272.000 tokens de entrada tienen tarifas más altas para toda la solicitud. Otros modos de procesamiento, el procesamiento regional cuando esté disponible y algunas herramientas también modifican el coste. Las tres páginas indican una ventana de contexto de 1.050.000 tokens y una salida máxima de 128.000; una ventana amplia es un límite de capacidad, no una razón para enviar todos los documentos disponibles.
Calcula el coste de toda la ruta de la tarea: entrada, entrada en caché, escrituras en caché, salida, cargos de herramientas, reintentos y cualquier suplemento por contexto largo. Divide ese total entre las tareas aceptadas según el mismo criterio de revisión. Después, compara la latencia del paso que percibe el usuario y la del flujo completo. Los precios unitarios por sí solos no permiten saber qué ruta resulta más barata por resultado satisfactorio.
Define la tarea y el resultado antes de añadir herramientas
Define para cada paso una entrada clara, el lector previsto o el consumidor posterior, las fuentes y herramientas permitidas, las restricciones y la condición de finalización. La guía de OpenAI también pide especificar qué decisiones puede tomar el modelo y cuáles requieren la aprobación de una persona. Mantén coherentes esas fronteras en las instrucciones del proyecto, las habilidades y los prompts.
Para obtener resultados legibles por máquina, define de antemano los campos y los valores válidos, y utiliza la guía de Structured Outputs cuando la tarea encaje con un esquema. Considera que una estructura válida es solo una comprobación: un campo puede ajustarse al esquema y aun así contener un error factual. Si el resultado se entrega a una persona, exige que incluya la conclusión, las pruebas utilizadas, las comprobaciones realizadas y las cuestiones pendientes. Contrástalo con las entradas originales y el criterio de aceptación del equipo.
Al evaluar la caché de prompts, coloca primero las instrucciones estables y el material de referencia compartido, y después cambia los detalles de la tarea. La reutilización puede reducir el coste recurrente de entrada, pero el cálculo debe incluir las escrituras en caché y el contexto posterior. La guía anterior sobre caché de prompts de BIG CHANGE profundiza en el diagnóstico de la caché.
Mantén las tareas prolongadas bajo supervisión
La guía del 2 de octubre describe cómo ajustar el rumbo de una ejecución en curso, realizar llamadas asíncronas a herramientas y delegar tareas independientes en subagentes paralelos. Una corrección enviada mediante la API WebSocket de Responses queda en cola: no revierte acciones ya completadas ni detiene una herramienta que ya se está ejecutando. Una herramienta asíncrona permite avanzar en tareas no relacionadas, pero las dependientes deben esperar su resultado. La compatibilidad con varios agentes en GPT-6.1 Sol a través de la API de Responses sigue en beta.
En una ejecución de varios pasos, guarda el ID de la tarea, el modelo y el nivel de esfuerzo elegidos, la etapa actual, los ID de las llamadas a herramientas y sus resultados, las aprobaciones y las pruebas que respaldan la respuesta final. Decide de antemano qué hacer ante un tiempo de espera agotado, una llamada fallida, un cambio de instrucciones o un resultado duplicado. Cuando el contexto crezca, la compactación puede reducir la información que se conserva; comprueba qué retiene realmente la ejecución que continúa en vez de darlo por supuesto. El modo en segundo plano de OpenAI es otra opción documentada para tareas que duran más que una sola solicitud. Elige estos controles en función de la duración del trabajo y de las necesidades de recuperación.
La guía de OpenAI recomienda usar una API directa o una herramienta conectada cuando pueda ejecutar el paso, y recurrir a la interacción con la pantalla cuando sea necesaria. La guía de tareas de navegador de la API Agents de BIG CHANGE explica la interfaz de uso del ordenador y cómo supervisarla.
Una hoja de trabajo para que el equipo pueda reproducir la decisión
Usa los mismos casos y el mismo criterio de revisión con cada candidato. Esta hoja de trabajo es un método de evaluación propuesto; BIG CHANGE no ha introducido ni probado resultados.
Registra cada caso y candidato | Dato que se debe conservar |
|---|---|
Tarea y resultado esperado | ID de entrada real, requisitos de salida, herramientas permitidas y criterio de aceptación |
Configuración | ID del modelo de la API, esfuerzo, modo de procesamiento, versión del prompt, esquema o contrato de salida |
Resultado | Aceptada, rechazada o pendiente de revisión; motivo del fallo; persona revisora |
Tiempo | Duración total y duración del paso que percibe el usuario |
Uso y coste | Tokens de entrada, de entrada en caché, de escritura en caché y de salida; tarifas de herramientas; reintentos; suplemento por contexto largo o procesamiento regional |
Decisión | Tareas aceptadas divididas entre tareas intentadas; coste total dividido entre tareas aceptadas; tipos de fallos sin resolver |
Incluye casos sencillos y difíciles, entradas malformadas e interrupciones en el uso de herramientas que se den en el flujo de trabajo real. Mantén fijos los casos al comparar modelos y repite la evaluación después de cambiar los prompts o los permisos de las herramientas. Clasifica los fallos: falta de pruebas, campo incorrecto, error de herramienta, instrucción omitida o respuesta que necesita corrección humana. Cambia un paso a otro modelo solo si el mismo criterio de aceptación demuestra una mejora útil. Un modelo más barato que requiera más trabajo de corrección puede costar más por tarea aceptada; uno más lento quizá sirva para una fase en segundo plano, pero no para una fase interactiva.
Antes del lanzamiento, comprueba los límites reales de solicitudes y gasto del proyecto, los controles de datos, los tiempos de espera, el comportamiento de los reintentos, la supervisión y los límites de aprobación humana con la lista de comprobación para el despliegue de OpenAI. Mantén un proceso de revisión por muestreo tras el lanzamiento y vuelve a ejecutar la hoja de trabajo cuando cambie un alias de modelo, un prompt, una herramienta o la carga de trabajo. Usa los datos de las tareas resultantes para decidir cómo distribuirlas.
Fuentes y lecturas adicionales
- La guía de la familia GPT-6 de OpenAI del 2 de octubre recoge las recomendaciones del proveedor sobre modelos, esfuerzo, instrucciones y flujos de trabajo prolongados. No presenta resultados de pruebas de BIG CHANGE ni identifica el mejor modelo para la carga de trabajo de un equipo concreto.
- GPT-6 Luna, GPT-6.1 Sol y GPT-6 Astra describen los ID de API, el esfuerzo admitido, el contexto, los precios y los límites por nivel citados aquí. Aún es necesario comprobar el acceso y la facturación de la cuenta actual.
- La lista de comprobación para el despliegue de la API de OpenAI respalda la recomendación de evaluar tareas representativas, configurar la API de Responses y planificar los controles de producción. La hoja de trabajo anterior es un método propuesto por BIG CHANGE, no una comparativa del proveedor.
- Structured Outputs, compactación y modo en segundo plano explican las interfaces concretas mencionadas en el flujo de trabajo.



