AI-translated from English; not yet reviewed by a fluent editor.
# Escolha um modelo GPT-6 para um fluxo de trabalho de API em produção
> Um guia baseado em tarefas para GPT-6 Astra, GPT-6.1 Sol e Luna, com preços atuais da API e uma folha de cálculo para avaliar qualidade, latência e custo antes da implementação.
By BIG CHANGE Editorial
Published: 2026-10-09T20:51:30.540Z
Updated: 2026-10-09T20:51:30.540Z
Canonical: https://bigchange.ai/blog/choose-gpt-6-model-production-api-workflow

AI-generated conceptual editorial illustration by BIG CHANGE.
A OpenAI publicou um [guia da família GPT-6](https://openai.com/index/practical-guide-building-gpt-6/) em 2 de outubro de 2026. O guia reúne a escolha de modelos, instruções, tarefas longas e verificações de implementação. Uma equipa de software tem ainda de encontrar a combinação que passe nos seus próprios testes, respeitando os limites de custo e de tempo de resposta.
As opções atuais da família apresentadas no guia são GPT-6 Astra, GPT-6.1 Sol e GPT-6 Luna. Consultámos a documentação da API e os preços da OpenAI em 3 de outubro. O método de seleção e a folha de cálculo abaixo são propostas; não executámos os modelos nem medimos uma carga de trabalho em produção.
## A grande mudança
- **O que mudou:** A OpenAI apresenta atualmente a família GPT-6 como um conjunto de opções de acordo com a carga de trabalho, com níveis de esforço de raciocínio ajustáveis e ferramentas para tarefas que abrangem várias etapas. As equipas podem configurar cada parte de um fluxo de trabalho, em vez de usarem uma única configuração de modelo para todas as tarefas.
- **Por que isso importa:** Uma equipa pode avaliar se o modelo Luna é adequado a uma etapa de extração focada, se uma etapa de programação ou pesquisa justifica o Sol e em que casos a capacidade adicional do Astra compensa o preço. A resposta depende das tarefas concluídas, da latência e do custo total do fluxo, incluindo a utilização de ferramentas e as tentativas falhadas.
- **O que acompanhar:** As execuções longas exigem transferências e verificações explícitas. É possível atualizar as instruções durante uma execução, mas os resultados assíncronos das ferramentas e o trabalho delegado têm de ser conciliados antes de aceitar a resposta final.
## Escolha por tarefa e avalie o fluxo inteiro
Comece com um conjunto representativo de tarefas reais e um critério de aceitação para cada uma. A OpenAI recomenda a [Responses API](https://developers.openai.com/api/docs/guides/deployment-checklist) para consultar o comportamento atual dos modelos, as chamadas de ferramentas e o trabalho com estado. São necessários um projeto de API, credenciais, acesso à faturação e um modelo disponível para esse projeto. As páginas dos modelos não indicam a existência de um plano gratuito; os limites de pedidos dependem do nível de utilização. Verifique o acesso e os limites efetivos da conta antes de dimensionar a implementação.
| Trabalho atribuído ao modelo | Modelo candidato inicial | Esforço inicial | Promova ou altere quando |
| --- | --- | --- | --- |
| Extração, classificação ou resumo estruturado recorrente com resposta bem definida | `gpt-6-luna` | Low para tarefas rotineiras; compare com o nível predefinido Medium | A taxa de erros ou o tempo de revisão exceder o limite da equipa |
| Programação, pesquisa, uso de ferramentas ou uma etapa de avaliação profissional | `gpt-6.1-sol` | Nível predefinido Medium; teste High nos casos difíceis | As tarefas representativas falham mesmo com dados de entrada e instruções adequados |
| A etapa mais difícil de raciocínio ou revisão, quando a qualidade é decisiva | `gpt-6-astra` | Compare Medium e High nos mesmos casos | Mantenha apenas se o ganho medido justificar o custo e o tempo adicionais |
A tabela transforma as [orientações da OpenAI sobre os modelos](https://openai.com/index/practical-guide-building-gpt-6/) e as [páginas dos modelos](https://developers.openai.com/api/docs/models/compare) em pontos de partida para a avaliação. Confirme os IDs dos modelos na API e os níveis de esforço compatíveis: Astra e GPT-6.1 Sol suportam de Low a Max; Luna também suporta None. GPT-6.1 Sol não suporta None nem Minimal. A OpenAI recomenda experimentar Extra High ou Max, quando disponíveis, se High não for suficiente. Compare os níveis de esforço com o mesmo conjunto de tarefas, porque a qualidade, a duração e o consumo de tokens podem variar em conjunto.
No modo de processamento Standard e para prompts com até 272.000 tokens de entrada, as tarifas atuais por milhão de tokens são:
| Modelo | Entrada | Entrada em cache | Gravação em cache | Saída |
| --- | --- | --- | --- | --- |
| GPT-6 Luna | US$ 0,10 | US$ 0,01 | US$ 0,125 | US$ 0,50 |
| GPT-6.1 Sol | US$ 2,00 | US$ 0,10 | US$ 2,50 | US$ 10,00 |
| GPT-6 Astra | US$ 10,00 | US$ 1,00 | US$ 12,50 | US$ 50,00 |
Fontes de preços: páginas dos modelos GPT-6 [Luna](https://developers.openai.com/api/docs/models/gpt-6-luna), [GPT-6.1 Sol](https://developers.openai.com/api/docs/models/gpt-6.1-sol) e [Astra](https://developers.openai.com/api/docs/models/gpt-6-astra) foram consultadas. Um pedido com mais de 272.000 tokens de entrada tem tarifas mais elevadas para todo o pedido. Outros modos de processamento, o processamento regional, quando disponível, e algumas ferramentas alteram a faturação. As três páginas indicam uma janela de contexto de 1.050.000 tokens e uma saída máxima de 128.000 tokens; uma janela grande é um limite de capacidade, não um motivo para enviar todos os documentos disponíveis.
Estime o custo do percurso completo da tarefa: entrada, entrada em cache, gravações em cache, saída, custos das ferramentas, novas tentativas e qualquer acréscimo por contexto longo. Divida o total pelo número de tarefas aceites segundo o mesmo critério de revisão. Depois, compare a latência na etapa apresentada ao utilizador e no fluxo de trabalho completo. Os preços unitários, por si só, não permitem saber qual é a opção mais barata por resultado bem-sucedido.
## Especifique a tarefa e a saída antes de adicionar ferramentas
Defina para cada etapa uma entrada clara, o leitor pretendido ou consumidor seguinte, as fontes e ferramentas permitidas, as restrições e a condição de conclusão. O guia da OpenAI também recomenda indicar quais as decisões que o modelo pode tomar e quais exigem aprovação de uma pessoa. Mantenha coerentes os limites definidos nas instruções do projeto, nas competências e nos prompts.
Para saídas legíveis por máquina, defina antecipadamente os campos e os valores válidos; depois, use o [guia de Saídas Estruturadas](https://developers.openai.com/api/docs/guides/structured-outputs) quando um esquema for adequado à tarefa. Considere a validade do formato apenas uma das verificações: um campo pode respeitar o esquema e, ainda assim, conter um erro factual. Se a saída for uma entrega a uma pessoa, exija o resultado, as evidências utilizadas, as verificações realizadas e as questões por resolver. Compare o resultado com os dados de entrada originais e o critério de aceitação da equipa.
Coloque instruções estáveis e material de referência partilhado antes de alterar os detalhes da tarefa ao avaliar o [cache de prompts](https://developers.openai.com/api/docs/guides/prompt-caching). A reutilização pode reduzir o custo recorrente das entradas, mas as gravações em cache e o contexto posterior também devem ser incluídos na estimativa. O guia anterior da BIG CHANGE sobre [cache de prompts](https://bigchange.ai/blog/gpt-6-prompt-caching-agent-context-costs) detalha o diagnóstico do cache.
## Mantenha o trabalho de longa duração fácil de inspecionar
O [guia de 2 de outubro](https://openai.com/index/practical-guide-building-gpt-6/) descreve a orientação durante a execução, as chamadas assíncronas de ferramentas e os subagentes em paralelo para trabalho independente. Uma correção enviada através da API WebSocket da Responses fica em fila; não anula ações concluídas nem interrompe uma ferramenta que já esteja em execução. Uma ferramenta assíncrona permite que o trabalho não relacionado prossiga, mas as etapas dependentes têm de aguardar pelo resultado. O suporte multiagente do GPT-6.1 Sol na API Responses está atualmente em beta.
Numa execução com várias etapas, registe o ID da tarefa, o modelo e o nível de esforço escolhidos, a etapa atual, os IDs das chamadas de ferramentas e dos respetivos resultados, as aprovações e as evidências que sustentam a resposta final. Decida antecipadamente o que fazer em caso de tempo limite, falha numa chamada de ferramenta, alteração das instruções ou resultado duplicado. Quando o contexto se expande, a [compactação](https://developers.openai.com/api/docs/guides/compaction) pode reduzir o conteúdo levado adiante; inspecione o que a execução continuada realmente preserva. O [modo em segundo plano](https://developers.openai.com/api/docs/guides/background) é outra opção documentada para tarefas que ultrapassam um único pedido. Escolha estes controlos de acordo com a duração do trabalho e as necessidades de recuperação.
O guia da OpenAI recomenda uma API direta ou uma ferramenta ligada quando esta puder executar a etapa, e interação com o ecrã quando for necessária. O guia da BIG CHANGE sobre [tarefas de navegação com a Agents API](https://bigchange.ai/blog/openai-agents-api-computer-use-browser-guide) aborda a interface de utilização do computador e o respetivo processo de supervisão.
## Uma folha de cálculo para uma decisão que a equipa possa reproduzir
Use os mesmos casos e o mesmo critério de revisão para cada opção. Esta folha de cálculo é um método de avaliação proposto; a BIG CHANGE não introduziu nem testou resultados.
| Registo por caso e opção | Elemento a registar |
| --- | --- |
| Tarefa e resultado esperado | ID de uma entrada real, requisitos da saída, ferramentas permitidas e critério de aceitação |
| Configuração | ID do modelo de API, esforço, modo de processamento, versão do prompt e esquema ou contrato de saída |
| Resultado | Aceite, rejeitado ou a necessitar de revisão; motivo da falha; revisor |
| Tempo | Duração de ponta a ponta e duração na etapa voltada ao utilizador |
| Utilização e custos | Tokens de entrada, entrada em cache, gravação em cache e saída; tarifas de ferramentas; novas tentativas; adicional por contexto longo ou processamento regional |
| Decisão | Tarefas aceites divididas pelo total de tarefas tentadas; custo total dividido pelo número de tarefas aceites; tipos de falha por resolver |
Inclua os casos fáceis e difíceis, as entradas malformadas e as etapas de ferramentas interrompidas que surjam no fluxo de trabalho real. Mantenha os casos fixos ao comparar modelos e repita a avaliação depois de alterar os prompts ou as permissões das ferramentas. Analise as falhas por tipo: falta de evidências, campo incorreto, erro de ferramenta, instrução não cumprida ou resposta que exija correção humana. Só mude uma etapa para outro modelo quando o mesmo critério de aceitação demonstrar um ganho útil. Um modelo mais barato que exija mais retrabalho pode custar mais por tarefa aceite; um modelo mais lento pode ser adequado a uma etapa em segundo plano, mas não a uma etapa interativa.
Antes do lançamento, compare os limites efetivos de utilização e de despesa do projeto, os controlos de dados, os tempos limite, o comportamento de novas tentativas, a monitorização e os limites de aprovação humana com a [lista de verificação de implementação](https://developers.openai.com/api/docs/guides/deployment-checklist) da OpenAI. Mantenha um processo de revisão por amostragem após o lançamento e repita a avaliação sempre que mudar um alias de modelo, um prompt, uma ferramenta ou a carga de trabalho. Use os dados obtidos nas tarefas para decidir o encaminhamento.
## Fontes e leituras complementares
- [Guia da família GPT-6 da OpenAI, de 2 de outubro](https://openai.com/index/practical-guide-building-gpt-6/), com recomendações do fornecedor sobre modelos, esforço, instruções e fluxos de trabalho longos. Não apresenta resultados de testes da BIG CHANGE nem indica o melhor modelo para a carga de trabalho de uma equipa específica.
- [GPT-6 Luna](https://developers.openai.com/api/docs/models/gpt-6-luna), [GPT-6.1 Sol](https://developers.openai.com/api/docs/models/gpt-6.1-sol) e [GPT-6 Astra](https://developers.openai.com/api/docs/models/gpt-6-astra) documentam os IDs da API, o esforço compatível, o contexto, os preços e os limites por nível usados aqui. Ainda é preciso verificar o acesso e a faturação da conta atual.
- [Lista de verificação de implementação da API da OpenAI](https://developers.openai.com/api/docs/guides/deployment-checklist), que sustenta as recomendações de avaliar tarefas representativas, configurar a API Responses e planear os controlos de produção. A folha de cálculo acima é um método proposto pela BIG CHANGE, não um teste comparativo do fornecedor.
- [Saídas Estruturadas](https://developers.openai.com/api/docs/guides/structured-outputs), [compactação](https://developers.openai.com/api/docs/guides/compaction) e [modo em segundo plano](https://developers.openai.com/api/docs/guides/background) explicam as interfaces específicas mencionadas no fluxo.
## Sources
- [Guia da família GPT-6](https://openai.com/index/practical-guide-building-gpt-6/) — Guia principal do fornecedor sobre funções dos modelos, esforço de raciocínio, instruções e estruturação das saídas, armazenamento em cache, orientação durante a execução, chamadas assíncronas e suporte multiagente em beta. As recomendações não demonstram o sucesso nem o custo em tarefas locais.
- [Documentação do modelo GPT-6 Astra](https://developers.openai.com/api/docs/models/gpt-6-astra) — ID oficial do modelo, níveis de esforço compatíveis, contexto e saída máximos, modalidades, tarifas de tokens no modo Standard, limite de preço para contexto longo e limites por escalão de utilização. As tarifas podem mudar.
- [Documentação do modelo GPT-6.1 Sol](https://developers.openai.com/api/docs/models/gpt-6.1-sol) — Confirma o ID atual do GPT-6.1 Sol, os níveis de raciocínio padrão e compatíveis, chamadas de ferramentas na Responses API, contexto, saída, tarifas, condições regionais e de contexto longo e limites por nível.
- [Documentação do modelo GPT-6 Luna](https://developers.openai.com/api/docs/models/gpt-6-luna) — Confirma o foco em tarefas específicas, níveis de esforço de None a Max, suporte a ferramentas na API Responses, limites de contexto e de saída, tarifas no modo Standard e limites por escalão de utilização.
- [Lista de verificação de implementação da API](https://developers.openai.com/api/docs/guides/deployment-checklist) — Recomendações de produção da OpenAI sobre a API Responses, a escolha de modelo e de nível de esforço, avaliações representativas, controlos de ferramentas e contexto, fiabilidade e monitorização. Não valida a folha de cálculo proposta.
- [Saídas estruturadas do modelo](https://developers.openai.com/api/docs/guides/structured-outputs) — Interface oficial para esquemas de saída. Uma estrutura conforme não comprova a correção factual; o artigo recomenda uma revisão independente.
- [Cache de prompts](https://developers.openai.com/api/docs/guides/prompt-caching) — Comportamento oficial do cache e orientação para prefixos estáveis, mencionados brevemente. O artigo anterior #29 da BIG CHANGE aborda em detalhe o diagnóstico do cache.
- [Compactação](https://developers.openai.com/api/docs/guides/compaction) — Mecanismo oficial para reduzir o contexto de conversas longas; o artigo recomenda verificar o estado preservado em vez de presumir que tudo foi mantido perfeitamente.
- [Modo em segundo plano](https://developers.openai.com/api/docs/guides/background) — Documenta um modo da Responses para tarefas longas; citado apenas como uma opção disponível de continuidade.
Newsletter BIG CHANGE
A perspetiva geral, ao seu ritmo.
Histórias recentes sobre IA e robótica, mudanças que vale a pena acompanhar e ideias práticas para utilizar. Escolha um briefing diário, um resumo semanal ou uma perspetiva mensal.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
A sua privacidade, a sua escolha.
O armazenamento necessário ajuda a proteger o site e a memorizar as suas escolhas. O Google Analytics opcional permanece desativado até que o autorize. Pode ler todos os artigos utilizando apenas o armazenamento necessário. Detalhes de privacidade