GPT-6 Astra: What Analysis and Benchmarks Say About the Model

Independent benchmarks show GPT-6 Astra excels in agentic coding at a fraction of the cost, but its higher price offsets efficiency gains in general intelligence tasks.

GPT-6 Astra: O que análises e benchmarks apontam sobre o modelo

O GPT-6 Astra, lançado em 3 de setembro de 2026, mostra ganhos relevantes em tarefas de codificação com agentes, empatando com os modelos mais fortes do mercado por menos da metade do custo. Já no índice geral de inteligência, ele usa menos tokens que seu antecessor, mas essa eficiência é anulada pelo aumento de preço.

Por que isso importa para quem usa a Tess

Na Tess, você tem acesso a diversos modelos de IA em um só lugar — e escolher o modelo certo para cada tarefa impacta diretamente o custo e a qualidade do resultado.

O GPT-6 Astra é o novo modelo de raciocínio da OpenAI, sucessor do GPT-5.6 Sol. Os números divulgados pela Artificial Analysis, referência independente em benchmarks de IA, ajudam a entender em quais cenários ele se destaca — e em quais a troca ainda pode não fazer sentido.

Preço: ficou mais caro

O preço do GPT-6 Astra é 2,5 vezes maior que o do GPT-5.6 Sol em toda a tabela: passou de US$ 4 / US$ 20 para US$ 10 / US$ 50 por milhão de tokens de entrada e saída.

O modelo mantém o desconto de 90% para leitura em cache e o acréscimo de 25% para escrita em cache.

Resumo rápido: há duas histórias diferentes. No Coding Agent Index, focado em agentes de código, o Astra empata com os melhores modelos por menos da metade do custo. No Intelligence Index, de inteligência geral, ele é mais eficiente em tokens que o antecessor, mas o aumento de preço reduz essa vantagem.

Destaques no Índice de Agentes de Código

Rivaliza com os principais modelos do mercado

No Codex, o GPT-6 Astra pontua 67 no índice — praticamente empatado com Claude Opus 5, Fable 5 e Muse Spark 1.3. O líder do índice é o Fable 5.1, com 70 pontos.

70% mais eficiente em tokens que o GPT-5.6 Sol

O Astra apresenta uma melhora substancial de eficiência: usa cerca de um terço dos tokens do GPT-5.6 Sol em esforço máximo no ambiente Codex e apenas um quinto dos tokens do Claude Opus 5 em modo xhigh.

Isso posiciona diferentes níveis de esforço do modelo na chamada fronteira de Pareto de eficiência: as melhores combinações disponíveis entre qualidade e uso de tokens.

Lidera a fronteira de custo-eficiência

Em esforço máximo, o GPT-6 Astra custa aproximadamente o mesmo que o GPT-5.6 Sol em esforço máximo, mas pontua 2 pontos acima no índice.

Por tarefa, o modelo custa menos da metade do Claude Fable 5 para a mesma pontuação.

Coding Agent Index

Fonte: Artificial Analysis — Coding Agent Index.

As melhorias de custo no índice de codificação são puxadas pela eficiência de tokens: uma redução de aproximadamente 3 vezes no uso de tokens em esforço máximo, comparado ao GPT-5.6 Sol.

Eficiência de tokens em codificação

Fonte: Artificial Analysis — eficiência de tokens no Coding Agent Index.

Custo por tarefa versus índice de codificação

Fonte: Artificial Analysis — Coding Agent Index versus custo por tarefa.

Destaques no Índice de Inteligência

Empata com o GPT-5.6 Sol em inteligência geral

O GPT-6 Astra pontua 61, empatado com o GPT-5.6 Sol no índice de inteligência geral.

O resultado fica 5 pontos abaixo do Claude Fable 5.1 em configuração máxima com fallback, além de ficar atrás do Muse Spark 1.3, da Meta.

Cerca de 10% menos tokens de saída, mas com preço mais alto

O GPT-6 Astra estabelece uma nova fronteira de Pareto entre inteligência e tokens de saída por tarefa, com redução de aproximadamente 10% no uso de tokens em esforço máximo, em comparação ao GPT-5.6 Sol.

No entanto, como seu preço aumentou 2,5 vezes, o modelo se torna 75% mais caro por tarefa que seu antecessor em esforço máximo.

Reduz alucinações à metade

Um dos dados mais relevantes está no AA-Omniscience, benchmark de conhecimento e alucinação da Artificial Analysis.

A taxa de alucinação caiu de 92% para 51% em esforço máximo. Além disso, a melhora não veio acompanhada de perda de precisão: a acurácia aumentou 4 pontos.

Ganho de aproximadamente 80 pontos no AA-Briefcase

O GPT-6 Astra melhora cerca de 80 pontos no AA-Briefcase, benchmark voltado a projetos de trabalho de conhecimento de longo prazo, com múltiplas tarefas ligadas entre si e milhares de arquivos de referência.

O modelo avançou tanto na avaliação por rubrica quanto em qualidade analítica. Por outro lado, houve queda em qualidade de apresentação, dimensão na qual o GPT-5.6 Sol ainda lidera.

Resultados mistos em outras avaliações

O modelo ganhou 6 pontos no Humanity's Last Exam, avaliação com foco em matemática, ciências e humanidades.

Em contrapartida, houve queda de aproximadamente 80 pontos de Elo no GDPval-AA v2, benchmark que mede tarefas de valor econômico em 44 profissões. Também foram observadas pequenas regressões em atendimento ao cliente, problemas científicos de Python e raciocínio sobre documentos longos.

Inteligência versus tokens de saída por tarefa

Fonte: Artificial Analysis — Intelligence Index versus tokens de saída por tarefa.

O GPT-6 Astra é 75% mais caro que o GPT-5.6 Sol em esforço máximo e, por isso, fica majoritariamente atrás do antecessor na comparação entre inteligência e custo por tarefa.

Inteligência versus custo por tarefa

Fonte: Artificial Analysis — Intelligence Index versus custo por tarefa.

Taxa de alucinação no AA-Omniscience

Fonte: Artificial Analysis — AA-Omniscience, benchmark de conhecimento e alucinação.

AA-Briefcase e GDPval-AA v2

Fonte: Artificial Analysis — AA-Briefcase e GDPval-AA v2.

Resumindo, na prática

  • Para tarefas de código e agentes: o GPT-6 Astra é uma escolha muito forte. Entrega desempenho no nível dos principais modelos do mercado com uma relação custo-benefício competitiva.
  • Para inteligência e raciocínio geral: a eficiência adicional em tokens não compensa necessariamente o aumento de preço. Compare alternativas antes de migrar um fluxo.
  • Para tarefas que exigem precisão factual: a redução da taxa de alucinação é um avanço relevante, mas respostas críticas ainda devem passar por validação humana.
  • Para projetos longos e complexos: o modelo mostra ganhos em qualidade analítica, mas o resultado final pode precisar de revisão de apresentação.

A melhor forma de decidir qual modelo usar em cada fluxo é testá-lo no seu caso de uso. Com a Tess, você pode comparar modelos em um único workspace e escolher a melhor combinação entre qualidade, velocidade e custo.


Fonte: dados, gráficos e metodologia originais da Artificial Analysis — Benchmarking GPT-6 Astra, publicado em 3 de setembro de 2026.

Construa com TESS

Transforme ideias deste artigo em fluxos de IA funcionais.

Crie agentes, automações e fluxos com conhecimento em uma plataforma feita para times.