Inteligência artificial, sem ruído.
OpenAI3 min

GPT-5.6 chega em três tiers: Sol, Terra e Luna — veja benchmarks e preços

OpenAI lança oficialmente a família GPT-5.6 com três modelos, tool calling programático e modo multi-agente. Sol lidera o índice de coding com 80 pontos. Confira todos os benchmarks.

GPT-5.6 chega em três tiers: Sol, Terra e Luna — veja benchmarks e preços

A OpenAI liberou para disponibilidade geral a família GPT-5.6, que havia sido anunciada em preview limitado. O lançamento traz três modelos distintos — Sol, Terra e Luna — cada um posicionado em um tier de capacidade e preço, além de novidades importantes como tool calling programático e um modo multi-agente na API.

Três tiers, três faixas de preço

A precificação por 1 milhão de tokens é a seguinte:

ModeloInputOutputPosicionamento
SolUS$ 5US$ 30Flagship — coding, agentes, pesquisa de segurança
TerraUS$ 2,50US$ 15Balanceado — uso empresarial de alto volume
LunaUS$ 1US$ 6Mais rápido e barato — resumo, classificação, rascunho
Preços oficiais da família GPT-5.6 por 1M tokens (julho/2026)

Disponibilidade por superfície

ChatGPT: usuários Plus, Pro, Business e Enterprise acessam o Sol em níveis médio e alto de reasoning. Pro e Enterprise também podem selecionar o GPT-5.6 Sol Pro.

ChatGPT Work e Codex: usuários Free e Go acessam o Terra. Pagos escolhem entre os três modelos e configuram o nível de esforço por modelo. O modo max está disponível para todos com acesso ao GPT-5.6.

API: todos os três tiers estão disponíveis. O tool calling programático e o beta multi-agente rodam na Responses API.

Benchmarks: onde o GPT-5.6 brilha

No Artificial Analysis Coding Agent Index v1.1, o Sol com reasoning máximo atinge 80 pontos — 2,8 acima do Claude Fable 5 (77,2), usando menos da metade dos tokens de saída e menos da metade do tempo.

No Terminal-Bench 2.1, o Sol alcança 88,8% (subindo para 91,9% no modo Ultra com quatro agentes em paralelo). No BrowseComp, chega a 92,2% no modo Ultra. No OSWorld 2.0, marca 62,6% — superando o Claude Opus 4.8 usando 85% menos tokens de saída.

No Agents’ Last Exam, que avalia fluxos de trabalho profissionais longos em 55 áreas, o Sol atinge 52,7%, superando o Fable 5 em 12,2 pontos.

Onde o GPT-5.6 perde

Quatro lacunas merecem destaque:

  • SWE-Bench Pro: Sol (64,6%) fica ~15 pontos atrás do Claude Mythos 5 (80,3%) e do Fable 5 (80%) — diferença significativa em coding.
  • Inteligência geral: Fable 5 lidera no AA Intelligence Index v4.1 (59,9 vs 58,9) e no GDPval-AA v2 por ~12 Elo.
  • Tool use: No Toolathlon, Sol (58%) fica atrás do Fable 5 (61,7%) e do Opus 4.8 (59,9%).
  • Contexto longo: Luna cai para 41,3% no MRCR v2 a 256K-512K tokens.

Tool calling programático e multi-agente

Uma das novidades mais interessantes é o Programmatic Tool Calling: o modelo escreve e executa JavaScript em um runtime V8 isolado, sem acesso à rede. Clientes que adotaram a funcionalidade relataram redução de tokens entre 38% e 63,5% em cenários reais.

O modo Ultra coordena quatro agentes em paralelo por padrão, aumentando a pontuação no Terminal-Bench 2.1 de 88,8% para 91,9%. O beta multi-agente na API permite construir fluxos semelhantes.

Prompt caching mais previsível

O GPT-5.6 introduz cache breakpoints explícitos e tempo mínimo de cache de 30 minutos. Gravações de cache custam 1,25x a taxa de input não cacheado — um novo item de custo a considerar. Leituras mantêm o desconto de 90% para input cacheado.

Conclusão

O GPT-5.6 é um lançamento sólido que consolida a liderança da OpenAI em coding e agentes. A estratégia de três tiers com spread de 5x no preço é inteligente para adoção empresarial. Mas as lacunas em SWE-Bench e tool use mostram que a competição com Anthropic está longe de ser decidida.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.