A OpenAI liberou para disponibilidade geral a família GPT-5.6, que havia sido anunciada em preview limitado. O lançamento traz três modelos distintos — Sol, Terra e Luna — cada um posicionado em um tier de capacidade e preço, além de novidades importantes como tool calling programático e um modo multi-agente na API.
Três tiers, três faixas de preço
A precificação por 1 milhão de tokens é a seguinte:
| Modelo | Input | Output | Posicionamento |
|---|---|---|---|
| Sol | US$ 5 | US$ 30 | Flagship — coding, agentes, pesquisa de segurança |
| Terra | US$ 2,50 | US$ 15 | Balanceado — uso empresarial de alto volume |
| Luna | US$ 1 | US$ 6 | Mais rápido e barato — resumo, classificação, rascunho |
Disponibilidade por superfície
ChatGPT: usuários Plus, Pro, Business e Enterprise acessam o Sol em níveis médio e alto de reasoning. Pro e Enterprise também podem selecionar o GPT-5.6 Sol Pro.
ChatGPT Work e Codex: usuários Free e Go acessam o Terra. Pagos escolhem entre os três modelos e configuram o nível de esforço por modelo. O modo max está disponível para todos com acesso ao GPT-5.6.
API: todos os três tiers estão disponíveis. O tool calling programático e o beta multi-agente rodam na Responses API.
Benchmarks: onde o GPT-5.6 brilha
No Artificial Analysis Coding Agent Index v1.1, o Sol com reasoning máximo atinge 80 pontos — 2,8 acima do Claude Fable 5 (77,2), usando menos da metade dos tokens de saída e menos da metade do tempo.
No Terminal-Bench 2.1, o Sol alcança 88,8% (subindo para 91,9% no modo Ultra com quatro agentes em paralelo). No BrowseComp, chega a 92,2% no modo Ultra. No OSWorld 2.0, marca 62,6% — superando o Claude Opus 4.8 usando 85% menos tokens de saída.
No Agents’ Last Exam, que avalia fluxos de trabalho profissionais longos em 55 áreas, o Sol atinge 52,7%, superando o Fable 5 em 12,2 pontos.
Onde o GPT-5.6 perde
Quatro lacunas merecem destaque:
- SWE-Bench Pro: Sol (64,6%) fica ~15 pontos atrás do Claude Mythos 5 (80,3%) e do Fable 5 (80%) — diferença significativa em coding.
- Inteligência geral: Fable 5 lidera no AA Intelligence Index v4.1 (59,9 vs 58,9) e no GDPval-AA v2 por ~12 Elo.
- Tool use: No Toolathlon, Sol (58%) fica atrás do Fable 5 (61,7%) e do Opus 4.8 (59,9%).
- Contexto longo: Luna cai para 41,3% no MRCR v2 a 256K-512K tokens.
Tool calling programático e multi-agente
Uma das novidades mais interessantes é o Programmatic Tool Calling: o modelo escreve e executa JavaScript em um runtime V8 isolado, sem acesso à rede. Clientes que adotaram a funcionalidade relataram redução de tokens entre 38% e 63,5% em cenários reais.
O modo Ultra coordena quatro agentes em paralelo por padrão, aumentando a pontuação no Terminal-Bench 2.1 de 88,8% para 91,9%. O beta multi-agente na API permite construir fluxos semelhantes.
Prompt caching mais previsível
O GPT-5.6 introduz cache breakpoints explícitos e tempo mínimo de cache de 30 minutos. Gravações de cache custam 1,25x a taxa de input não cacheado — um novo item de custo a considerar. Leituras mantêm o desconto de 90% para input cacheado.
Conclusão
O GPT-5.6 é um lançamento sólido que consolida a liderança da OpenAI em coding e agentes. A estratégia de três tiers com spread de 5x no preço é inteligente para adoção empresarial. Mas as lacunas em SWE-Bench e tool use mostram que a competição com Anthropic está longe de ser decidida.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



