A OpenAI lançou o GPT-5.6 e os números são claros: o novo Sol supera o Claude Fable 5 da Anthropic em praticamente todas as métricas que importam, gastando menos tokens e custando menos. Mas a Anthropic ainda tem vantagens em matemática avançada e raciocínio abstracto.
Onde o GPT-5.6 ganha
Em programação, o GPT-5.6 Sol marca 80 pontos no Artificial Analysis Coding Agent Index, contra 77,2 do Fable 5 — usando menos de metade dos tokens e um terço do custo. Em cibersegurança (ExploitBench2: 73,5% vs 47,9%), navegação web (BrowseComp: 92,2%) e uso de computador (OSWorld: 62,6%), o Sol estabelece novos recordes. Mesmo os modelos mais baratos (Terra e Luna) superam o Fable 5 a uma fracção do custo.
Onde o Claude ainda lidera
O Claude Fable 5 mantém vantagem em FrontierMath Tier 4 (87,8% vs 83% do Sol) e no ARC-AGI-3, teste de raciocínio abstracto. Para trabalho que exige raciocínio matemático profundo, o Fable 5 ainda tem margem. No Toolathlon (uso de ferramentas), Fable 5 e Mythos Preview também estão à frente.
O fator preço
A redução de preços de Agosto tornou a disputa mais agressiva: a Luna (modelo económico) foi cortada em 80% e a Terra em 20%. A Luna supera o Opus 4.8 a aproximadamente um quarto do custo. Para utilizadores que pagam por volume, a diferença de preço é decisiva quando a qualidade é equivalente.
Ultra mode muda o jogo
O modo ultra do GPT-5.6 coordena quatro agentes em paralelo por padrão, algo que a Anthropic não oferece nativamente. Isto significa tarefas complexas terminam mais rápido e com melhores resultados. Na prática, o utilizador delega um problema difícil e o modelo divide-o entre agentes especializados que colaboram.
Fontes
OpenAI — GPT-5.6 resultados completos
Grok Bot: a IA que trabalha sozinha