O que aconteceu

A Anthropic lançou um novo modelo de linguagem, o Opus 5.5, que assumiu imediatamente o topo do Índice de Inteligência Artificial Analysis, a principal referência independente de benchmarks de IA do mercado. O resultado chama atenção porque o modelo anterior mais avançado da própria Anthropic ficou atrás na nova avaliação.

Segundo a Artificial Analysis, o novo modelo marcou 58 pontos no índice (versão 4.3.2), cinco pontos a frente do GPT-6 Astra da OpenAI e do modelo anterior da Anthropic, que ficaram empatados em 53 pontos.

Como funciona o Índice de Inteligência Artificial Analysis

O índice combina 10 avaliações diferentes que testam raciocínio, código, conhecimento geral e capacidade agentica: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. A pontuação final e uma media ponderada do desempenho em cada uma dessas provas.

Diferente de benchmarks isolados, o índice tenta capturar um retrato mais completo da capacidade de um modelo em tarefas do mundo real, incluindo trabalho agentico (onde o modelo executa ações em sequência, não só responde perguntas).

Onde o novo modelo lidera

O Opus 5.5 lidera em 6 das 10 avaliações que compõem o índice:

  • Humanity's Last Exam: 61,4% (recorde anterior era 59,1%)
  • SciCode: 66,9% (recorde anterior era 63,1%)
  • GDPval-AA v2.1
  • AA-Briefcase v1.1
  • AA-Omniscience
  • AutomationBench-AA
tip
Dica

Humanity's Last Exam e um dos benchmarks mais difíceis do mercado, criado justamente para não ter respostas fáceis de encontrar em dados de treinamento. Ganhos ai indicam avanço real de raciocínio, não só memorização.

O número que mais chama atenção: trabalho agentico

O destaque mais forte do Opus 5.5 aparece no AA-Briefcase v1.1, benchmark de tarefas agenticas de trabalho de conhecimento (organizar informação, planejar etapas, executar ações em sequência). O modelo alcançou 1.822 pontos de Elo, 143 pontos acima do modelo anterior da Anthropic.

Na prática, esse tipo de ganho costuma se traduzir em melhor desempenho em tarefas como análise de documentos longos, automação de fluxos de trabalho e assistentes que precisam tomar varias decisões encadeadas sem supervisão constante.

Mais barato e menos 'robotico'

Além do ganho de desempenho, a Anthropic reduziu o preço do Opus 5.5 em 20% em relação as versões anteriores, com desconto ainda maior em cache hit (quando o modelo reaproveita contexto já processado antes). Segundo reportagem do site The Decoder, a empresa também prometeu reduzir o estilo de escrita engessado que caracterizava respostas anteriores da família de modelos.

O modelo anterior ainda tem um recorde próprio

Vale destacar que a versão anterior da Anthropic havia liderado uma avaliação passada do mesmo índice com pontuação de 66, superando outros concorrentes na época. Essa pontuação, porém, usou uma metodologia diferente da avaliação atual (v4.3.2) e não e diretamente comparável ao score de 58 do Opus 5.5.

warning
Atenção

Comparar pontuações de versões diferentes do índice pode induzir a erro. A Artificial Analysis atualiza a metodologia periodicamente, então o número absoluto só e comparável dentro da mesma versão do índice.

Como fica a disputa com a OpenAI e outros concorrentes

Com o Opus 5.5, a Anthropic chega a paridade técnica com o GPT-6 Astra da OpenAI em avaliações como Terminal-Bench 4.0 e AutomationBench-AA, ao mesmo tempo em que abre uma vantagem de 5 pontos no índice geral. Isso reposiciona a disputa entre os dois laboratórios, que ha meses trocavam a liderança a cada novo lançamento.

Outros modelos citados no mesmo levantamento ficam mais distantes do topo, reforçando que a corrida principal hoje esta concentrada entre Anthropic e OpenAI.

O que isso significa para quem usa IA no dia a dia

Para desenvolvedores e empresas que já usam a API da Anthropic, a atualização chega sem custo de migração: o Opus 5.5 substitui o uso recomendado para tarefas que exigem mais raciocínio, com preço menor por tarefa. Para quem usa o modelo anterior hoje, vale reavaliar qual opcao entrega melhor custo-beneficio para cada tipo de tarefa - nem sempre o modelo com maior pontuação geral e o mais indicado para um caso de uso específico.

Para o usuário final, o principal ganho prático tende a ser respostas mais precisas em tarefas complexas e, segundo a promessa da Anthropic, um tom de escrita menos formulaico.

Conclusão

A chegada do Opus 5.5 mostra que o ritmo de atualizações no mercado de IA continua acelerado em 2026: ganhos de desempenho vindo acompanhados de cortes de preço, numa pressão competitiva direta entre Anthropic, OpenAI e outros laboratórios como Google e xAI. Resta acompanhar se a próxima atualização devolve a liderança a versão anterior - ou se o Opus 5.5 se firma como o modelo de referência por mais tempo.