O que é o ARC-AGI

O ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) e um benchmark criado por François Chollet, o engenheiro do Google que também criou o Keras. Ele foi publicado em 2019 com um objetivo claro: medir se uma IA consegue realmente generalizar e raciocinar, em vez de apenas memorizar padrões de treinamento.

A ideia surgiu de uma frustração real de Chollet com os benchmarks existentes. Testes como o MMLU ou o HumanEval podem ser "passados" por um modelo que simplesmente memorizou respostas do dataset de treino. O ARC-AGI foi projetado para ser resistente a isso, exigindo raciocínio por analogia em puzzles visuais que o modelo nunca viu antes.

Em 2024, a ARC Prize Foundation lançou um prémio de 1 milhão de dólares para qualquer sistema que atingisse 85% de acerto no benchmark. Isso colocou o ARC-AGI no centro das discussões sobre AGI nos maiores labs do mundo, incluindo OpenAI, Anthropic, Google DeepMind e dezenas de pesquisadores independentes.

Como funciona

Cada tarefa do ARC-AGI apresenta uma grade colorida com pixels e um padrão lógico. O modelo recebe alguns pares de exemplo (entrada/saída) e precisa descobrir a regra por trás deles para então aplicar essa regra a uma nova entrada e produzir a saída correta. Parece simples, e para humanos e: a taxa de acerto humana e de cerca de 85%.

O segredo e que cada puzzle usa um conceito diferente. Pode ser simetria, contagem, preenchimento de padrões, translação, rotação ou combinações dessas ideias. Os conceitos são elementares para humanos, mas exigem que o sistema raciocine do zero, sem poder depender de padrões vistos no treino.

💡
Dica

Você pode testar puzzles do ARC-AGI no próprio site do projeto em arcprize.org e ter uma sensação exata do que as IAs precisam resolver.

O benchmark e dividido em dois conjuntos: um público (para desenvolvimento) e um privado (para avaliação oficial). Os resultados oficiais no leaderboard usam o conjunto privado, o que evita que times treinem diretamente nos puzzles de avaliação.

Principais recursos

O ARC-AGI tem características que o tornam único no ecossistema de benchmarks de IA:

  • Resistência ao overfitting: os puzzles são novos para o modelo na hora do teste, o que elimina a vantagem de memorizar datasets.
  • Leaderboard público e transparente: qualquer pessoa pode submeter resultados em arcprize.org e ver onde seu sistema se posiciona.
  • Métrica simples: percentual de puzzles resolvidos corretamente, sem ambiguidade sobre o que contar.
  • ARC-AGI-2: versão mais difícil lançada em 2025, com puzzles que desafiam até os melhores sistemas atuais.
  • Comparação com humanos: o benchmark foi calibrado para que humanos comuns (sem treinamento especial) resolvam cerca de 85% dos puzzles.

O leaderboard em arcprize.org mostra em tempo real quais sistemas lideram, com detalhes sobre métodos usados e reproducibilidade.

Como começar: acessando e testando

Para explorar o ARC-AGI, o ponto de entrada e o site oficial:

# Clonar o repositório oficial do ARC-AGI
git clone https://GitHub.com/fchollet/ARC-AGI.git

# Estrutura de dados
# data/training/ - 400 tarefas para desenvolvimento
# data/evaluation/ - 400 tarefas para avaliação local
# data/test/ - conjunto privado (respostas não públicas)

Cada tarefa e um arquivo JSON simples. Você pode carregar qualquer tarefa e visualizar os pares de exemplo antes de tentar resolver. Para submissões oficiais, crie uma conta em arcprize.org e siga o processo de submissão descrito na documentação.

⚠️
Atenção

O conjunto de teste oficial não tem as respostas disponíveis publicamente. Qualquer placar acima de 0% no leaderboard oficial foi obtido por submissão real ao sistema de avaliação do ARC Prize.

Para quem quer treinar um sistema, o repositório inclui scripts de visualização e exemplos de como carregar as tarefas em Python. O formato JSON e simples o suficiente para integrar com qualquer framework de ML.

Exemplo prático

Imagine um puzzle simples: nos exemplos, uma linha de quadrados azuis sempre tem um quadrado vermelho ao final. A entrada de teste e uma linha de quadrados azuis sem o vermelho. O sistema precisa inferir a regra e completar com um quadrado vermelho na posição correta.

# Exemplo de formato de uma tarefa ARC-AGI (JSON simplificado)
{
  "train": [
    {
      "input": [[0,0,2,2,2]],
      "output": [[0,0,2,2,2,1]]
    },
    {
      "input": [[0,2,2]],
      "output": [[0,2,2,1]]
    }
  ],
  "test": [
    {
      "input": [[2,2,2,2]]
      // output esperado: [[2,2,2,2,1]]
    }
  ]
}

Os puzzles reais são grades 2D com cores representadas por números de 0 a 9. A regra pode ser qualquer coisa: simetria, reflexão, contagem de objetos, preenchimento de lacunas, translação de padrões. O desafio e descobrir a regra a partir de apenas 3 a 5 exemplos.

Comparação com alternativas

O ecossistema de benchmarks de IA e vasto, mas o ARC-AGI tem um nicho bem definido:

  • MMLU: testa conhecimento de mundo (trivia, ciências, direito). Pode ser passado com memorizar textos. Não mede raciocínio novo.
  • HumanEval / SWE-Bench: testa programação. Ótimo para avaliar coders de IA, mas não mede inteligência geral.
  • GSM8K: problemas de matemática escolar. Útil, mas resolvível com chain-of-thought em LLMs grandes.
  • ARC-AGI: único benchmark projetado especificamente para resistir a memorizar. Mede generalização real.

O ARC-AGI e mais lento de rodar (cada puzzle exige inferência real) e mais difícil de otimizar, mas e o mais honesto sobre o que o sistema realmente sabe fazer.

Pontos positivos e limitações

O ARC-AGI tem pontos fortes claros. Ele é o benchmark mais resistente a overfitting que existe hoje. O leaderboard público cria uma competição saudável e transparente. O formato de dado e simples e bem documentado. E a correlação com capacidade de raciocínio geral e mais forte do que em outros benchmarks.

Mas também tem limitações reais. Os puzzles são visuais e espaciais, o que significa que o benchmark avalia principalmente raciocínio visuo-espacial, não linguagem, matemática avançada ou outros domínios. Além disso, mesmo um sistema que resolva 90% dos puzzles pode estar usando técnicas muito distantes do que chamamos de inteligência geral humana.

🔴
Cuidado

Alta pontuação no ARC-AGI não significa AGI. Significa que o sistema e bom em raciocínio visuo-espacial abstrato. E um sinal importante, mas não o único critério para AGI.

O ARC-AGI-2, lançado em 2025, aumentou significativamente a dificuldade. Até meados de 2025, os melhores sistemas públicos ainda estavam bem abaixo dos 85% que humanos comuns atingem, mostrando que ha muito caminho pela frente.

Casos de uso reais

O ARC-AGI tem aplicações concretas para diferentes perfis:

  • Pesquisadores de IA: usam o benchmark para avaliar novas arquiteturas de raciocínio, como sistemas neuro-simbólicos ou abordagens de program synthesis.
  • Labs de IA: times como OpenAI e DeepMind usam o ARC-AGI como sinal de progresso interno, mesmo sem publicar todos os resultados no leaderboard público.
  • Desenvolvedores independentes: muitos dos melhores resultados no leaderboard vieram de competidores individuais, não de grandes empresas.
  • Educadores e divulgadores: os puzzles do ARC-AGI são excelentes para explicar de forma intuitiva o que significa realmente raciocinar versus memorizar.

Dicas e boas práticas

💡
Dica

Antes de tentar treinar um modelo no ARC-AGI, resolva você mesmo pelo menos 20 puzzles do conjunto de treino. Isso da uma intuição real sobre o tipo de raciocínio exigido.

🚀
Pro tip

As abordagens que lideram o leaderboard frequentemente combinam LLMs com busca discreta ou program synthesis. Puro fine-tuning de LLM raramente passa dos 40%.

⚠️
Atenção

Não confunda o conjunto de avaliação local (cujas respostas são públicas) com o conjunto de teste oficial. Treinar no conjunto de avaliação da uma vantagem artificial que não aparece no leaderboard oficial.

Vale a pena acompanhar?

Se você se importa com o progresso real da IA, sim. O ARC-AGI e o melhor sinal público disponível sobre se os modelos estão ficando genuinamente mais inteligentes ou apenas maiores. Quando um sistema humano ultrapassa os 85% no ARC-AGI-2, isso vai ser uma das noticias mais importantes da historia da tecnologia.

Para desenvolvedores, acompanhar o leaderboard custa zero e oferece uma perspectiva única sobre o estado da arte que vai muito além do que o marketing dos labs pública. Vale favoritar arcprize.org e checar periodicamente quem subiu no placar e com qual técnica.