arXiv cs.AI→ original

FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода

FindStatBench — новый бенчмарк из 2 329 задач по синтезу комбинаторного кода: модель пишет Python-функцию без подсказок и инструментов. Авторы прогнали 11 систем и нашли неожиданное — несколько классических задач модели решают идеально без примеров, но проваливают, получив пять примеров в промпте. Сильнейшие открытые и закрытые модели разошлись меньше чем на 1 п.п.

Processado por IA de arXiv cs.AI; editado por Hamidun News
FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores apresentaram o FindStatBench, um benchmark que avalia grandes modelos de linguagem na síntese de código combinatório: 2329 tarefas, 24 coleções e 5,52 milhões de objetos de teste ocultos. Nesse conjunto, os modelos abertos e fechados mais fortes divergiram em precisão por menos de um ponto percentual.

O que o FindStatBench avalia

O FindStatBench é construído sobre o projeto matemático FindStat e exige que o modelo escreva uma única função em Python, solve, a partir de uma descrição matemática do problema e no máximo cinco exemplos públicos de "entrada-saída". Não há busca, chamadas de ferramentas, feedback de execução, votação ou reranqueamento — apenas uma única tentativa. A resposta é executada em um sandbox sobre objetos combinatórios ocultos e verificada por execução exata.

Os autores testaram 11 sistemas: quatro modelos de produção fechados e sete modelos de pesos abertos, servidos por meio de um único provedor de inferência.

  • 2329 tarefas em 24 coleções, 5,52 milhões de objetos de teste ocultos
  • Dois tipos: statistic synthesis (objeto → número inteiro) e map synthesis (objeto → objeto)
  • A entrada consiste em uma descrição e no máximo 5 exemplos de "entrada-saída"
  • A avaliação é a execução exata da função Python em um sandbox
  • 11 sistemas testados: 4 fechados + 7 abertos

Por que exemplos no prompt prejudicam

Em parte das tarefas, os exemplos no prompt reduzem a precisão em vez de aumentá-la. Segundo o estudo, várias bijeções clássicas são resolvidas com perfeição pelos modelos sem nenhum exemplo, mas os mesmos modelos falham nessas tarefas ao receberem cinco exemplos de "entrada-saída". Outra parte das falhas está relacionada à mecânica do orçamento de saída: o raciocínio do modelo esgota a resposta visível antes mesmo de chegar ao código propriamente dito. Prompts longos causam uma queda acentuada de precisão — os autores chamam isso de accuracy cliff.

Onde os modelos esbarram em um teto

A statistic synthesis é sensivelmente mais fácil para os modelos do que a map synthesis: associar um objeto a um número inteiro é mais simples do que associar um objeto a outro objeto. Os sistemas abertos e fechados mais fortes convergem dentro de um ponto percentual entre si em instance accuracy, e combinar todos os sistemas em um "oráculo", além de amostragem quíntupla a partir de um modelo de força média, trazem apenas ganhos limitados. Algumas coleções de tarefas permanecem em zero.

"Statistic synthesis é muito mais fácil para nós do que map synthesis... e a indução precisa de regras simbólicas continua frágil", afirma o resumo do

FindStatBench no arXiv.

O que isso significa

Mesmo os principais LLMs ainda são ruins em derivar regras simbólicas exatas a partir de descrições matemáticas — e nem mais exemplos nem mais computação rompem essa parede. O FindStatBench oferece à indústria um teste rigoroso e executável voltado justamente para esse tipo de raciocínio, e não para repetir soluções já conhecidas.

Perguntas frequentes

O que é o FindStatBench?

É um benchmark executável baseado no projeto FindStat: 2329 tarefas de síntese combinatória de código em que o modelo escreve uma função Python e a resposta é verificada por execução exata sobre 5,52 milhões de objetos ocultos, sem direito a dicas, ferramentas ou novas tentativas.

Por que mais exemplos nem sempre ajudam os modelos?

Segundo o estudo, várias bijeções clássicas são resolvidas com perfeição pelos modelos sem nenhum exemplo, mas falham diante de um prompt com cinco exemplos: o contexto mais longo leva a uma queda acentuada de precisão, e o raciocínio às vezes esgota o orçamento da resposta antes mesmo de gerar o código.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…