FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода
FindStatBench — новый бенчмарк из 2 329 задач по синтезу комбинаторного кода: модель пишет Python-функцию без подсказок и инструментов. Авторы прогнали 11 систем и нашли неожиданное — несколько классических задач модели решают идеально без примеров, но проваливают, получив пять примеров в промпте. Сильнейшие открытые и закрытые модели разошлись меньше чем на 1 п.п.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Em julho de 2026, pesquisadores apresentaram o FindStatBench, um benchmark que avalia grandes modelos de linguagem na síntese de código combinatório: 2329 tarefas, 24 coleções e 5,52 milhões de objetos de teste ocultos. Nesse conjunto, os modelos abertos e fechados mais fortes divergiram em precisão por menos de um ponto percentual.
O que o FindStatBench avalia
O FindStatBench é construído sobre o projeto matemático FindStat e exige que o modelo escreva uma única função em Python, solve, a partir de uma descrição matemática do problema e no máximo cinco exemplos públicos de "entrada-saída". Não há busca, chamadas de ferramentas, feedback de execução, votação ou reranqueamento — apenas uma única tentativa. A resposta é executada em um sandbox sobre objetos combinatórios ocultos e verificada por execução exata.
Os autores testaram 11 sistemas: quatro modelos de produção fechados e sete modelos de pesos abertos, servidos por meio de um único provedor de inferência.
- 2329 tarefas em 24 coleções, 5,52 milhões de objetos de teste ocultos
- Dois tipos: statistic synthesis (objeto → número inteiro) e map synthesis (objeto → objeto)
- A entrada consiste em uma descrição e no máximo 5 exemplos de "entrada-saída"
- A avaliação é a execução exata da função Python em um sandbox
- 11 sistemas testados: 4 fechados + 7 abertos
Por que exemplos no prompt prejudicam
Em parte das tarefas, os exemplos no prompt reduzem a precisão em vez de aumentá-la. Segundo o estudo, várias bijeções clássicas são resolvidas com perfeição pelos modelos sem nenhum exemplo, mas os mesmos modelos falham nessas tarefas ao receberem cinco exemplos de "entrada-saída". Outra parte das falhas está relacionada à mecânica do orçamento de saída: o raciocínio do modelo esgota a resposta visível antes mesmo de chegar ao código propriamente dito. Prompts longos causam uma queda acentuada de precisão — os autores chamam isso de accuracy cliff.
Onde os modelos esbarram em um teto
A statistic synthesis é sensivelmente mais fácil para os modelos do que a map synthesis: associar um objeto a um número inteiro é mais simples do que associar um objeto a outro objeto. Os sistemas abertos e fechados mais fortes convergem dentro de um ponto percentual entre si em instance accuracy, e combinar todos os sistemas em um "oráculo", além de amostragem quíntupla a partir de um modelo de força média, trazem apenas ganhos limitados. Algumas coleções de tarefas permanecem em zero.
"Statistic synthesis é muito mais fácil para nós do que map synthesis... e a indução precisa de regras simbólicas continua frágil", afirma o resumo do
FindStatBench no arXiv.
O que isso significa
Mesmo os principais LLMs ainda são ruins em derivar regras simbólicas exatas a partir de descrições matemáticas — e nem mais exemplos nem mais computação rompem essa parede. O FindStatBench oferece à indústria um teste rigoroso e executável voltado justamente para esse tipo de raciocínio, e não para repetir soluções já conhecidas.
Perguntas frequentes
O que é o FindStatBench?
É um benchmark executável baseado no projeto FindStat: 2329 tarefas de síntese combinatória de código em que o modelo escreve uma função Python e a resposta é verificada por execução exata sobre 5,52 milhões de objetos ocultos, sem direito a dicas, ferramentas ou novas tentativas.
Por que mais exemplos nem sempre ajudam os modelos?
Segundo o estudo, várias bijeções clássicas são resolvidas com perfeição pelos modelos sem nenhum exemplo, mas falham diante de um prompt com cinco exemplos: o contexto mais longo leva a uma queda acentuada de precisão, e o raciocínio às vezes esgota o orçamento da resposta antes mesmo de gerar o código.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.