Redes neurais são calculadoras ruins: por que LLMs falham em aritmética e o que fazer a respeito
Um LLM pode errar com confiança os dígitos centrais de uma multiplicação de seis dígitos: as pontas estão certas, o meio é inventado. Isso não é bug: um transformer prevê tokens a partir da estatística dos dados de treino, em vez de executar um algoritmo. A aritmética curta fica, na prática, memorizada nos dados — há milhões de exemplos. Números longos são adivinhados. A solução da indústria não é ensinar o modelo a calcular, mas dar a ele ferramentas — Python, code interpreter, calculadora.
Processado por IA de Habr AI; editado por Hamidun News
Uma rede neural falha até em matemática simples, produzindo confiadamente um resultado incorreto para multiplicar números de seis dígitos—dígitos corretos nas bordas, erro no meio. Isto não é um bug ou deficiência de um modelo particular: um transformador prediz tokens com base em estatísticas, não executando um algoritmo de multiplicação como uma calculadora faria.
Token versus algoritmo: qual é a diferença
Multiplicação em coluna é um procedimento com dígitos, transportes, somas intermediárias e ordem estrita de operações. Um processador o executa. Uma criança na escola o executa. Um transformador em um único passe—não: gera texto semelhante à resposta correta, baseado em estatísticas de dados de treinamento.
Aritmética curta funciona exatamente como memória, não como cálculo:
- Tabelas de multiplicação aparecem em dados de treinamento milhões de vezes
- "7 × 8 = 56" o modelo não calcula—se lembra
- Com números de dois ou três dígitos, ainda há padrões familiares suficientes
- Com números de seis dígitos—quase não há exemplos familiares; o modelo começa a "continuar de forma plausível"
- A confiança ao dar uma resposta não está relacionada à precisão do resultado
Por que o erro acaba no meio do número?
Os dígitos exteriores do resultado podem ser derivados do primeiro e último dígitos dos fatores—este é um padrão que o modelo aprende. Os dígitos do meio requerem uma cadeia honesta de transportes, que um transformador não constrói em um único passe autorregressivo.
Caligrafia característica: a borda direita (unidades, dezenas) e a borda esquerda (dígitos de ordem superior) geralmente estão corretos, dígitos do meio—inventados. Enquanto isso, o modelo não tem um sinal interno "não tenho certeza"—o preditor de tokens simplesmente continua a sequência da forma mais plausível possível.
Como a indústria resolve isto
A solução não veio de dentro da arquitetura, mas de fora: ferramentas. Code Interpreter em ChatGPT, blocos Python em Claude, chamadas de calculadora via function calling—o modelo delega a computação para alguém que sabe como computar.
"Faz, e bem-sucedidamente, apenas não onde parece."
O progresso não está em ensinar LLM a calcular independentemente, mas em ensiná-lo a chamar a ferramenta certa.
Chain-of-thought (gravação explícita de etapas intermediárias) ajuda parcialmente: a precisão em números multi-dígitos aumenta. Mas cada token na cadeia é em si uma previsão, então esta técnica não fornece confiabilidade de 100%.
Em paralelo, a pesquisa continua em ajuste fino especializado para matemática—modelos treinados predominantemente em textos científicos entendem melhor as tarefas. Mas nem eles substituem uma calculadora: o valor de tais modelos está em formular corretamente a tarefa para uma ferramenta, não em auto-cálculo.
O que isto significa
Esperar que LLM se comporte como uma calculadora é uma má compreensão arquitetônica. O padrão correto: o modelo entende a tarefa, constrói lógica, delega números a uma ferramenta, interpreta a saída. Confiar em economia unitária diretamente em um chat sem ferramentas—significa verificar não o modelo, mas a sorte.
Perguntas frequentes
Por que o modelo não avisa que não consegue calcular?
Um modelo de linguagem não tem um sinal interno de incerteza ao gerar um número. Ele gera o próximo token com probabilidade máxima—e com igual confiança produz resultados corretos e incorretos. Esta é uma propriedade fundamental da geração autorregressiva, não um erro de código.
Chain-of-thought ajuda com aritmética complexa?
Sim, mas limitadamente. Gravação passo-a-passo de transportes aumenta a precisão porque o modelo "vê" resultados intermediários como contexto para a próxima previsão. No entanto, cada passo permanece uma previsão, e os erros se acumulam—para cálculos críticos, uma ferramenta externa é necessária.
Por que uma rede neural falha em matemática?
Um transformador prediz tokens com base em estatísticas de dados de treinamento, não executando um algoritmo matemático como faz um processador ou ser humano.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.