Habr AI→ original

Las redes neuronales son malas calculadoras: por qué los LLMs fallan en aritmética y qué hacer al respecto

Un LLM puede equivocarse con seguridad en los dígitos centrales de una multiplicación de seis cifras: los bordes son correctos, el centro es inventado. No es un bug: un transformer predice tokens a partir de la estadística de los datos de entrenamiento, en lugar de ejecutar un algoritmo. La aritmética corta queda, en la práctica, memorizada en los datos — hay millones de ejemplos. Los números largos se adivinan. La solución de la industria no es enseñar al modelo a calcular, sino darle herramientas: Python, code interpreter, calculadora.

Procesado por IA desde Habr AI; editado por Hamidun News
Las redes neuronales son malas calculadoras: por qué los LLMs fallan en aritmética y qué hacer al respecto
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Una red neuronal falla incluso en matemática simple, produciendo confiadamente un resultado incorrecto para multiplicar números de seis dígitos—dígitos correctos en los bordes, error en el medio. Esto no es un bug o deficiencia de un modelo particular: un transformador predice tokens basándose en estadísticas, no ejecutando un algoritmo de multiplicación como lo haría una calculadora.

Token versus algoritmo: ¿cuál es la diferencia?

La multiplicación en columna es un procedimiento con dígitos, acarreos, sumas intermedias y orden estricto de operaciones. Un procesador lo ejecuta. Un alumno de escuela lo ejecuta. Un transformador en un solo paso—no: genera texto que se parece a la respuesta correcta, basándose en estadísticas de datos de entrenamiento.

La aritmética corta funciona exactamente como memoria, no como cálculo:

  • Las tablas de multiplicación aparecen en datos de entrenamiento millones de veces
  • "7 × 8 = 56" el modelo no calcula—lo recuerda
  • Con números de dos o tres dígitos, todavía hay suficientes patrones familiares
  • Con números de seis dígitos—casi no hay ejemplos familiares; el modelo comienza a "continuar de manera plausible"
  • La confianza al dar una respuesta no está relacionada con la precisión del resultado

¿Por qué el error termina en el medio del número?

Los dígitos exteriores del resultado pueden derivarse de los primeros y últimos dígitos de los factores—este es un patrón que el modelo aprende. Los dígitos del medio requieren una cadena honesta de acarreos, que un transformador no construye en un solo paso autorregresivo.

Caligrafía característica: el borde derecho (unidades, decenas) y el borde izquierdo (dígitos de orden superior) a menudo son correctos, los dígitos del medio—inventados. Mientras tanto, el modelo no tiene una señal interna "no estoy seguro"—el predictor de tokens simplemente continúa la secuencia de la manera más plausible posible.

¿Cómo resuelve la industria esto?

La solución no vino desde adentro de la arquitectura, sino desde afuera: herramientas. Code Interpreter en ChatGPT, bloques de Python en Claude, llamadas a calculadora a través de function calling—el modelo delega el cálculo a alguien que sabe cómo calcular.

"Hace, y bastante exitosamente, solo que no donde parece."

El progreso no está en enseñar a LLM a calcular de forma independiente, sino en enseñarle a llamar la herramienta correcta.

Chain-of-thought (grabación explícita de pasos intermedios) ayuda parcialmente: la precisión en números de múltiples dígitos aumenta. Pero cada token en la cadena es en sí mismo una predicción, por lo que esta técnica no proporciona confiabilidad del 100%.

En paralelo, continúa la investigación sobre ajuste fino especializado para matemáticas—los modelos entrenados predominantemente en textos científicos entienden mejor las tareas. Pero ni siquiera reemplazan una calculadora: el valor de tales modelos está en plantear correctamente la tarea para una herramienta, no en auto-cálculo.

Qué significa esto

Esperar que LLM se comporte como una calculadora es un malentendido arquitectónico. El patrón correcto: el modelo entiende la tarea, construye lógica, delega números a una herramienta, interpreta el resultado. Confiar en la economía unitaria directamente en un chat sin herramientas—significa verificar no el modelo, sino la suerte.

Preguntas frecuentes

¿Por qué el modelo no advierte que no puede calcular?

Un modelo de lenguaje no tiene una señal interna de incertidumbre cuando genera un número. Genera el siguiente token con probabilidad máxima—y con igual confianza produce resultados correctos e incorrectos. Esta es una propiedad fundamental de la generación autorregresiva, no un error de código.

¿Ayuda chain-of-thought con aritmética compleja?

Sí, pero limitadamente. La grabación paso a paso de acarreos aumenta la precisión porque el modelo "ve" resultados intermedios como contexto para la siguiente predicción. Sin embargo, cada paso sigue siendo una predicción, y los errores se acumulan—para cálculos críticos, se necesita una herramienta externa.

¿Por qué una red neuronal falla en matemáticas?

Un transformador predice tokens basándose en estadísticas de datos de entrenamiento, no ejecutando un algoritmo matemático como lo hace un procesador o un humano.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…