Habr AI→ original

El mismo benchmark de LLM arrojó 28% y 76% — la diferencia está solo en cómo se formulan las preguntas

Un desarrollador probó LLMs en idioma ruso en documentos corporativos — políticas, órdenes, facturas, aprobaciones. El modelo necesitaba encontrar el documento correcto entre similares, citar una línea específica y no fallar cuando una fecha cambiaba. Un mismo modelo mostró en el benchmark del 28% al 76% — el resultado dependía no de la elección del modelo, sino de cómo se organizaban las consultas a él.

Procesado por IA desde Habr AI; editado por Hamidun News
El mismo benchmark de LLM arrojó 28% y 76% — la diferencia está solo en cómo se formulan las preguntas
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Un desarrollador que probó modelos de lenguaje rusos en documentos corporativos obtuvo resultados que van desde 28% hasta 76% en el mismo benchmark para el mismo modelo — la diferencia se explica únicamente por la forma en que se formulan las preguntas.

Cómo está estructurado el benchmark

El autor reunió un benchmark para modelos de lenguaje en ruso en tipos reales de documentos corporativos — políticas, órdenes, facturas y acuerdos. La tarea para los modelos era encontrar el documento necesario entre otros similares, citar una línea específica en él y no "fallar" cuando una sola fecha en uno de los documentos se cambia.

  • Rango de resultados para el mismo modelo en un benchmark — de 28% a 76%
  • Tipo de datos — documentos corporativos: políticas, órdenes, facturas, acuerdos
  • Habilidades probadas — encontrar el documento correcto entre similares, referencia precisa a una línea, resistencia a cambios de un solo detalle (fecha)
  • Razón de la variación — no el modelo en sí, sino cómo se organizan las solicitudes hacia él

De dónde vino la diferencia de 48 puntos porcentuales

El hallazgo clave del experimento es que el resultado final resultó ser altamente dependiente de cómo se organizaron las solicitudes al modelo, en lugar de qué modelo se utilizó. En otras palabras, el mismo modelo puede "fallar" en el benchmark o pasar casi tres veces mejor — simplemente cambiando cómo se presenta la pregunta y el contexto del documento.

Por qué esto importa para las aplicaciones empresariales de LLM

Las empresas construyen cada vez más sistemas internos de búsqueda y procesamiento de documentos sobre LLMs — lo que la industria llama RAG (generación aumentada por recuperación): acuerdos, órdenes e facturas rara vez se almacenan en un formato conveniente para el modelo, y en la práctica el modelo debe seleccionar el documento necesario de muchos similares, luego citar la línea exacta. Esto es exactamente lo que el benchmark del autor probó.

Si la variación en los resultados se explica por el formato de la solicitud en lugar de la elección del modelo, entonces para los equipos que implementan LLMs en procesos internos, las inversiones en una organización adecuada de consultas y contexto pueden producir un efecto mayor que cambiar a un modelo más grande o más costoso. Esto es especialmente notable en la resistencia a cambios "pequeños": cuando una sola fecha en uno de los documentos se cambia, y el modelo continúa citando la versión antigua o pierde el documento necesario entre similares — tales fallas son generalmente lo que socava la confianza en los sistemas LLM dentro de las empresas, incluso si el modelo funciona razonablemente bien en promedio.

Qué significa esto

Un benchmark en documentos corporativos reales muestra: comparar modelos "directamente" sin fijar el método de presentación de preguntas no es confiable metodológicamente, y para la implementación práctica de LLMs en flujo de documentos, es más importante no perseguir un modelo más poderoso, sino perfeccionar cómo se le hacen preguntas.

Preguntas Frecuentes

¿Qué exactamente probó el benchmark?

Los modelos fueron probados en la capacidad de encontrar el documento correcto entre documentos similares entre sí — políticas, órdenes, facturas y acuerdos — citar una línea específica y no perder precisión si una sola fecha en uno de los documentos fue cambiada.

¿Por qué el mismo benchmark produjo resultados tan diferentes?

Porque el resultado resultó ser sensible no al modelo en sí, sino a cómo se organizaron las solicitudes hacia él — el autor del experimento vincula directamente la diferencia de 28% a 76% específicamente a cómo se presentaron las preguntas, en lugar de cambiar el modelo.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…