KDnuggets→ original

Por qué los modelos de lenguaje estropean la estructura de un documento cuando les confías la edición

Cuando le pides a un LLM que edite un documento complejo, a menudo devuelve un archivo completamente distinto: encabezados desalineados, tablas perdidas, secciones reescritas que nadie tocó. La razón no es un bug, sino la arquitectura: los modelos regeneran el texto en lugar de editar de forma puntual. KDnuggets desglosa los factores clave: el fenómeno “lost in the middle”, la percepción del formato como tokens aleatorios y la competencia entre la instrucción y los patrones de los datos de entrenamiento.

Procesado por IA desde KDnuggets; editado por Hamidun News
Por qué los modelos de lenguaje estropean la estructura de un documento cuando les confías la edición
Fuente: KDnuggets. Collage: Hamidun News.
◐ Escuchar artículo

Editar documentos con un modelo de lenguaje parece ser una solución obvia: insertar texto, dar una instrucción, obtener un resultado sin horas de trabajo manual. Sin embargo, en la práctica, el documento devuelto a menudo resulta ser diferente — con encabezados desplazados, párrafos faltantes o fragmentos reformulados que nadie pidió tocar. En lugar de edición, ocurre una degradación invisible de la estructura.

Generación versus edición

La contradicción clave radica en la arquitectura de los transformadores mismos. Los modelos de lenguaje se entrenan para predecir el siguiente token basándose en el contexto — no "editan" en el sentido en que lo hace un procesador de textos. Cuando un modelo recibe la instrucción "corrige la gramática en la tercera sección", no aplica una regla precisa a las líneas — genera lo que cree que el texto actualizado debería parecer en su totalidad.

El límite "editar solo esto" está fundamentalmente difuminado para un LLM: el modelo evalúa todo el contexto y genera una nueva versión en lugar de aplicar ediciones atómicas. Esto es especialmente notable en documentos grandes — cuanto más "material" hay, más fuerte es la desviación de la fuente.

El fenómeno de lo perdido en el medio

Incluso los modelos con una ventana de contexto de 200k tokens crean problemas estructurales con documentos largos. La investigación identifica consistentemente el efecto "lost in the middle": los modelos retienen bien la información del principio y el final del contexto, pero pierden sistemáticamente detalles del medio. Cuanto más largo el documento, más fuerte el efecto. Para archivos reales, esto significa que los elementos estructurales en las secciones centrales tienen más probabilidad de corromperse. Víctimas típicas:

  • Listas anidadas — los niveles de anidación se aplanan a uno
  • Tablas — pierden la alineación de columnas o se convierten en prosa
  • Referencias cruzadas — se convierten en texto plano sin anclajes
  • Frontmatter YAML y etiquetas personalizadas — se eliminan como "desorden innecesario"
  • Numeración de secciones — se desordena después de cualquier inserción o eliminación de contenido

Formato como tokens sin semántica

Markdown, HTML, LaTeX — el modelo ve todo esto como tokens ordinarios, no como sintaxis con reglas. Para una red neuronal, los símbolos `##` son simplemente dos caracteres de almohadilla, no "un encabezado de segundo nivel alineado con la tabla de contenidos". Los patrones de formato se reproducen por analogía estadística con datos de entrenamiento, no por reglas sintácticas explícitas. El resultado es predecible: indentación inconsistente, niveles de encabezado revueltos, anclajes de enlace rotos, cambio aleatorio entre formatos dentro de un documento. Cada una de estas violaciones es apenas perceptible por sí sola, pero juntas hacen que el documento sea inutilizable para procesamiento automatizado o publicación.

"El modelo no entiende tu documento — entiende la distribución de

probabilidad del siguiente token en su contexto."

Competencia entre instrucción y patrones

Otro factor es la competencia entre la instrucción explícita del usuario y los patrones estadísticos aprendidos durante el entrenamiento. Si Markdown estándar predominaba en los datos de entrenamiento, el modelo será atraído hacia él incluso contra la prohibición explícita. Plantillas corporativas no estándar, marcado técnico específico de estándares, estilo estructural específico del autor — todo esto es vulnerable a la "memoria" del corpus de entrenamiento. Además, las instrucciones largas se "desdibujan" a medida que avanza la generación. Al final de un documento grande, la atención a las restricciones del indicador original se debilita — y la desviación estructural se acumula.

Qué significa esto

Para el trabajo práctico, la conclusión es clara: los LLM son mejores en tareas puntuales que en edición exhaustiva de un documento completo en un único paso. Para archivos complejos estructurados — especificaciones técnicas, contratos legales, artículos académicos con referencias cruzadas — es recomendable dividir el documento en secciones aisladas y trabajar con cada una por separado. Las instrucciones deben ser lo más explícitas posible: "cambia solo este párrafo, deja todo lo demás como está". Después de cualquier edición con LLM, se requiere verificación explícita de elementos estructurales — estos son los primeros en sufrir.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…