Por qué los modelos de lenguaje estropean la estructura de un documento cuando les confías la edición
Cuando le pides a un LLM que edite un documento complejo, a menudo devuelve un archivo completamente distinto: encabezados desalineados, tablas perdidas, secciones reescritas que nadie tocó. La razón no es un bug, sino la arquitectura: los modelos regeneran el texto en lugar de editar de forma puntual. KDnuggets desglosa los factores clave: el fenómeno “lost in the middle”, la percepción del formato como tokens aleatorios y la competencia entre la instrucción y los patrones de los datos de entrenamiento.
Procesado por IA desde KDnuggets; editado por Hamidun News
Editar documentos con un modelo de lenguaje parece ser una solución obvia: insertar texto, dar una instrucción, obtener un resultado sin horas de trabajo manual. Sin embargo, en la práctica, el documento devuelto a menudo resulta ser diferente — con encabezados desplazados, párrafos faltantes o fragmentos reformulados que nadie pidió tocar. En lugar de edición, ocurre una degradación invisible de la estructura.
Generación versus edición
La contradicción clave radica en la arquitectura de los transformadores mismos. Los modelos de lenguaje se entrenan para predecir el siguiente token basándose en el contexto — no "editan" en el sentido en que lo hace un procesador de textos. Cuando un modelo recibe la instrucción "corrige la gramática en la tercera sección", no aplica una regla precisa a las líneas — genera lo que cree que el texto actualizado debería parecer en su totalidad.
El límite "editar solo esto" está fundamentalmente difuminado para un LLM: el modelo evalúa todo el contexto y genera una nueva versión en lugar de aplicar ediciones atómicas. Esto es especialmente notable en documentos grandes — cuanto más "material" hay, más fuerte es la desviación de la fuente.
El fenómeno de lo perdido en el medio
Incluso los modelos con una ventana de contexto de 200k tokens crean problemas estructurales con documentos largos. La investigación identifica consistentemente el efecto "lost in the middle": los modelos retienen bien la información del principio y el final del contexto, pero pierden sistemáticamente detalles del medio. Cuanto más largo el documento, más fuerte el efecto. Para archivos reales, esto significa que los elementos estructurales en las secciones centrales tienen más probabilidad de corromperse. Víctimas típicas:
- Listas anidadas — los niveles de anidación se aplanan a uno
- Tablas — pierden la alineación de columnas o se convierten en prosa
- Referencias cruzadas — se convierten en texto plano sin anclajes
- Frontmatter YAML y etiquetas personalizadas — se eliminan como "desorden innecesario"
- Numeración de secciones — se desordena después de cualquier inserción o eliminación de contenido
Formato como tokens sin semántica
Markdown, HTML, LaTeX — el modelo ve todo esto como tokens ordinarios, no como sintaxis con reglas. Para una red neuronal, los símbolos `##` son simplemente dos caracteres de almohadilla, no "un encabezado de segundo nivel alineado con la tabla de contenidos". Los patrones de formato se reproducen por analogía estadística con datos de entrenamiento, no por reglas sintácticas explícitas. El resultado es predecible: indentación inconsistente, niveles de encabezado revueltos, anclajes de enlace rotos, cambio aleatorio entre formatos dentro de un documento. Cada una de estas violaciones es apenas perceptible por sí sola, pero juntas hacen que el documento sea inutilizable para procesamiento automatizado o publicación.
"El modelo no entiende tu documento — entiende la distribución de
probabilidad del siguiente token en su contexto."
Competencia entre instrucción y patrones
Otro factor es la competencia entre la instrucción explícita del usuario y los patrones estadísticos aprendidos durante el entrenamiento. Si Markdown estándar predominaba en los datos de entrenamiento, el modelo será atraído hacia él incluso contra la prohibición explícita. Plantillas corporativas no estándar, marcado técnico específico de estándares, estilo estructural específico del autor — todo esto es vulnerable a la "memoria" del corpus de entrenamiento. Además, las instrucciones largas se "desdibujan" a medida que avanza la generación. Al final de un documento grande, la atención a las restricciones del indicador original se debilita — y la desviación estructural se acumula.
Qué significa esto
Para el trabajo práctico, la conclusión es clara: los LLM son mejores en tareas puntuales que en edición exhaustiva de un documento completo en un único paso. Para archivos complejos estructurados — especificaciones técnicas, contratos legales, artículos académicos con referencias cruzadas — es recomendable dividir el documento en secciones aisladas y trabajar con cada una por separado. Las instrucciones deben ser lo más explícitas posible: "cambia solo este párrafo, deja todo lo demás como está". Después de cualquier edición con LLM, se requiere verificación explícita de elementos estructurales — estos son los primeros en sufrir.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.