RAG (Retrieval-Augmented Generation)
RAG (retrieval-augmented generation) es una técnica que permite que un modelo de lenguaje extraiga documentos relevantes de una base de conocimiento externa antes de responder y fundamentar su respuesta en ellos. Reduce alucinaciones y mantiene las respuestas actuales sin reentrenar el modelo.
RAG combina dos componentes: un recuperador y un generador. Cuando llega una pregunta, el recuperador la convierte en un embedding, busca en una base de datos vectorial de tus documentos pasajes semánticamente similares, y entrega las mejores coincidencias al modelo de lenguaje como contexto. El modelo entonces escribe su respuesta fundamentada en esos pasajes en lugar de depender solo de lo que memorizó durante el entrenamiento.
El enfoque resuelve tres problemas crónicos de LLM simultáneamente. Frescura del conocimiento: actualizas la base de documentos, no el modelo. Alucinaciones: el modelo cita el texto recuperado en lugar de inventar hechos. Datos privados: los wikis corporativos, contratos y tickets de soporte nunca necesitan entrar en el entrenamiento del modelo — permanecen en el índice y se obtienen en tiempo de consulta.
RAG no es una bala de plata: la calidad de la respuesta está limitada por la calidad de la recuperación. Si el paso de búsqueda devuelve fragmentos irrelevantes, el modelo resumirá confiadamente el material incorrecto. Los sistemas en producción por lo tanto invierten en estrategia de chunking, búsqueda híbrida (palabra clave + vectorial), reranking, y evalúan el paso de recuperación separadamente del paso de generación.