RAG (Retrieval-Augmented Generation)
RAG (retrieval-augmented generation) é uma técnica que permite a um modelo de linguagem extrair documentos relevantes de uma base de conhecimento externa antes de responder e fundamentar sua resposta neles. Reduz alucinações e mantém as respostas atuais sem retreinar o modelo.
RAG combina dois componentes: um retriever e um generator. Quando uma pergunta chega, o retriever a converte em um embedding, pesquisa um vector database de seus documentos para passages semanticamente similares, e entrega as melhores correspondências ao modelo de linguagem como contexto. O modelo então escreve sua resposta fundamentada nessas passages em vez de depender apenas do que memorizou durante o treinamento.
A abordagem resolve três problemas crônicos de LLM de uma vez. Atualização de conhecimento: você atualiza a base de documentos, não o modelo. Alucinações: o modelo cita texto recuperado em vez de inventar fatos. Dados privados: wikis corporativos, contratos e tickets de suporte nunca precisam entrar no treinamento do modelo — eles permanecem no índice e são buscados no tempo de consulta.
RAG não é uma panaceia: a qualidade da resposta é limitada pela qualidade do retrieval. Se a etapa de busca retornar chunks irrelevantes, o modelo confiadamente resumirá o material errado. Sistemas em produção portanto investem em estratégia de chunking, busca híbrida (keyword + vector), reranking e avaliação da etapa de retrieval separadamente da etapa de geração.