Técnicas e métodos

RAG (Retrieval-Augmented Generation)

RAG (retrieval-augmented generation) é uma técnica que permite a um modelo de linguagem extrair documentos relevantes de uma base de conhecimento externa antes de responder e fundamentar sua resposta neles. Reduz alucinações e mantém as respostas atuais sem retreinar o modelo.

RAG combina dois componentes: um retriever e um generator. Quando uma pergunta chega, o retriever a converte em um embedding, pesquisa um vector database de seus documentos para passages semanticamente similares, e entrega as melhores correspondências ao modelo de linguagem como contexto. O modelo então escreve sua resposta fundamentada nessas passages em vez de depender apenas do que memorizou durante o treinamento.

A abordagem resolve três problemas crônicos de LLM de uma vez. Atualização de conhecimento: você atualiza a base de documentos, não o modelo. Alucinações: o modelo cita texto recuperado em vez de inventar fatos. Dados privados: wikis corporativos, contratos e tickets de suporte nunca precisam entrar no treinamento do modelo — eles permanecem no índice e são buscados no tempo de consulta.

RAG não é uma panaceia: a qualidade da resposta é limitada pela qualidade do retrieval. Se a etapa de busca retornar chunks irrelevantes, o modelo confiadamente resumirá o material errado. Sistemas em produção portanto investem em estratégia de chunking, busca híbrida (keyword + vector), reranking e avaliação da etapa de retrieval separadamente da etapa de geração.

Exemplo

Um chatbot de suporte usa RAG para pesquisar artigos do centro de ajuda da empresa e responde com a política de reembolso exata em vez de adivinhar.

Termos relacionados

Últimas notícias sobre o tema

← Glossário