Desenvolvedor substituiu explicação repetida de contexto de rede neural por fluxo de trabalho LLM Wiki
Habr publicou uma análise do fluxo de trabalho LLM Wiki: em vez de explicar repetidamente o contexto para a rede neural cada vez, o autor construiu um sistema em Obsidian e Codex onde o modelo popula gradualmente uma base de conhecimento em vez de fazer busca de documentos padrão. Vários artigos do Habr serviram como fontes para preenchimento, o processo construído em três etapas — ingest, query e lint, com custo de carregamento de dados calculado usando Yandex Foundation Models.
Processado por IA de Habr AI; editado por Hamidun News
Um autor de blog técnico no Habr demonstrou um fluxo de trabalho LLM Wiki: em vez de re-explicar o contexto para uma rede neural a cada solicitação, o modelo preenche gradualmente e organiza uma base de conhecimento no armazenamento Obsidian. Vários artigos do Habr foram usados como fontes para preencher a base, e o processamento de tarefas foi construído em Codex.
Do Que o Fluxo de Trabalho É Construído
O sistema se baseia em uma combinação de várias ferramentas e três processos sequenciais que o autor implementou independentemente em cima de um vault existente no Obsidian.
- Armazenamento de conhecimento — vault no Obsidian
- Processamento e geração de solicitações — através de Codex
- Fontes para preenchimento da base — vários artigos do Habr
- Três processos de pipeline: ingest (carregamento de materiais), query (consultar a base), lint (verificação de qualidade)
- O autor calculou o custo de ingest no modelo Yandex Foundation Models
Constituir o fluxo de trabalho em torno de exatamente três processos separados — ingest, query e lint — permite ao autor dividir a responsabilidade: carregar novos materiais, acessar conhecimento já acumulado e verificar qualidade ocorrem como etapas independentes, não como uma única operação monolítica.
Como Isso Difere do RAG Regular
A abordagem clássica de RAG, a cada solicitação, busca novamente fragmentos relevantes em uma base de documentos e os substitui no prompt — o modelo não lembra de nada entre sessões, e o contexto precisa ser remontado do zero cada vez. No LLM Wiki, o modelo, por outro lado, complementa e estrutura incrementalmente o vault: o resultado de cada consulta não apenas responde ao usuário, mas também se assenta na base de conhecimento como uma camada wiki separada que pode ser reutilizada em consultas subsequentes sem re-explicar o contexto.
O autor mostra no artigo a estrutura do vault em si e exemplos de como essa camada wiki se parece na prática, comparando a abordagem resultante com o RAG regular em termos de conveniência e custo. De acordo com sua descrição, a diferença chave não é de onde o modelo obtém os fatos, mas o que acontece com a resposta após ser recebida: no RAG clássico a resposta é perdida após a sessão, enquanto no LLM Wiki ela permanece parte da base para consultas subsequentes.
Que Riscos a Abordagem Tem
O autor analisa separadamente os riscos que se manifestam rapidamente na prática com tal abordagem — em particular, a questão do custo do ingest constante de novos materiais e a necessidade de um processo lint separado para que a base de conhecimento não se degrade e não acumule entradas contraditórias conforme cresce.
O autor calculou os custos de ingest não abstratamente, mas em um modelo específico — Yandex Foundation Models — o que fala sobre uma tentativa de avaliar a economia da abordagem na prática, em vez de apenas descrever sua arquitetura em teoria.
O Que Isso Significa
O fluxo de trabalho LLM Wiki oferece uma alternativa ao RAG tradicional: em vez de remontar o contexto de documentos brutos a cada vez, o modelo mantém uma base de conhecimento viva e constantemente atualizada — isso pode reduzir o número de tokens gastos explicando o contexto, mas requer controle de qualidade separado através do lint para manter a base confiável.
Para aqueles que trabalham com LLM em grandes volumes de perguntas repetitivas — seja uma base de conhecimento pessoal em Obsidian ou documentação corporativa — tal abordagem mostra um caminho prático para reduzir o custo de repetir constantemente o mesmo contexto em prompts.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.