Habr AI→ original

RAG + graphe d'appels : contexte automatique depuis un gestionnaire de tâches pour Claude Code

Le contexte est le principal problème lorsqu'on travaille avec LLM sur des projets réels, et non la qualité du modèle. Un développeur sur Habr a décrit une solution : un index RAG du dépôt avec des vecteurs et un graphe d'appels, plus un plugin pour Claude Code. Le système détermine lui-même quels fichiers et fonctions sont liés à une tâche du gestionnaire, assemble le contexte automatiquement et le réduit à une limite de tokens raisonnable.

Traité par IA depuis Habr AI ; édité par Hamidun News
RAG + graphe d'appels : contexte automatique depuis un gestionnaire de tâches pour Claude Code
Source : Habr AI. Collage: Hamidun News.
◐ Écouter l'article

Le contexte est le principal problème lors de l'utilisation des LLM dans le développement réel. Ce n'est pas la qualité du modèle ou la taille de la fenêtre, mais ce qui et comment cela entre dans le prompt. Un développeur a partagé une solution pratique sur Habr : un index RAG du référentiel avec des vecteurs et un graphe d'appels, plus un plugin pour Claude Code qui collecte automatiquement le contexte d'une tâche du suivi de tâches — sans sélection manuelle et sans gaspillage de tokens.

Pourquoi le

Contexte est Plus Important que la Qualité du Modèle

Quand un développeur prend une tâche du suivi et ouvre un assistant IA, l'étape la plus difficile n'est pas le dialogue avec le modèle, mais sa préparation. Vous devez comprendre quels fichiers sont liés à la tâche, quelles fonctions sont appelées, quels modules sont interconnectés. Dans les grands projets, cela prend 10–20 minutes d'examen manuel du code — avant d'écrire le premier prompt.

Si vous versez tout dans le contexte d'un coup — les tokens sont dépensés rapidement, la requête devient chère, et le LLM se perd dans le bruit du code non lié. Si vous prenez trop peu — le modèle ne voit pas les dépendances, omet des fonctions importantes et donne des réponses superficielles. Trouver l'équilibre manuellement est difficile.

Le RAG classique avec embeddings résout une partie du problème : la recherche sémantique trouve des fragments sémantiquement similaires. Mais il ne comprend pas la structure du code : la fonction A peut être sémantiquement éloignée de B, mais l'appeler directement — et les deux sont nécessaires dans le contexte.

Comment la Solution Fonctionne

L'auteur a construit un système sur deux niveaux d'indexation :

  • Couche vectorielle — embeddings de code pour recherche sémantique : fragments similaires, commentaires, noms
  • Graphe d'appels — dépendances structurelles : la fonction A appelle B, le module C importe D, E hérite de F
  • Plugin Claude Code — lit la description de la tâche du suivi et exécute la recherche sur les deux niveaux
  • Classement et troncature — les résultats sont pondérés par pertinence et coupés à la limite de tokens
  • Mises à jour incrémentielles — l'index n'est pas recalculé à partir de zéro à chaque commit

Le système repose sur un analyseur de code (AST) et des outils d'analyse statique. Le graphe d'appels permet de contourner les limitations de la recherche sémantique : même si les noms de fonctions ne sont pas standards ou si les commentaires sont rares, les connexions structurelles du code peuvent toujours être tracées via l'AST.

L'index est stocké séparément de la base de code et ne nécessite aucune modification du référentiel lui-même. Le plugin Claude Code s'installe comme une extension standard et accède à l'index via une API locale.

Économie de Tokens

C'est ici que l'approche produit des résultats mesurables. Sans contexte intelligent, les développeurs versent souvent des fichiers entiers ou des répertoires dans le prompt — "par précaution." Avec RAG + graphe, le système décide lui-même ce qui est pertinent et retourne uniquement cela.

«

Le principal problème de l'utilisation des LLM dans un projet réel n'est pas la qualité du modèle, mais le contexte », — l'auteur de l'article.

Pour les grands monorepos, l'effet est particulièrement notable : au lieu de 50 000 tokens de « tout ce qui pourrait être lié » — 3 000–5 000 tokens de contexte précis. C'est à la fois la vitesse de réponse et une économie directe d'API. La pratique montre : un contexte correctement collecté réduit le nombre d'itérations avec le modèle. Quand l'IA voit toutes les dépendances à la fois, elle demande rarement des fragments supplémentaires ou donne des réponses incomplètes.

Ce Que Cela Signifie

L'approche montre une direction réelle pour les équipes d'ingénierie mettant en œuvre des assistants IA : automatiser non pas le dialogue avec le modèle lui-même, mais la collecte de contexte avant celui-ci. L'intégration avec le suivi de tâches est une étape logique : la tâche est déjà décrite, il suffit de la lier correctement au code. Pour les grandes équipes avec des centaines de tickets par jour, cela peut devenir une partie standard du processus d'ingénierie.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…