MarkTechPost→ original

MarkTechPost a montré comment construire un co-chercheur IA QSAR pour trouver des inhibiteurs d'EGFR

MarkTechPost a publié un tutoriel le 6 juillet 2026 sur la création d'un co-chercheur IA autonome pour rechercher des inhibiteurs de la mutation EGFR C797S, qui provoque une résistance tumorale à la thérapie ciblée. Le système récupère les données de ChEMBL et UniProt, normalise les molécules via RDKit, entraîne un modèle Random Forest QSAR avec division de scaffold sur les empreintes Morgan, explique les prédictions via SHAP et assemble et classe les nouvelles molécules candidates à l'aide de fragments BRICS.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
MarkTechPost a montré comment construire un co-chercheur IA QSAR pour trouver des inhibiteurs d'EGFR
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

MarkTechPost le 6 juillet 2026 a publié un tutoriel pratique sur la création d'un assistant de recherche en IA autonome pour découvrir des inhibiteurs de mutation EGFR C797S — l'une des raisons de la résistance aux médicaments dans le cancer du poumon.

Comment le système collecte les données

Le pipeline commence par définir la protéine cible : par le biais des bases de données ChEMBL et UniProt, les auteurs trouvent des informations structurales et fonctionnelles sur EGFR et sa forme C797S résistante à la thérapie. Les enregistrements d'activité IC50 expérimentale sont extraits de ChEMBL — la concentration d'une substance à laquelle la moitié de l'activité de la cible est inhibée. Ces valeurs sont converties en pIC50, une échelle logarithmique standard de force de liaison, pratique pour entraîner un modèle d'apprentissage automatique.

  • Sources de données — bases de données ChEMBL (activité chimique) et UniProt (cible protéique)
  • Mutation cible — EGFR C797S, l'une des raisons de la résistance tumorale aux médicaments ciblés
  • Mesure d'activité — IC50, convertie en pIC50
  • Codage de structure moléculaire — empreintes digitales de Morgan via la bibliothèque RDKit
  • Modèle — Random Forest avec partitionnement de données scaffold-split

Comment le modèle QSAR est entraîné

Après la collecte et le nettoyage des données, RDKit standardise les structures chimiques et calcule les empreintes digitales de Morgan — des vecteurs numériques codant l'environnement de chaque atome dans une molécule. Un modèle Random Forest est entraîné sur ces caractéristiques, apprenant à prédire les valeurs de pIC50 pour les composés nouveaux et jamais vus auparavant.

Un détail méthodologique clé est le scaffold-split. Au lieu de diviser aléatoirement les données en ensembles d'entraînement et de test, les auteurs groupent les molécules par échafaudage chimique et s'assurent que les composés avec le même squelette ne se retrouvent pas dans les deux ensembles simultanément. Cette approche teste plus honnêtement la capacité du modèle à généraliser les connaissances à des classes de substances structurellement nouvelles, plutôt que de simplement mémoriser les variantes de molécules déjà familières.

Pourquoi SHAP et la génération de candidats importent

Pour comprendre quels fragments moléculaires spécifiques augmentent l'activité prédite, les auteurs appliquent SHAP — une méthode pour interpréter les modèles d'apprentissage automatique, montrant la contribution de chaque caractéristique à la prédiction finale. Cela transforme Random Forest d'une boîte noire en un outil qui dit aux chimistes quels éléments structuraux valent la peine d'être préservés ou renforcés dans les nouveaux candidats.

Ensuite, l'algorithme BRICS est inclus dans le pipeline — il casse les molécules actives connues en fragments aux points typiques de rupture de liaison lors de la synthèse chimique. En réassemblant ces fragments en nouvelles combinaisons, le système génère une bibliothèque de structures candidates et utilise le modèle QSAR entraîné pour les classer selon la force de liaison prédite à EGFR C797S, sélectionnant les variantes les plus prometteuses pour des tests supplémentaires.

Ce que cela signifie

Le tutoriel montre comment une combinaison de bases de données ouvertes, RDKit, d'apprentissage automatique classique et d'IA explicable se transforme en outil fonctionnel pour le développement de médicaments en phase précoce — sans plateformes propriétaires et avec une logique transparente pour chaque prédiction qu'un chimiste peut vérifier.

Questions fréquemment posées

Qu'est-ce que scaffold-split dans l'entraînement du modèle QSAR ?

C'est une façon de diviser les données en ensembles d'entraînement et de test par échafaudage chimique de molécules, plutôt que aléatoirement — cela teste si le modèle peut prédire l'activité de structures véritablement nouvelles, plutôt que de simplement reconnaître celles similaires à celles déjà vues.

Pourquoi les fragments BRICS sont-ils nécessaires dans le pipeline ?

BRICS casse les molécules actives connues en fragments aux points typiques de rupture de liaison lors de la synthèse, puis permet de réassembler ces fragments dans de nouvelles structures candidates que le modèle classe selon la force de liaison prédite à EGFR C797S.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…