MarkTechPost→ оригинал

MarkTechPost показал, как собрать ИИ-соучёного QSAR для поиска ингибиторов EGFR

MarkTechPost опубликовал 6 июля 2026 года тьюториал по созданию автономного ИИ-соучёного для поиска ингибиторов мутации EGFR C797S, вызывающей устойчивость опухолей к таргетной терапии. Система берёт данные ChEMBL и UniProt, стандартизирует молекулы через RDKit, обучает scaffold-split Random Forest QSAR-модель на отпечатках Моргана, объясняет предсказания через SHAP и с помощью BRICS-фрагментов собирает и ранжирует новые молекулы-кандидаты.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
MarkTechPost показал, как собрать ИИ-соучёного QSAR для поиска ингибиторов EGFR
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

MarkTechPost 6 июля 2026 года опубликовал практический тьюториал о создании автономного ИИ-соучёного для поиска ингибиторов мутации EGFR C797S — одной из причин лекарственной устойчивости при раке лёгкого.

Как система собирает данные

Пайплайн начинается с определения белка-мишени: через базы ChEMBL и UniProt авторы находят структурную и функциональную информацию об EGFR и его устойчивой к терапии форме C797S. Из ChEMBL извлекаются записи об экспериментальной активности IC50 — концентрации вещества, при которой ингибируется половина активности мишени. Эти значения переводятся в pIC50, стандартную логарифмическую шкалу силы связывания, удобную для обучения модели машинного обучения.

  • Источники данных — базы ChEMBL (химическая активность) и UniProt (белковая мишень)
  • Целевая мутация — EGFR C797S, одна из причин устойчивости опухолей к таргетным препаратам
  • Показатель активности — IC50, переведённый в pIC50
  • Кодирование структуры молекул — отпечатки Моргана через библиотеку RDKit
  • Модель — Random Forest со scaffold-split разбиением выборки

Как обучается QSAR-модель

После сбора и очистки данных RDKit стандартизирует химические структуры и рассчитывает отпечатки Моргана — числовые векторы, кодирующие окружение каждого атома молекулы. На этих признаках обучается модель Random Forest, которая учится предсказывать значение pIC50 для новых, ранее не встречавшихся соединений.

Ключевая методологическая деталь — scaffold-split. Вместо случайного деления данных на обучающую и тестовую выборки авторы группируют молекулы по химическому каркасу и следят, чтобы соединения с одинаковым скелетом не попадали одновременно в обе выборки. Такой подход честнее проверяет способность модели обобщать знания на структурно новые классы веществ, а не просто запоминать варианты уже знакомых молекул.

Зачем нужен SHAP и генерация кандидатов

Чтобы понять, какие именно фрагменты молекулы повышают предсказанную активность, авторы применяют SHAP — метод интерпретации моделей машинного обучения, показывающий вклад каждого признака в итоговый прогноз. Это превращает Random Forest из чёрного ящика в инструмент, который подсказывает химикам, какие структурные элементы стоит сохранить или усилить в новых кандидатах.

Дальше в пайплайн включается алгоритм BRICS — он разбивает известные активные молекулы на фрагменты по типичным точкам разрыва связей при химическом синтезе. Пересобирая эти фрагменты в новых комбинациях, система генерирует библиотеку кандидатных структур и с помощью обученной QSAR-модели ранжирует их по прогнозируемой силе связывания с EGFR C797S, отбирая наиболее перспективные варианты для дальнейшей проверки.

Что это значит

Тьюториал показывает, как связка открытых баз данных, RDKit, классического машинного обучения и объяснимого ИИ превращается в рабочий инструмент ранней стадии разработки лекарств — без проприетарных платформ и с прозрачной логикой каждого предсказания, которую может проверить химик.

Частые вопросы

Что такое scaffold-split при обучении QSAR-модели?

Это способ разделения данных на обучающую и тестовую выборки по химическому каркасу молекул, а не случайным образом — так проверяется, способна ли модель предсказывать активность действительно новых структур, а не просто узнавать похожие на уже виденные.

Зачем в пайплайне нужны BRICS-фрагменты?

BRICS разбивает известные активные молекулы на фрагменты по типичным точкам разрыва связей при синтезе, а затем позволяет пересобирать эти фрагменты в новые кандидатные структуры, которые модель ранжирует по прогнозируемой силе связывания с EGFR C797S.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…