MarkTechPost mostró cómo construir un coautor de IA QSAR para encontrar inhibidores de EGFR
MarkTechPost publicó un tutorial el 6 de julio de 2026 sobre cómo crear un coautor de IA autónomo para buscar inhibidores de la mutación EGFR C797S, que causa resistencia tumoral a la terapia dirigida. El sistema toma datos de ChEMBL y UniProt, estandariza moléculas a través de RDKit, entrena un modelo Random Forest QSAR con división de scaffold en huellas Morgan, explica predicciones a través de SHAP y ensambla y clasifica nuevas moléculas candidatas usando fragmentos BRICS.
Procesado por IA desde MarkTechPost; editado por Hamidun News
MarkTechPost el 6 de julio de 2026 publicó un tutorial práctico sobre cómo crear un asistente de investigación de IA autónomo para descubrir inhibidores de la mutación EGFR C797S — una de las razones de la resistencia a los medicamentos en el cáncer de pulmón.
Cómo el sistema recopila datos
El pipeline comienza definiendo la proteína objetivo: a través de las bases de datos ChEMBL y UniProt, los autores encuentran información estructural y funcional sobre EGFR y su forma resistente a terapia C797S. Se extraen registros de actividad experimental IC50 de ChEMBL — la concentración de una sustancia en la cual se inhibe la mitad de la actividad del objetivo. Estos valores se convierten a pIC50, una escala logarítmica estándar de fuerza de unión, conveniente para entrenar un modelo de aprendizaje automático.
- Fuentes de datos — bases de datos ChEMBL (actividad química) y UniProt (objetivo proteico)
- Mutación objetivo — EGFR C797S, una de las razones de la resistencia tumoral a fármacos dirigidos
- Medida de actividad — IC50, convertida a pIC50
- Codificación de estructura molecular — huellas dactilares de Morgan mediante la biblioteca RDKit
- Modelo — Random Forest con partición de datos de scaffold-split
Cómo se entrena el modelo QSAR
Después de la recopilación y limpieza de datos, RDKit estandariza estructuras químicas y calcula huellas dactilares de Morgan — vectores numéricos que codifican el entorno de cada átomo en una molécula. Se entrena un modelo Random Forest en estas características, aprendiendo a predecir valores de pIC50 para compuestos nuevos y nunca antes vistos.
Un detalle metodológico clave es scaffold-split. En lugar de dividir aleatoriamente los datos en conjuntos de entrenamiento y prueba, los autores agrupan moléculas por andamio químico y aseguran que los compuestos con el mismo esqueleto no terminen en ambos conjuntos simultáneamente. Este enfoque prueba más honestamente la capacidad del modelo para generalizar conocimiento a clases estructuralmente nuevas de sustancias, en lugar de simplemente memorizar variantes de moléculas ya familiares.
Por qué SHAP y la generación de candidatos importan
Para entender qué fragmentos moleculares específicos aumentan la actividad predicha, los autores aplican SHAP — un método para interpretar modelos de aprendizaje automático, mostrando la contribución de cada característica a la predicción final. Esto transforma Random Forest de una caja negra en una herramienta que dice a los químicos qué elementos estructurales vale la pena preservar o fortalecer en nuevos candidatos.
A continuación, el algoritmo BRICS se incluye en el pipeline — rompe moléculas activas conocidas en fragmentos en puntos típicos de ruptura de enlaces durante la síntesis química. Al reensamblarse estos fragmentos en nuevas combinaciones, el sistema genera una biblioteca de estructuras candidatas y utiliza el modelo QSAR entrenado para clasificarlas por la fuerza de unión predicha a EGFR C797S, seleccionando las variantes más prometedoras para pruebas posteriores.
Qué significa esto
El tutorial muestra cómo una combinación de bases de datos abiertas, RDKit, aprendizaje automático clásico e IA explicable se transforma en una herramienta funcional para el desarrollo de fármacos en etapas tempranas — sin plataformas propietarias y con lógica transparente para cada predicción que un químico puede verificar.
Preguntas frecuentes
¿Qué es scaffold-split en el entrenamiento del modelo QSAR?
Esta es una forma de dividir datos en conjuntos de entrenamiento y prueba por andamio químico de moléculas, en lugar de aleatoriamente — esto prueba si el modelo puede predecir actividad de estructuras verdaderamente nuevas, en lugar de simplemente reconocer aquellas similares a las ya vistas.
¿Por qué son necesarios los fragmentos BRICS en el pipeline?
BRICS rompe moléculas activas conocidas en fragmentos en puntos típicos de ruptura de enlaces durante la síntesis, y luego permite reensamblarse estos fragmentos en nuevas estructuras candidatas que el modelo clasifica por la fuerza de unión predicha a EGFR C797S.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.