返回成果与获奖
OUTPUT · TEXTBOOK SECTION

《人工智能药学》第 5-2 章第一节:基于机器学习的 ADME 性质预测

在审 教材参编
内容规划 案例设计 撰写与修订

内容简介

本节系统介绍基于机器学习的 ADME(吸收、分布、代谢、排泄)性质预测方法。 首先阐述 ADME 的基本概念与重要性——约 40% 的药物研发失败可归因于不良的 ADME 性质, 而传统实验测试成本高、周期长、通量低,人工智能预测模型由此成为前移研发风险的重要决策支持工具。 其次,以口服给药为例梳理吸收、分布、代谢、排泄各环节的关键性质与可预测端点 (如 HIA、Caco-2 渗透性、血浆蛋白结合率、CYP450 / UGT 底物与抑制剂、肾清除率等)。 在此基础上,本节给出 ADME 预测模型构建的标准化流程, 涵盖数据收集、数据处理、分子表征、特征选择、模型构建、模型评价、应用域分析与可解释性分析八个核心步骤, 并结合两个前沿案例(数据 / 表征 / 算法的综合基准评估、跨物种静脉注射药代动力学参数预测) 说明如何根据任务特点选择合适的建模策略。 最后,本节介绍了 PubChem、DrugBank、ChEMBL、OCHEM 等常用数据库 与 admetSAR 3.0、ADMET-AI、ADMETlab 3.0、Deep-PK 等代表性在线预测平台。

负责范围

负责第 5-2 章第一节的内容规划、案例设计、撰写与修订。 章节聚焦机器学习方法在 ADME 性质预测中的原理、流程与典型应用案例。

核心流程

ADME 性质预测模型构建流程 MODELING WORKFLOW
ADME 性质预测模型的八个核心步骤 两行流程,上行为数据收集、数据处理、分子表征、特征选择,下行为模型构建、模型评价、应用域分析、可解释性分析。数据收集来自 PubChem、DrugBank、ChEMBL、OCHEM 等数据库与文献;数据处理包括实验体系统一、化学合理性校验、去盐去无机、去重与标签一致性;分子表征包括指纹、描述符与分子图;特征选择过滤冗余;模型构建涵盖机器学习与深度学习算法及训练策略;模型评价分内部交叉验证与外部验证;应用域基于距离或相似性阈值;可解释性分析将黑箱变为白箱。 ① 数据收集 PubChem · DrugBank ChEMBL · OCHEM 公开发表的科学文献 数据规模与质量决定 模型性能上限 ② 数据处理 实验体系与方法统一 化学合理性校验 去盐 · 去无机 · 去重 分类阈值 / 回归单位统一 标签一致性处理 ③ 分子表征 分子指纹(MACCS 等) 分子描述符(理化 · 拓扑) 分子图(GNN 输入) 连接化学与 AI 模型的 桥梁 ④ 特征选择 过滤法 · 包装法 嵌入法 · 经验方法 避免维度灾难 降低复杂度 · 防过拟合 ⑤ 模型构建 SVM · 随机森林 XGBoost · LightGBM DNN · GNN · Transformer 迁移 · 自监督 · 多任务学习 ⑥ 模型评价 内部验证:k 折交叉验证 外部验证:独立数据集 分类:Acc · F1 · AUC 回归:R² · MAE · RMSE ⑦ 应用域分析 距离 / 相似性阈值 D = μ + Zσ 界定可靠预测的 化学空间范围 ⑧ 可解释性分析 将「黑箱」变为「白箱」 归因到原子 / 子结构 增加模型可信度 辅助机制理解 数据 → 表征 → 建模 → 验证 → 应用域 → 可解释性:ADME 预测模型构建的八个核心步骤
依据教材图 5-18 的流程重绘:数据收集、数据处理、分子表征、特征选择、模型构建、模型评价、应用域分析、可解释性分析八个核心步骤。应用域阈值 D = μ + Zσ 中,μ 与 σ 为训练集分子两两距离 / 相似性的均值与标准差。

出版说明

本节目前在审,出版信息以最终成书为准。角色表述仅覆盖本人负责部分。