返回科研项目
RESEARCH · 01

可解释深度学习 pKa 预测

GraFpKa
已发表 · J. Pharm. Analysis 2022 — 2025

研究背景

pKa 对分子的 ADMET(吸收、分布、代谢、排泄与毒性)性质具有显著影响, 是药物研究中的重要指标。现有 pKa 预测方法可分为两类: 基于物理的方法依据物理定律计算,准确性与可靠性较高,但对算力需求大; 以 QSAR 为代表的经验方法则依赖数据驱动, 但其输入多为人工构建的分子指纹或描述符,需要较多专家知识且可能引入主观偏差, 定长向量也限制了对不同复杂度分子的表达。 近年来图神经网络快速发展,在保持较高精度的同时算力需求更低, 已广泛应用于分子性质预测。

然而,多数研究致力于提升预测精度,忽略了模型的可解释性。 本项目的研究问题由此而来:如何在保证预测精度的前提下提升模型的可解释性,打开深度学习模型的"黑箱"。

我的贡献

  • 从相关研究中收集分子 pKa 数据,划分为酸性与碱性两个数据集,分别构建酸性和碱性 pKa 预测模型
  • 设计分子图与分子指纹的多模态融合表征:以 AttentiveFP 从分子图中学习原子连接关系,以全连接层提取指纹中分子图不包含的结构信息,拼接后联合预测
  • 构建大规模预测数据预训练与实验数据微调的迁移学习策略,提升模型泛化性能
  • 依次完成外部验证、Y 随机化检验与应用域分析,系统评估模型的可靠性、鲁棒性与适用范围
  • 引入积分梯度法进行可解释性分析,可视化原子及官能团对预测值的贡献方向与大小

方法与数据

数据。 预训练数据共 1,268,985 条(酸性 712,352 条、碱性 556,633 条,来自 ChEMBL), 微调数据为 5,742 条实验值(酸性 2,750 条、碱性 2,992 条,来自 DataWarrior), 均按 8 : 1 : 1 划分为训练、验证与测试集。 酸性与碱性微调数据集分别包含 552 和 607 个独特骨架,其中仅来自 1—2 个分子的骨架分别占 76.99% 和 78.91%; 骨架云图与相似性热图显示两数据集平均相似度仅 0.112 和 0.099,表明数据多样性较高。 对预训练与微调数据在分子量(MW)、logP、拓扑极性表面积(TPSA)、氢键受体数(HBA)、 氢键供体数(HBD)和 pKa 六个维度的比较表明,预训练数据能够覆盖微调数据的多数特征分布, 有利于模型学习更广的化学空间;t-SNE 降维可视化进一步验证了数据集划分的合理性。

模型。 分子图经 AttentiveFP 提取连接关系特征, 分子指纹为 MACCS(166 位)、ErG 药效团指纹(315 位)与 PubChem 指纹(881 位)构成的混合指纹, 经全连接层提取补充结构特征, 二者拼接后分别输出酸性和碱性 pKa 预测; 整体训练采用预训练—微调两阶段迁移学习策略, 完成后依次进行外部验证、Y 随机化检验、应用域分析与可解释性分析。

GraFpKa · 模型架构 MODEL CONSTRUCTION
GraFpKa 双分支融合预测架构 参照论文图 B 重绘。分子图通过 AttentiveFP 提取图特征,分子指纹通过多层感知机提取指纹特征。两类特征拼接后输入预测网络,分别用于酸性或碱性 pKa 模型。整体训练采用预训练后微调的迁移学习策略。图中节点与维度仅作结构示意。 01 / 双分支表征 02 / 特征融合与预测 整体训练策略 · Transfer learning 预训练 微调 分子图 Molecule graphs AttentiveFP 图特征提取 Cl S N O OH 01011010 分子指纹 Fingerprints 多层感知机 · MLP 指纹特征提取 特征拼接 Concatenate 预测网络 Fully connected pKa 酸性 / 碱性 分别建模 分子连接关系 + 指纹结构信息 → 融合表征 → pKa 预测
依据论文图 B 重绘。两条分支的特征拼接后进入预测网络,酸性与碱性任务分别建模;预训练—微调策略应用于整体模型。图中分子、节点数量及向量长度仅作架构示意。
AttentiveFP Molecular Fingerprint Transfer Learning Integrated Gradients External Validation Y-Randomization Applicability Domain

关键结果

  • 内部测试集上酸性与碱性模型的 MAE 分别为 0.621 和 0.402,全面优于仅用 AttentiveFP 的基线模型(0.850 和 0.727),证明融合分子指纹能够提升模型性能
  • 四个外部验证集上 R2 分别达到 0.876、0.876、0.882 和 0.841(SAMPL6 上 MAE 为 0.708),与同类模型相比具有较强竞争力
  • Y 随机化检验(25 次重复)中随机模型性能显著减弱,酸性与碱性模型的 cR2p 分别为 0.892 和 0.970,证明模型性能并非来自数据偶然性
  • 应用域分析界定了模型可信预测的分子范围,在精度与覆盖率的平衡下,酸性与碱性模型分别维持 77.8% 和 78.0% 的覆盖率

可解释性示意

原子级贡献解释 · 研究示意 INTEGRATED GRADIENTS · GraFpKa
原子级贡献解释示意 绿色和加号表示正归因,红色和减号表示负归因,空心圆表示未突出标注的原子。末端原子标为 N。结构、着色和数值均为说明图例的示例,不代表实际分子的积分梯度计算结果。 正贡献 负贡献 中性原子 N +0.38 +0.12 −0.27 原子着色:相对于基线的归因方向 · 数值仅作示意
绿色(+)与红色(−)分别表示正、负归因方向。图中结构、着色与数值仅用于解释读图方式,并非论文中某个分子的实际计算结果。

可解释性分析从两个角度展开:一是关键原子的捕捉——对 3-氨基-2-氟丁酸、 4-氨基-2-氟-5-甲基苯甲酸等分子的分析显示,模型能够定位决定 pKa 的关键原子; 二是微小变化的检测——对丁酸与 2-/3-/4-氟丁酸、丙-1-胺与不同位置氟代丙胺系列的比较显示, 模型能识别取代位置变化并给出一致的原子贡献解释。 与传统权重可视化方法相比,积分梯度能够进一步区分各原子或基团对 pKa 的影响方向(升高或降低)。

当前状态

研究论文已发表于 Journal of Pharmaceutical Analysis(第一作者,DOI:10.1016/j.jpha.2024.101174), 相关软件已获得软件著作权登记(GraFpKa V1.0)。

关联链接