可解释深度学习 pKa 预测
研究背景
pKa 对分子的 ADMET(吸收、分布、代谢、排泄与毒性)性质具有显著影响, 是药物研究中的重要指标。现有 pKa 预测方法可分为两类: 基于物理的方法依据物理定律计算,准确性与可靠性较高,但对算力需求大; 以 QSAR 为代表的经验方法则依赖数据驱动, 但其输入多为人工构建的分子指纹或描述符,需要较多专家知识且可能引入主观偏差, 定长向量也限制了对不同复杂度分子的表达。 近年来图神经网络快速发展,在保持较高精度的同时算力需求更低, 已广泛应用于分子性质预测。
然而,多数研究致力于提升预测精度,忽略了模型的可解释性。 本项目的研究问题由此而来:如何在保证预测精度的前提下提升模型的可解释性,打开深度学习模型的"黑箱"。
我的贡献
- 从相关研究中收集分子 pKa 数据,划分为酸性与碱性两个数据集,分别构建酸性和碱性 pKa 预测模型
- 设计分子图与分子指纹的多模态融合表征:以 AttentiveFP 从分子图中学习原子连接关系,以全连接层提取指纹中分子图不包含的结构信息,拼接后联合预测
- 构建大规模预测数据预训练与实验数据微调的迁移学习策略,提升模型泛化性能
- 依次完成外部验证、Y 随机化检验与应用域分析,系统评估模型的可靠性、鲁棒性与适用范围
- 引入积分梯度法进行可解释性分析,可视化原子及官能团对预测值的贡献方向与大小
方法与数据
数据。 预训练数据共 1,268,985 条(酸性 712,352 条、碱性 556,633 条,来自 ChEMBL), 微调数据为 5,742 条实验值(酸性 2,750 条、碱性 2,992 条,来自 DataWarrior), 均按 8 : 1 : 1 划分为训练、验证与测试集。 酸性与碱性微调数据集分别包含 552 和 607 个独特骨架,其中仅来自 1—2 个分子的骨架分别占 76.99% 和 78.91%; 骨架云图与相似性热图显示两数据集平均相似度仅 0.112 和 0.099,表明数据多样性较高。 对预训练与微调数据在分子量(MW)、logP、拓扑极性表面积(TPSA)、氢键受体数(HBA)、 氢键供体数(HBD)和 pKa 六个维度的比较表明,预训练数据能够覆盖微调数据的多数特征分布, 有利于模型学习更广的化学空间;t-SNE 降维可视化进一步验证了数据集划分的合理性。
模型。 分子图经 AttentiveFP 提取连接关系特征, 分子指纹为 MACCS(166 位)、ErG 药效团指纹(315 位)与 PubChem 指纹(881 位)构成的混合指纹, 经全连接层提取补充结构特征, 二者拼接后分别输出酸性和碱性 pKa 预测; 整体训练采用预训练—微调两阶段迁移学习策略, 完成后依次进行外部验证、Y 随机化检验、应用域分析与可解释性分析。
关键结果
- 内部测试集上酸性与碱性模型的 MAE 分别为 0.621 和 0.402,全面优于仅用 AttentiveFP 的基线模型(0.850 和 0.727),证明融合分子指纹能够提升模型性能
- 四个外部验证集上 R2 分别达到 0.876、0.876、0.882 和 0.841(SAMPL6 上 MAE 为 0.708),与同类模型相比具有较强竞争力
- Y 随机化检验(25 次重复)中随机模型性能显著减弱,酸性与碱性模型的 cR2p 分别为 0.892 和 0.970,证明模型性能并非来自数据偶然性
- 应用域分析界定了模型可信预测的分子范围,在精度与覆盖率的平衡下,酸性与碱性模型分别维持 77.8% 和 78.0% 的覆盖率
可解释性示意
可解释性分析从两个角度展开:一是关键原子的捕捉——对 3-氨基-2-氟丁酸、 4-氨基-2-氟-5-甲基苯甲酸等分子的分析显示,模型能够定位决定 pKa 的关键原子; 二是微小变化的检测——对丁酸与 2-/3-/4-氟丁酸、丙-1-胺与不同位置氟代丙胺系列的比较显示, 模型能识别取代位置变化并给出一致的原子贡献解释。 与传统权重可视化方法相比,积分梯度能够进一步区分各原子或基团对 pKa 的影响方向(升高或降低)。
当前状态
研究论文已发表于 Journal of Pharmaceutical Analysis(第一作者,DOI:10.1016/j.jpha.2024.101174), 相关软件已获得软件著作权登记(GraFpKa V1.0)。