返回科研项目
RESEARCH · 02

二元混合物毒性预测

Mixture Toxicity
已完成 2022 — 2025

研究背景

环境与食品体系中,抗生素与农用杀菌剂往往共同残留,单一化合物的风险评价难以覆盖混合暴露场景。 二元混合物可能产生协同、加和或拮抗效应,而实验穷举全部化合物组合与配比的成本很高。 浓度加和(CA)与独立作用(IA)模型提供了经典的零相互作用参考, 但其预测依赖作用模式假设,难以直接利用分子结构信息。

本项目探索另一条路径:以两个组分的分子结构和混合比例为输入,用机器学习直接预测混合物毒性, 再与 CA、IA 参考模型比较、判定相互作用类型,为混合物风险筛选提供计算工具。

研究问题

  • 能否仅根据两个组分的分子结构及混合比例,预测二元混合物的 pEC50
  • 预训练分子表征 Uni-Mol 与 MACCS、Morgan 等传统指纹相比,能否为当前数据提供更有效的结构信息?
  • 在小样本回归任务中,哪类算法(RF、SVR、XGBoost、LightGBM、MLP、线性回归)更为合适?
  • 机器学习预测结合 CA、IA 参考模型,能否判断混合物的协同或拮抗相互作用?
  • 模型在随机划分、留一交叉验证、应用域和 Y 随机化检验下是否稳健?

我的贡献

  • 整理公开文献中的抗生素—三唑类杀菌剂混合毒性数据(6 种化合物、15 种二元组合、每种 5 个配比,共 75 条记录),并同批整理另外 5 个文献数据集用于流程验证
  • 实现 Uni-Mol 预训练表征与 MACCS、Morgan、组合指纹等多套表征方案,按摩尔分数加权构建混合物特征
  • 系统比较 4 种表征 × 6 类回归算法共 24 组组合,经 Optuna 超参数搜索确定最终 Uni-Mol–LightGBM 模型
  • 对接 R mixtox 计算 CA、IA 参考毒性,通过相对模型偏差比(rMDR)实现协同/拮抗二分类
  • 完成留一交叉验证、Williams plot 应用域分析与 Y 随机化检验,并绘制基于组成比例的 CA/IA 偏离曲面

方法与数据

数据来源。 核心数据来自 Qin 等发表于 Environmental Pollution(2024, 360: 124565)的实验研究: 以绿色微藻 Auxenochlorella pyrenoidosa 96 h 生长抑制为毒性终点, 覆盖 3 种抗生素(多西环素、红霉素、土霉素)与 3 种三唑类杀菌剂(腈菌唑、丙环唑、戊唑醇) 构成的全部 15 种二元组合,等效射线设计下每个组合 5 个混合比例, 毒性以 pEC50(= −log10 EC50,mol/L)表示。 按原始文献标记划分训练集 54 条、测试集 21 条。选择该数据集的依据是其与研究主题最吻合, 且同时提供单体浓度—效应曲线、混合物 pEC50 与相互作用标签,能够贯通全部流程。

表征与建模。 单体表征比较预训练 Uni-Mol v1 的 512 维 CLS 表征与 MACCS(166 位)、Morgan(1024 位)等传统指纹; 混合物表征取两组分表征的摩尔分数加权和 zmix = p1z1 + p2z2。 回归层比较随机森林、支持向量回归、XGBoost、LightGBM、多层感知机与线性回归, 最终选定经 Optuna 优化的 Uni-Mol–LightGBM 模型。

二元混合物 · 建模架构 MIXTURE TOXICITY MODELING
从文献数据到二元混合物毒性预测 依据流程图 A、B、C 重绘。A:收集文献中的单体分子结构、摩尔分数和混合物实验毒性。B:两种单体的同类表征分别乘以摩尔分数 p1 和 p2 后逐元素相加,形成混合物描述符,p1 加 p2 等于 1。C:比较 Uni-Mol、MixedFP、Morgan、MACCS 四种表征与 RF、支持向量回归、XGBoost、LightGBM、MLP、线性回归六类算法的组合。突出显示 Uni-Mol 与 LightGBM 路线,输出混合物 pEC50 预测值。图中模型为候选比较,并非联合集成。 (A) 数据收集 (B) 描述符构建 (C) 模型构建 文献 组分 1 组分 2 p1 p2 分子结构 · 摩尔分数 混合物实验毒性 单体表征 z1 单体表征 z2 × p1 × p2 + 混合物描述符 zmix = p₁z₁ + p₂z₂ p₁ + p₂ = 1 混合物表征 Uni-MolMixedFPMorganMACCS RFSVM / SVRXGBoostLightGBMMLPLR 表征 × 算法:比较后选择模型 预测输出 pEC50 混合物 毒性预测 单体结构 + 混合比例 → 混合物表征 → 回归模型 → pEC₅₀
依据流程图 A—C 重绘。按相同表征的对应维度进行比例加权,比较不同表征与回归算法,蓝色强调 Uni-Mol + LightGBM 主线;候选模型不表示集成。输出为混合物 pEC₅₀,分子结构与向量长度仅作示意。
Uni-Mol LightGBM CA / IA rMDR Y-Randomization Williams Plot

关键结果

  • 最终 Uni-Mol–LightGBM 模型在固定测试集上 R2 = 0.9323、MAE = 0.1025、RMSE = 0.1276,Pearson r = 0.9732,CCC = 0.9608;训练集留一交叉验证 Q2LOO = 0.8888
  • 机器学习回归明显优于经典参考模型的同任务表现(CA、IA 直接预测 pEC50 的测试集 R2 分别为 0.7317 和 0.7750)
  • 基于 CA 和 IA 的 rMDR 相互作用分类在测试集上均正确判断 19/21 个样本,Accuracy 均为 0.905,MCC 分别为 0.806 和 0.826,优于原文献 KKNN 分类器(16/21),与原文献最佳 RF 分类器持平
  • Y 随机化检验中随机模型测试 R2 为负值(约 −0.42)、平均随机相关系数接近 0,cR2p ≈ 0.947,说明原模型性能并非来自标签偶然相关
  • 应用域分析(Williams plot)与基于组成比例的 CA/IA 偏离曲面为模型应用范围与相互作用趋势提供了补充诊断

探索路线

除主线外,项目还探索了「t-SNE 降维 + K-means 聚类、分簇建模再合并预测」的路线: 轮廓系数在 3 簇时最高(0.7227),但小样本进一步切分后簇内数据更少、过拟合风险上升, 合并预测也未形成可靠的增益证据,因此聚类路线作为独立于主模型的补充分析保留。

局限与下一步

本项目是一个完整的科研项目:基于公开实验数据,构建从结构表征、混合物回归到相互作用判定的计算工作流, 并对模型的适用范围做出明确界定——

  • 训练集与测试集共享全部 6 种化合物和 15 种二元组合,测试结果反映的是已知化学空间内不同配比的预测能力,不能等同于对新化合物、新组合或独立实验的外部验证
  • 超参数搜索阶段固定测试集曾参与最终模型筛选,测试指标宜表述为「固定留出集上的内部评估结果」,存在偏乐观风险
  • 54 条训练记录对应 512 维表征,样本量小而特征维度高,且同一组合的多个比例点相关,记录级指标可能高估有效样本量
  • 线性加权混合物表示未显式引入分子间交互项;相互作用输出为 SYN/ANT 二分类,未建模独立的加和(ADD)类别

后续工作将以分组交叉验证(leave-one-pair-out、leave-one-compound-out)和独立外部数据为核心, 而不是继续提升同一测试集上的分数。

关联链接