二元混合物毒性预测
研究背景
环境与食品体系中,抗生素与农用杀菌剂往往共同残留,单一化合物的风险评价难以覆盖混合暴露场景。 二元混合物可能产生协同、加和或拮抗效应,而实验穷举全部化合物组合与配比的成本很高。 浓度加和(CA)与独立作用(IA)模型提供了经典的零相互作用参考, 但其预测依赖作用模式假设,难以直接利用分子结构信息。
本项目探索另一条路径:以两个组分的分子结构和混合比例为输入,用机器学习直接预测混合物毒性, 再与 CA、IA 参考模型比较、判定相互作用类型,为混合物风险筛选提供计算工具。
研究问题
- 能否仅根据两个组分的分子结构及混合比例,预测二元混合物的 pEC50?
- 预训练分子表征 Uni-Mol 与 MACCS、Morgan 等传统指纹相比,能否为当前数据提供更有效的结构信息?
- 在小样本回归任务中,哪类算法(RF、SVR、XGBoost、LightGBM、MLP、线性回归)更为合适?
- 机器学习预测结合 CA、IA 参考模型,能否判断混合物的协同或拮抗相互作用?
- 模型在随机划分、留一交叉验证、应用域和 Y 随机化检验下是否稳健?
我的贡献
- 整理公开文献中的抗生素—三唑类杀菌剂混合毒性数据(6 种化合物、15 种二元组合、每种 5 个配比,共 75 条记录),并同批整理另外 5 个文献数据集用于流程验证
- 实现 Uni-Mol 预训练表征与 MACCS、Morgan、组合指纹等多套表征方案,按摩尔分数加权构建混合物特征
- 系统比较 4 种表征 × 6 类回归算法共 24 组组合,经 Optuna 超参数搜索确定最终 Uni-Mol–LightGBM 模型
- 对接 R mixtox 计算 CA、IA 参考毒性,通过相对模型偏差比(rMDR)实现协同/拮抗二分类
- 完成留一交叉验证、Williams plot 应用域分析与 Y 随机化检验,并绘制基于组成比例的 CA/IA 偏离曲面
方法与数据
数据来源。 核心数据来自 Qin 等发表于 Environmental Pollution(2024, 360: 124565)的实验研究: 以绿色微藻 Auxenochlorella pyrenoidosa 96 h 生长抑制为毒性终点, 覆盖 3 种抗生素(多西环素、红霉素、土霉素)与 3 种三唑类杀菌剂(腈菌唑、丙环唑、戊唑醇) 构成的全部 15 种二元组合,等效射线设计下每个组合 5 个混合比例, 毒性以 pEC50(= −log10 EC50,mol/L)表示。 按原始文献标记划分训练集 54 条、测试集 21 条。选择该数据集的依据是其与研究主题最吻合, 且同时提供单体浓度—效应曲线、混合物 pEC50 与相互作用标签,能够贯通全部流程。
表征与建模。 单体表征比较预训练 Uni-Mol v1 的 512 维 CLS 表征与 MACCS(166 位)、Morgan(1024 位)等传统指纹; 混合物表征取两组分表征的摩尔分数加权和 zmix = p1z1 + p2z2。 回归层比较随机森林、支持向量回归、XGBoost、LightGBM、多层感知机与线性回归, 最终选定经 Optuna 优化的 Uni-Mol–LightGBM 模型。
关键结果
- 最终 Uni-Mol–LightGBM 模型在固定测试集上 R2 = 0.9323、MAE = 0.1025、RMSE = 0.1276,Pearson r = 0.9732,CCC = 0.9608;训练集留一交叉验证 Q2LOO = 0.8888
- 机器学习回归明显优于经典参考模型的同任务表现(CA、IA 直接预测 pEC50 的测试集 R2 分别为 0.7317 和 0.7750)
- 基于 CA 和 IA 的 rMDR 相互作用分类在测试集上均正确判断 19/21 个样本,Accuracy 均为 0.905,MCC 分别为 0.806 和 0.826,优于原文献 KKNN 分类器(16/21),与原文献最佳 RF 分类器持平
- Y 随机化检验中随机模型测试 R2 为负值(约 −0.42)、平均随机相关系数接近 0,cR2p ≈ 0.947,说明原模型性能并非来自标签偶然相关
- 应用域分析(Williams plot)与基于组成比例的 CA/IA 偏离曲面为模型应用范围与相互作用趋势提供了补充诊断
探索路线
除主线外,项目还探索了「t-SNE 降维 + K-means 聚类、分簇建模再合并预测」的路线: 轮廓系数在 3 簇时最高(0.7227),但小样本进一步切分后簇内数据更少、过拟合风险上升, 合并预测也未形成可靠的增益证据,因此聚类路线作为独立于主模型的补充分析保留。
局限与下一步
本项目是一个完整的科研项目:基于公开实验数据,构建从结构表征、混合物回归到相互作用判定的计算工作流, 并对模型的适用范围做出明确界定——
- 训练集与测试集共享全部 6 种化合物和 15 种二元组合,测试结果反映的是已知化学空间内不同配比的预测能力,不能等同于对新化合物、新组合或独立实验的外部验证
- 超参数搜索阶段固定测试集曾参与最终模型筛选,测试指标宜表述为「固定留出集上的内部评估结果」,存在偏乐观风险
- 54 条训练记录对应 512 维表征,样本量小而特征维度高,且同一组合的多个比例点相关,记录级指标可能高估有效样本量
- 线性加权混合物表示未显式引入分子间交互项;相互作用输出为 SYN/ANT 二分类,未建模独立的加和(ADD)类别
后续工作将以分组交叉验证(leave-one-pair-out、leave-one-compound-out)和独立外部数据为核心, 而不是继续提升同一测试集上的分数。