条件级亚硝胺致突变性预测
研究背景
亚硝胺是一类具有 N–N=O 官能团的化合物,作为合成工艺副产物或降解产物在药品中广泛存在。 2018 年以来,缬沙坦、雷尼替丁等药品中相继检出 N-亚硝基二甲胺(NDMA)等小分子亚硝胺, 引发全球多轮药品召回;监管关注随之扩展至药物活性物质相关亚硝胺(NDSRI)—— 由药物结构中的胺基在工艺过程中亚硝化生成、普遍缺乏毒理数据的一类杂质。
亚硝胺多为前致突变剂,需经细胞色素 P450 酶(CYP2E1、CYP2C19、CYP2B6、CYP2A6、CYP3A4 等亚型) 的 α-位羟基化代谢活化后,方能与 DNA 烷基化而表现出致突变性—— 这种代谢依赖性正是 Ames 试验中 S9 组分(大鼠 / 仓鼠肝微粒体)与测试菌株共同决定实验结果的原因。 监管层面,ICH M7 及欧美指南引入了致癌效力分类方法(CPCA): 依据 α-碳取代特征将亚硝胺划分为 5 个效力类别、对应递增的可接受摄入量(18–1500 ng/day), 并通过整合定量构效预测、CYP 结合分析与 TD50 数据的决策树辅助归类。
亚硝胺的基因毒性评估以细菌回复突变试验(Ames 试验)为金标准, 监管机构并推荐采用更灵敏的增强型 Ames 试验(EAT,30 分钟预孵育法)—— 但完整试验周期长、成本高,难以覆盖数量庞大的 NDSRI 候选空间。 现有计算工具各有局限:面向 NDSRI 的专有 QSAR 模型受制于极小的公开训练集 (约 46 个分子、其中阴性样本仅 5 个);基于专家经验的规则模型与商业模型的应用域和透明度有限, 在亚硝胺化学空间内的独立验证亦不充分;通用 Ames 预测模型则未针对亚硝胺的代谢活化机制与实验条件差异建模。
本项目目标:构建一个高质量、可溯源的亚硝胺 Ames 条件级数据集, 并在此基础上开发兼顾分子结构与实验条件(菌株 × S9)的致突变性预测模型, 为亚硝胺杂质的风险优先级排序提供计算支持。
研究问题
- 如何从分散的文献中,构建每条记录均可溯源至原始文献的亚硝胺 Ames 条件级数据集?
- 以「分子结构 + 菌株 + S9 条件」为输入的条件级建模,能否优于「任一阳性即阳性」的化合物级聚合建模?
- 面向亚硝胺代谢活化机制的自研特征(α-碳羟基化反应性、位阻掩蔽程度、亚硝基电荷分布等),能否在分子指纹与描述符之外提供额外判别信息?
- 在小样本、类别不平衡的条件下,如何通过防泄漏的分组交叉验证与稳健评估纪律可靠地比较模型?
我的贡献
- 以 "nitrosamine + Ames / mutagenicity / Salmonella" 等关键词组合系统检索 PubMed、ScienceDirect 等数据库,覆盖亚硝胺 Ames 试验的同行评议文献(含正文表格与补充材料)
- 建立逐篇文献提取规程:为每篇文献建立独立的提取规则档案,确保每条数据均可溯源至原始文献的具体表格
- 设计 15 字段的条件级记录结构,完整保留菌株、S9 条件、试验方法、溶剂、诱导剂等实验上下文
- 制定阴阳性判定与质量控制规则,逐文献核对判定阈值,四类排除均有记录可查
- 实现 RDKit 分子标准化管线与去重聚合策略,完成防数据泄漏设计,形成最终训练数据集
- 搭建条件级建模框架并开展特征、算法与评估研究(进行中),全流程脚本化并输出两份数据处理流程文档
数据集构建
数据来源与提取。 系统检索覆盖亚硝胺 Ames 试验的同行评议文献(含正文表格与补充材料), 对每篇文献建立独立的提取规则档案:数据定位(正文表 / 补充材料表)、字段提取路径、 该文献实际采用的阴阳性判定阈值、以及特例处理记录(重复试验冲突、疑似笔误的保守处理等)。 相比常见 Ames 数据集仅记录化合物级结论,本数据集保留了完整的实验条件上下文 (菌株 × S9 × 方法 × 溶剂 × 诱导剂):
- 化合物标识:CAS 号、SMILES、化学名称
- 测试菌株(8 种):TA98、TA100、TA1535、TA1537、TA97a、TA102、WP2 uvrA、WP2 uvrA pKM101
- 代谢活化条件(5 种):S9 物种(大鼠 / 仓鼠)× S9 浓度(10% / 30%),及无 S9 对照
- 实验方法:预孵育法(30 / 60 min)与平板掺入法;溶剂(丙酮、DMSO、水、甲醇、乙醇等 9 种);S9 诱导剂(PB/BNF、Aroclor 1254、Aroclor 等 4 类)
- 判定依据(各文献实际采用的阈值,如实记录)、阴阳性标签、DOI / URL 溯源信息
判定与质控。 按行业惯例逐文献核对判定标准:TA100、TA98、WP2 uvrA pKM101 的回复菌落数 ≥ 溶剂对照 2 倍,TA1535、TA1537 ≥ 溶剂对照 3 倍, 阳性判定同时要求剂量–响应上升趋势;个别文献的特殊阈值(如 TA102 的 1.5 倍)如实记录。 四类数据被排除:细胞毒性浓度下无法判读的数据、同一条件下重复试验结果矛盾的记录、 缺少 CAS 号无法唯一标识的化合物、疑似笔误的存疑数据(按保守原则整组剔除)—— 每条排除均有记录可查。
标准化与整合。 SMILES 经 RDKit 管线标准化:解析 → 去盐 / 去混合物(保留最大有机片段)→ 去无机物 → 标准化 SMILES → 分子量筛选(≤ 1000 Da)。 同一(化合物 × 菌株 × S9 条件)下的多条记录,实验配置不同但结论同向的合并为一条 (任一阳性即记阳性,保留最保守的毒性结论),标签直接矛盾的整组剔除(34 组), 避免噪声标签进入训练集。 为迁移学习探索构建的通用分子背景数据集(6,924 个 Ames 阴阳性分子) 剔除了与亚硝胺集重叠的 41 个分子,确保化合物级信息隔离。
- 101
- 化合物
标准化 SMILES 唯一 - 1,550
- 条件级记录
8 菌株 × 5 种 S9 条件 - 446 · 28.8%
- 阳性记录
平均每化合物约 15 条 - 3,893
- 条件级原始记录
清洗与整合前规模
全流程以 Python / RDKit 脚本化,输出详细版与简洁版两份数据处理流程文档,保证可复现、可审计; 另建设 15.7 万条 × 87 字段的 Ames 原始记录储备库(多来源汇总、未清洗),作为后续数据扩展的候选池。
建模探索(进行中)
任务形式。 条件级预测:P(Ames 阳性 | 分子结构, 菌株, S9 条件)。 初步对比显示,条件级建模的表现显著优于「任一阳性即阳性」的化合物级聚合建模, 说明实验条件(菌株 × 代谢活化)携带关键判别信息。
特征体系。 框架已搭建并持续优化:Morgan 分子指纹、MACCS 结构键、RDKit 分子描述符, 以及自研的亚硝胺机制特征——α-碳羟基化反应性、位阻掩蔽程度、亚硝基电荷分布等。
算法与评估纪律。 以 Logistic 回归、随机森林、XGBoost、LightGBM 四类模型为基线; 采用按化合物分组的分层交叉验证防止同系物跨集泄漏, 以 MCC 为主指标开展多种子重复评估与嵌套阈值分析。
正在开展:特征与超参数优化、决策阈值策略、迁移学习与多任务学习等方法的系统性对照评估, 以及外部验证方案设计。模型性能指标以后续实际结果为准。
当前状态与下一步
数据集建设阶段已完成:101 个化合物、1,550 条条件级记录,全流程可溯源、可复现。 建模阶段正在推进,重点方向为机制特征工程与模型稳健性评估; 后续将开展模型外部验证,并探索将预测模型应用于药物相关亚硝胺(NDSRI)的风险优先级排序。