返回科研项目
RESEARCH · 04

条件级亚硝胺致突变性预测

Nitrosamine Ames
进行中 · 数据集已完成 2026 — PRESENT

研究背景

亚硝胺是一类具有 N–N=O 官能团的化合物,作为合成工艺副产物或降解产物在药品中广泛存在。 2018 年以来,缬沙坦、雷尼替丁等药品中相继检出 N-亚硝基二甲胺(NDMA)等小分子亚硝胺, 引发全球多轮药品召回;监管关注随之扩展至药物活性物质相关亚硝胺(NDSRI)—— 由药物结构中的胺基在工艺过程中亚硝化生成、普遍缺乏毒理数据的一类杂质。

亚硝胺多为前致突变剂,需经细胞色素 P450 酶(CYP2E1、CYP2C19、CYP2B6、CYP2A6、CYP3A4 等亚型) 的 α-位羟基化代谢活化后,方能与 DNA 烷基化而表现出致突变性—— 这种代谢依赖性正是 Ames 试验中 S9 组分(大鼠 / 仓鼠肝微粒体)与测试菌株共同决定实验结果的原因。 监管层面,ICH M7 及欧美指南引入了致癌效力分类方法(CPCA): 依据 α-碳取代特征将亚硝胺划分为 5 个效力类别、对应递增的可接受摄入量(18–1500 ng/day), 并通过整合定量构效预测、CYP 结合分析与 TD50 数据的决策树辅助归类。

亚硝胺的基因毒性评估以细菌回复突变试验(Ames 试验)为金标准, 监管机构并推荐采用更灵敏的增强型 Ames 试验(EAT,30 分钟预孵育法)—— 但完整试验周期长、成本高,难以覆盖数量庞大的 NDSRI 候选空间。 现有计算工具各有局限:面向 NDSRI 的专有 QSAR 模型受制于极小的公开训练集 (约 46 个分子、其中阴性样本仅 5 个);基于专家经验的规则模型与商业模型的应用域和透明度有限, 在亚硝胺化学空间内的独立验证亦不充分;通用 Ames 预测模型则未针对亚硝胺的代谢活化机制与实验条件差异建模。

本项目目标:构建一个高质量、可溯源的亚硝胺 Ames 条件级数据集, 并在此基础上开发兼顾分子结构与实验条件(菌株 × S9)的致突变性预测模型, 为亚硝胺杂质的风险优先级排序提供计算支持。

研究问题

  • 如何从分散的文献中,构建每条记录均可溯源至原始文献的亚硝胺 Ames 条件级数据集?
  • 以「分子结构 + 菌株 + S9 条件」为输入的条件级建模,能否优于「任一阳性即阳性」的化合物级聚合建模?
  • 面向亚硝胺代谢活化机制的自研特征(α-碳羟基化反应性、位阻掩蔽程度、亚硝基电荷分布等),能否在分子指纹与描述符之外提供额外判别信息?
  • 在小样本、类别不平衡的条件下,如何通过防泄漏的分组交叉验证与稳健评估纪律可靠地比较模型?

我的贡献

  • 以 "nitrosamine + Ames / mutagenicity / Salmonella" 等关键词组合系统检索 PubMed、ScienceDirect 等数据库,覆盖亚硝胺 Ames 试验的同行评议文献(含正文表格与补充材料)
  • 建立逐篇文献提取规程:为每篇文献建立独立的提取规则档案,确保每条数据均可溯源至原始文献的具体表格
  • 设计 15 字段的条件级记录结构,完整保留菌株、S9 条件、试验方法、溶剂、诱导剂等实验上下文
  • 制定阴阳性判定与质量控制规则,逐文献核对判定阈值,四类排除均有记录可查
  • 实现 RDKit 分子标准化管线与去重聚合策略,完成防数据泄漏设计,形成最终训练数据集
  • 搭建条件级建模框架并开展特征、算法与评估研究(进行中),全流程脚本化并输出两份数据处理流程文档

数据集构建

数据来源与提取。 系统检索覆盖亚硝胺 Ames 试验的同行评议文献(含正文表格与补充材料), 对每篇文献建立独立的提取规则档案:数据定位(正文表 / 补充材料表)、字段提取路径、 该文献实际采用的阴阳性判定阈值、以及特例处理记录(重复试验冲突、疑似笔误的保守处理等)。 相比常见 Ames 数据集仅记录化合物级结论,本数据集保留了完整的实验条件上下文 (菌株 × S9 × 方法 × 溶剂 × 诱导剂):

  • 化合物标识:CAS 号、SMILES、化学名称
  • 测试菌株(8 种):TA98、TA100、TA1535、TA1537、TA97a、TA102、WP2 uvrA、WP2 uvrA pKM101
  • 代谢活化条件(5 种):S9 物种(大鼠 / 仓鼠)× S9 浓度(10% / 30%),及无 S9 对照
  • 实验方法:预孵育法(30 / 60 min)与平板掺入法;溶剂(丙酮、DMSO、水、甲醇、乙醇等 9 种);S9 诱导剂(PB/BNF、Aroclor 1254、Aroclor 等 4 类)
  • 判定依据(各文献实际采用的阈值,如实记录)、阴阳性标签、DOI / URL 溯源信息

判定与质控。 按行业惯例逐文献核对判定标准:TA100、TA98、WP2 uvrA pKM101 的回复菌落数 ≥ 溶剂对照 2 倍,TA1535、TA1537 ≥ 溶剂对照 3 倍, 阳性判定同时要求剂量–响应上升趋势;个别文献的特殊阈值(如 TA102 的 1.5 倍)如实记录。 四类数据被排除:细胞毒性浓度下无法判读的数据、同一条件下重复试验结果矛盾的记录、 缺少 CAS 号无法唯一标识的化合物、疑似笔误的存疑数据(按保守原则整组剔除)—— 每条排除均有记录可查

条件级数据集 · 构建流程 NITROSAMINE AMES DATASET
从文献检索到条件级训练数据集 四阶段流程:检索与提取得到 3,893 条条件级原始记录;质量控制逐文献核对 2 倍与 3 倍溶剂对照阈值并执行四类排除;RDKit 标准化后按化合物、菌株、S9 条件去重聚合,任一阳性即记阳性,矛盾标签整组剔除 34 组;最终得到 101 个化合物、1,550 条条件级记录,阳性 446 条占 28.8%,覆盖 8 菌株与 5 种 S9 条件。底部横条为贯穿全程的逐条溯源、防数据泄漏与可复现设计。 01 · 检索与提取 02 · 质量控制 03 · 标准化与整合 04 · 训练数据集 系统文献检索 PubMed · ScienceDirect 等 全文与补充材料 正文表格 · 补充材料表 逐篇提取 · 15 字段 每篇文献独立规则档案 输出 3,893 条条件级原始记录 阴阳性判定核对 ≥ 2× / 3× 溶剂对照 + 趋势 特殊阈值如实记录 如 TA102 的 1.5 倍 四类排除规则 毒性 · 矛盾 · 缺 CAS · 存疑 全程留痕 每条排除均有记录可查 分子标准化 · RDKit 去盐 · 最大片段 · ≤ 1000 Da 去重与聚合 任一阳性即记阳性 矛盾标签处理 整组剔除 34 组 全流程脚本化 Python / RDKit 101 化合物 · 标准化 SMILES 唯一 1,550 条件级记录 446(28.8%) 阳性记录 8 菌株 × 5 种 S9 条件 平均每化合物约 15 条 逐条溯源 每条记录保留 DOI / URL 防数据泄漏 背景集(6,924 分子)剔除 41 个重叠分子 流程文档 × 2 详细版 / 简洁版 · 可复现可审计
依据项目数据处理流程绘制。逐篇提取的 3,893 条条件级原始记录,经判定阈值核对与四类排除、RDKit 分子标准化、按「化合物 × 菌株 × S9 条件」去重聚合后,形成 101 个化合物、1,550 条条件级训练记录;结论同向的记录合并时任一阳性即记阳性,标签矛盾者整组剔除。底部横条为贯穿全程的溯源、防泄漏与可复现设计。

标准化与整合。 SMILES 经 RDKit 管线标准化:解析 → 去盐 / 去混合物(保留最大有机片段)→ 去无机物 → 标准化 SMILES → 分子量筛选(≤ 1000 Da)。 同一(化合物 × 菌株 × S9 条件)下的多条记录,实验配置不同但结论同向的合并为一条 (任一阳性即记阳性,保留最保守的毒性结论),标签直接矛盾的整组剔除(34 组), 避免噪声标签进入训练集。 为迁移学习探索构建的通用分子背景数据集(6,924 个 Ames 阴阳性分子) 剔除了与亚硝胺集重叠的 41 个分子,确保化合物级信息隔离。

101
化合物
标准化 SMILES 唯一
1,550
条件级记录
8 菌株 × 5 种 S9 条件
446 · 28.8%
阳性记录
平均每化合物约 15 条
3,893
条件级原始记录
清洗与整合前规模

全流程以 Python / RDKit 脚本化,输出详细版与简洁版两份数据处理流程文档,保证可复现、可审计; 另建设 15.7 万条 × 87 字段的 Ames 原始记录储备库(多来源汇总、未清洗),作为后续数据扩展的候选池。

建模探索(进行中)

任务形式。 条件级预测:P(Ames 阳性 | 分子结构, 菌株, S9 条件)。 初步对比显示,条件级建模的表现显著优于「任一阳性即阳性」的化合物级聚合建模, 说明实验条件(菌株 × 代谢活化)携带关键判别信息。

特征体系。 框架已搭建并持续优化:Morgan 分子指纹、MACCS 结构键、RDKit 分子描述符, 以及自研的亚硝胺机制特征——α-碳羟基化反应性、位阻掩蔽程度、亚硝基电荷分布等。

算法与评估纪律。 以 Logistic 回归、随机森林、XGBoost、LightGBM 四类模型为基线; 采用按化合物分组的分层交叉验证防止同系物跨集泄漏, 以 MCC 为主指标开展多种子重复评估与嵌套阈值分析。

正在开展:特征与超参数优化、决策阈值策略、迁移学习与多任务学习等方法的系统性对照评估, 以及外部验证方案设计。模型性能指标以后续实际结果为准。

Dataset Curation Condition-Level Modeling Mechanistic Features QSAR Grouped CV MCC

当前状态与下一步

数据集建设阶段已完成:101 个化合物、1,550 条条件级记录,全流程可溯源、可复现。 建模阶段正在推进,重点方向为机制特征工程与模型稳健性评估; 后续将开展模型外部验证,并探索将预测模型应用于药物相关亚硝胺(NDSRI)的风险优先级排序。

关联链接