返回科研项目
RESEARCH · 03

毒性报告撰写多智能体系统

AutoToxReporter
稿件在审 · J. Cheminformatics 2025 — PRESENT

研究背景

化学品毒性证据分散在预测平台、毒理数据库与文献中,且实验记录、模型预测和机制关联的证据含义并不相同。报告撰写不仅需要检索信息,还需要围绕特定毒性终点组织结构、解释证据,并保持陈述与来源之间的可追溯关系。

AutoToxReporter 将这项工作拆分为大纲规划、证据检索、报告撰写、反思修订与可选检查,探索多智能体能否辅助形成便于专家复核的毒理学报告,而非替代专家作出毒性或风险判定。

研究问题

  • 如何统一接入异构毒性证据,同时保留实验、预测与机制关联各自的来源和上下文?
  • 多模型大纲整合、单次与分步生成、反思轮数和检查模块,分别如何影响报告质量与耗时?
  • 如何同时评价报告的结构质量、评委间一致性,以及引文是否真正支持对应陈述?

我的贡献

  • 提出研究方案并开发 AutoToxReporter,设计 Generator、Integrator、Composer、Reflector 与 Inspector 的角色分工、提示词及协作流程。
  • 封装 QSAR Toolbox、admetSAR 3.0、CTD 和 PubMed 工具,处理异构返回结果,保留证据类型、关键字段和来源信息。
  • 实现单次与分步写作、可配置反思、报告编辑工具,以及结构化引文占位符解析、去重编号和参考来源整理。
  • 开发 Vue + FastAPI 本地 Web 应用,串联化学品确认、大纲编辑、报告生成、来源审阅与导出。
  • 设计并执行对比实验、多评委评分与抽样人工引文核查,完成数据分析、图表制作和第一作者稿件撰写。

系统架构与工作流程

输入包括化学品 CAS / 名称 / SMILES、毒性终点、报告语言与生成参数。多个 Generator 独立生成候选大纲,由 Integrator 去重、补缺并统一结构;用户也可以直接提供或编辑大纲。

AutoToxReporter · 系统架构MULTI-AGENT WORKFLOW
AutoToxReporter 多智能体架构 输入化学品、毒性终点和语言,多模型生成大纲后由 Integrator 整合,也可提供自定义大纲。Composer 撰写,Reflector 按设置反思修订,Inspector 可选检查,输出带来源的报告。规划与生成阶段调用证据及编辑工具。研究评估比较量规评分、多评委一致性、基线和引文支持情况。 01 / 输入与设置 02 / 大纲规划 03 / 报告生成 04 / 研究评估 化学品标识 CAS / 名称 / SMILES 毒性终点 · 报告语言 自定义大纲(可选) 生成参数 单次 / 分步生成 反思轮数 · M Inspector 开 / 关 Generator 1 Generator 2 Generator N Integrator 可编辑的最终大纲 多模型独立提纲 去重 · 补缺 · 统一结构 Composer 初稿 · Draft Reflector 修订稿 · Draft Inspector(可选) 最终报告 + 引文 反思修订 × M 量规评分 · 五个维度 多评委一致性 基线方法比较 人工引文支持核查 比较设置 生成模式 / 反思轮数 Inspector / 报告语言 离线研究评估,非必经步骤 共享工具 / Function Calling 报告编辑 检索 / 插入 / 替换 / 删除 QSAR Toolbox 性质 / 结构警示 / 实验 admetSAR 3.0 ADMET 性质预测 CTD 基因 / 疾病 / 通路 PubMed 文献摘要与来源
依据研究架构图重绘。多模型大纲规划与报告生成共享工具层;自定义大纲可绕过自动规划。反思轮数与 Inspector 均可配置,最终报告支持来源追溯。右侧为研究中的评估设计,不表示每次生成都执行完整评估。

Composer 按大纲调用工具检索并撰写报告;Reflector 检查逻辑、证据解释与遗漏,Inspector 按需检查证据使用、引文格式和大纲覆盖。报告以 Markdown 输出,Web 界面提供正文与来源信息的并列审阅。

Multi-AgentLangChainFunction CallingVue / FastAPISource Attribution

多源证据与可追溯性

  • QSAR Toolbox:检索化学品、结构警示、实验记录与 QSAR 预测,保留实验可靠性、关键研究信息及预测应用域状态。
  • admetSAR 3.0:获取 ADMET 预测值与终点解释,辅助模型理解参数含义,避免将预测直接当作实验事实。
  • CTD:整理化学品—基因相互作用、富集通路与疾病关联;按来源支持或统计指标筛选,并排除仅表示治疗作用的疾病记录。
  • PubMed:检索文献元数据与摘要,只将有摘要的记录作为证据,保留可追溯的文献来源。

提示词约束模型在引用工具结果时写入结构化来源占位符;缺失字段标记为 N/A,不要求模型补全。后处理再解析、去重并按首次出现顺序编号,生成正文引文与 References。来源链接让核查成为可能,但并不自动保证陈述被证据充分支持。

实验设计与评价

204
大纲:17 个终点 × 2 种语言
×(5 个 Generator + 1 个 Integrator)
96
报告实验配置:8 个任务组合
× 2 种模式 × 3 种反思 × 2 种检查
289
人工核查的引文实例
来自随机抽取的 10 份完整报告

比较单次 / 分步生成、0–2 轮反思与 Inspector 开关,同时记录耗时。96 份报告中,2 份单次生成结果不完整,被排除出要求完整报告的质量评价。

基于 G-EVAL 思路建立分维度量规,分别评价报告的完整性、连贯性、终点针对性、深度与格式。三个主要评委独立评分,以 Spearman 相关为主、Pearson 为辅助检查一致性;额外模型的跨家族评估单独作为敏感性分析,不与主评委结果混合。

另外设置 O-QT Assistant 基线比较,并人工核查引文是否与来源冲突、超出证据范围或误用数据字段。自动评分用于比较质量趋势,人工核查聚焦来源支持,两者不能互相替代。

主要发现与方法边界

  • 大纲整合改善组织结构:Integrator 在证据覆盖与章节顺序上的评分最高,三个主要评委均认可其相对优势。
  • 生成策略存在权衡:英文单次生成在连贯性与格式上更好,分步生成在针对性与深度上更好;所测试中文报告更适合分步策略。分步生成也缓解了长报告输出长度限制。
  • 更多修订不等于更高质量:增加反思轮数未带来稳定收益;Inspector 略有改善连贯性,但可能减少内容覆盖,需要按任务选择。
  • 抽样引文支持率为 94.1%:289 处引文中 272 处支持对应陈述、17 处支持不足。问题在实验记录和文献证据中更突出,涉及证据范围与上下文解释。

94.1% 仅描述这 10 份报告的引文支持情况,不代表全文事实准确率,也不能外推为所有化学品的可靠性。研究的任务覆盖与人工抽样有限,LLM 评委存在宽严差异;生成报告仍需专家核实物种、剂量、暴露条件与证据适用范围。基线的任务设置与有效样本也存在差异,不据此宣称系统全面优于其他方法。

当前状态

第一作者研究稿件正在 Journal of Cheminformatics 审稿中。已完成系统开发、对比实验与本地 Web 应用;完整稿件暂不公开提供下载。后续仍需扩大任务覆盖,并通过更系统的专家评价验证实际使用价值。

关联链接