毒性报告撰写多智能体系统
研究背景
化学品毒性证据分散在预测平台、毒理数据库与文献中,且实验记录、模型预测和机制关联的证据含义并不相同。报告撰写不仅需要检索信息,还需要围绕特定毒性终点组织结构、解释证据,并保持陈述与来源之间的可追溯关系。
AutoToxReporter 将这项工作拆分为大纲规划、证据检索、报告撰写、反思修订与可选检查,探索多智能体能否辅助形成便于专家复核的毒理学报告,而非替代专家作出毒性或风险判定。
研究问题
- 如何统一接入异构毒性证据,同时保留实验、预测与机制关联各自的来源和上下文?
- 多模型大纲整合、单次与分步生成、反思轮数和检查模块,分别如何影响报告质量与耗时?
- 如何同时评价报告的结构质量、评委间一致性,以及引文是否真正支持对应陈述?
我的贡献
- 提出研究方案并开发 AutoToxReporter,设计 Generator、Integrator、Composer、Reflector 与 Inspector 的角色分工、提示词及协作流程。
- 封装 QSAR Toolbox、admetSAR 3.0、CTD 和 PubMed 工具,处理异构返回结果,保留证据类型、关键字段和来源信息。
- 实现单次与分步写作、可配置反思、报告编辑工具,以及结构化引文占位符解析、去重编号和参考来源整理。
- 开发 Vue + FastAPI 本地 Web 应用,串联化学品确认、大纲编辑、报告生成、来源审阅与导出。
- 设计并执行对比实验、多评委评分与抽样人工引文核查,完成数据分析、图表制作和第一作者稿件撰写。
系统架构与工作流程
输入包括化学品 CAS / 名称 / SMILES、毒性终点、报告语言与生成参数。多个 Generator 独立生成候选大纲,由 Integrator 去重、补缺并统一结构;用户也可以直接提供或编辑大纲。
Composer 按大纲调用工具检索并撰写报告;Reflector 检查逻辑、证据解释与遗漏,Inspector 按需检查证据使用、引文格式和大纲覆盖。报告以 Markdown 输出,Web 界面提供正文与来源信息的并列审阅。
多源证据与可追溯性
- QSAR Toolbox:检索化学品、结构警示、实验记录与 QSAR 预测,保留实验可靠性、关键研究信息及预测应用域状态。
- admetSAR 3.0:获取 ADMET 预测值与终点解释,辅助模型理解参数含义,避免将预测直接当作实验事实。
- CTD:整理化学品—基因相互作用、富集通路与疾病关联;按来源支持或统计指标筛选,并排除仅表示治疗作用的疾病记录。
- PubMed:检索文献元数据与摘要,只将有摘要的记录作为证据,保留可追溯的文献来源。
提示词约束模型在引用工具结果时写入结构化来源占位符;缺失字段标记为 N/A,不要求模型补全。后处理再解析、去重并按首次出现顺序编号,生成正文引文与 References。来源链接让核查成为可能,但并不自动保证陈述被证据充分支持。
实验设计与评价
- 204
- 大纲:17 个终点 × 2 种语言
×(5 个 Generator + 1 个 Integrator) - 96
- 报告实验配置:8 个任务组合
× 2 种模式 × 3 种反思 × 2 种检查 - 289
- 人工核查的引文实例
来自随机抽取的 10 份完整报告
比较单次 / 分步生成、0–2 轮反思与 Inspector 开关,同时记录耗时。96 份报告中,2 份单次生成结果不完整,被排除出要求完整报告的质量评价。
基于 G-EVAL 思路建立分维度量规,分别评价报告的完整性、连贯性、终点针对性、深度与格式。三个主要评委独立评分,以 Spearman 相关为主、Pearson 为辅助检查一致性;额外模型的跨家族评估单独作为敏感性分析,不与主评委结果混合。
另外设置 O-QT Assistant 基线比较,并人工核查引文是否与来源冲突、超出证据范围或误用数据字段。自动评分用于比较质量趋势,人工核查聚焦来源支持,两者不能互相替代。
主要发现与方法边界
- 大纲整合改善组织结构:Integrator 在证据覆盖与章节顺序上的评分最高,三个主要评委均认可其相对优势。
- 生成策略存在权衡:英文单次生成在连贯性与格式上更好,分步生成在针对性与深度上更好;所测试中文报告更适合分步策略。分步生成也缓解了长报告输出长度限制。
- 更多修订不等于更高质量:增加反思轮数未带来稳定收益;Inspector 略有改善连贯性,但可能减少内容覆盖,需要按任务选择。
- 抽样引文支持率为 94.1%:289 处引文中 272 处支持对应陈述、17 处支持不足。问题在实验记录和文献证据中更突出,涉及证据范围与上下文解释。
94.1% 仅描述这 10 份报告的引文支持情况,不代表全文事实准确率,也不能外推为所有化学品的可靠性。研究的任务覆盖与人工抽样有限,LLM 评委存在宽严差异;生成报告仍需专家核实物种、剂量、暴露条件与证据适用范围。基线的任务设置与有效样本也存在差异,不据此宣称系统全面优于其他方法。
当前状态
第一作者研究稿件正在 Journal of Cheminformatics 审稿中。已完成系统开发、对比实验与本地 Web 应用;完整稿件暂不公开提供下载。后续仍需扩大任务覆盖,并通过更系统的专家评价验证实际使用价值。