1. 行业常见问题
| 现象 | 风险 |
|---|---|
| 报告流畅但引用造假 | 科研/合规不可接受 |
| 多源证据(文献+计算+方法库)混在一起 | 读者无法追溯 |
| 推荐列表无排序依据 | 无法复现决策 |
| 「定稿」无审批 | 错误结论流出 |
2. 该技术如何解决
- Grounded Generation:生成前强制注入证据块;生成后校验引用 id
- Citation Packing:每条结论绑定
[n]或结构化 ref - 结构化推荐表:JSON/Markdown 表格 + 分源引用(文献 vs 方法 vs 计算输出)
- HITL 定稿:无引用或缺关键字段则不可 approve
段末注释:Grounded Generation 指生成内容必须可追溯到给定上下文证据,而非模型自由发挥。
3. 核心原理
3.1 报告输入分层
1 | 事实层:intake、转录本、job 结果路径(artifact) |
3.2 Prompt 约束(生成层)
- 每个段落至少一条
[n]引用 - 推荐表每行
refs非空,区分 literature / method / computation - 末尾声明:研究辅助,非临床/监管决策
4. 典型实现与代码示例
报告合成两层:模板合并 artifact(agent/reporter/artifacts.py)+ LangChain 轻量合成(LangGraph reporter 节点)。
4.1 结构化报告:artifact 合并
1 | # agent/reporter/artifacts.py — 读取落盘 JSON 的关键字段 |
各 Specialist 摘要来自 LangGraph 节点 state;artifact 路径由 uni/artifact_store 统一管理。
4.2 LangChain 合成节点
1 | # agent/orchestrator/graph.py |
Reporter Skill(skills/reporter/report_template.md)约束引用格式;HITL 定稿前须校验 [n] 或分源 ref 非空。
4.3 工程验收
1 | # 全链路生成 report artifact |
5. 替代方案与优缺点
| 方案 | 优点 | 缺点 |
|---|---|---|
| 模板 + LLM 填槽 | 结构稳 | 灵活性中 |
| 纯 LLM 自由撰写 | 文笔好 | 引用不可靠 |
| 先抽取事实 JSON 再渲染 | 可审计 | 两步成本 |
| RAG + 强制 JSON refs | 机器可验 | prompt 工程 |
| 人工只改 Markdown | 简单 | 难规模化 |
6. 自检题
- 文献引用与计算输出引用在报告中应如何区分呈现?
- 为何「无引用定稿」必须被系统拒绝?
- Grounded Generation 与 Hybrid RAG 的关系是什么?
7. 延伸阅读
- Gao et al., Enabling Large Language Models to Generate Text with Citations
- 返回索引:Agent-10-00 知识点系列索引