背景与边界
生成编排负责把证据转化为回答,并通过策略保证稳定性与可追溯性。
要完成的工作
- 输入:证据包、用户问题、会话上下文。
- 处理:提示模板、结构化输出、Agent 调度、失败回退。
- 输出:可引用、可解释、可控风格答案。
实现目标
- 事实一致且引用完整。
- 复杂任务可步骤化完成。
- 成本与时延可控。
阶段指标
评测本阶段时冻结证据包(或冻结检索器输出),只改生成约束、Agent 循环与护栏。
段末注释:忠实度(Faithfulness) = 答案中的论断能被当前上下文支持的比例;答案相关性(Answer Relevancy) = 答的是不是所问,不管是否幻觉;引用覆盖率(Citation Recall) = 事实句挂了可回溯 span 的比例。
忠实度
- 含义:答案中的 claim 能否被当前上下文支持(幻觉率的操作化)。
- 计算:从答案抽 claim 集合 $C$,逐条判定是否被 retrieved context 蕴含,
$$
\mathrm{Faithfulness}=\frac{|{c_i:\mathrm{supported}(c_i,\mathrm{ctx})}|}{|C|}
$$ - 适配:Grounded Generation;方法/剂量/p 值等事实句。
- 不适配:需要语料外常识或计算工具才能答的题——低分可能是缺工具,不是生成失控。
答案相关性
- 含义:答的是不是所问,不管是否幻觉。
- 计算:常用问句与答案嵌入余弦,或 LLM-as-judge 打 0–1。
- 适配:跑题、拒答过度、Agent 绕远路。
- 不适配:单独当上线门禁——相关但胡编会漏。必须与 Faithfulness 联用。
引用覆盖率
- 含义:事实句是否都挂了可回溯 span。
- 计算:$\mathrm{CiteR}=|{c:\mathrm{has_citation}(c)}|/|C_{\mathrm{factual}}|$。
- 适配:论文解读、审计;与引用精确率成对看(覆盖高、精确低 = 乱挂引用)。
- 不适配:聊天式 FAQ、不展示引用。
任务成功率 / 违规拦截率
- 含义:Agent 是否在步数与预算内完成可核验任务;护栏是否拦下违规输出。
- 计算:成功次数 / 任务数;拦截次数 / 应拦样本数(漏拦单独报)。
- 适配:Agentic、Guardrails。
- 不适配:单次检索问答——用 Faithfulness + Relevancy。
主要难点
- 长上下文注意力稀释。
- Agent 链路不确定性与超时。
成熟解决方案
- Long-context + 证据标记。
- Agent 步数/预算/超时限制。
- Grounded Generation 约束生成。
- Guardrails 风险拦截与回退。
二级方法对比(含 100 篇生物学文献量级)
说明:本阶段成本主要在 推理侧(单次问答),与「100 篇文献」的关系体现为:针对该语料库的典型长上下文/多步任务的资源与耗时。假设使用 32k–128k 上下文窗口 的商用 API 或本地 24GB 级 GPU;生物问答常含 方法细节、统计与图表解读,token 消耗偏高。
| 二级方法 | 适用范围 | 特点 | 主流实现框架 | 100 篇文献·资源消耗(估算) | 100 篇文献·时间消耗(估算) |
|---|---|---|---|---|---|
| Long-context RAG | 小中库、愿付 token 换简化链路 | 少检索、多原文拼接,注意力稀释风险 | Qwen-long / Claude / 本地 vLLM 长窗口 | 长上下文模型 显存 20–40 GB 或 API $/百万 token 为主 | 单次深度综述式问答:约 15–90 s(视总 token);100 篇不是一次吃完,通常按 批次文档 多次调用 |
| Agentic RAG | 多步检索、计算与比对 | 工具循环 + 预算/步数限制 | LangGraph(默认可控);LlamaIndex Agent | 多轮 LLM + 工具调用,GPU 16–48 GB 或 API 累加 | 单次复杂任务:30 s–数 min;100 篇语料上跑 批处理评测 可达 数 GPU·h |
| Grounded Generation | 强事实绑定、降幻觉 | 生成后 NLI/支撑度 过滤或重写 | RAGAS Faithfulness + 生成后 NLI;TruLens groundedness | 附加 NLI GPU 4–8 GB | 每问:+0.5–3 s |
| Guardrails | 合规、医疗/生物安全提示 | 输入/输出策略与拦截 | NeMo Guardrails / Guardrails AI | 规则引擎 + 小分类器,增量极小 | 每问:+5–80 ms(复杂策略则更高) |