RAG:生成编排框架概述

背景与边界

生成编排负责把证据转化为回答,并通过策略保证稳定性与可追溯性。

要完成的工作

  • 输入:证据包、用户问题、会话上下文。
  • 处理:提示模板、结构化输出、Agent 调度、失败回退。
  • 输出:可引用、可解释、可控风格答案。

实现目标

  • 事实一致且引用完整。
  • 复杂任务可步骤化完成。
  • 成本与时延可控。

阶段指标

评测本阶段时冻结证据包(或冻结检索器输出),只改生成约束、Agent 循环与护栏。

段末注释:忠实度(Faithfulness) = 答案中的论断能被当前上下文支持的比例;答案相关性(Answer Relevancy) = 答的是不是所问,不管是否幻觉;引用覆盖率(Citation Recall) = 事实句挂了可回溯 span 的比例。

忠实度

  • 含义:答案中的 claim 能否被当前上下文支持(幻觉率的操作化)。
  • 计算:从答案抽 claim 集合 $C$,逐条判定是否被 retrieved context 蕴含,
    $$
    \mathrm{Faithfulness}=\frac{|{c_i:\mathrm{supported}(c_i,\mathrm{ctx})}|}{|C|}
    $$
  • 适配:Grounded Generation;方法/剂量/p 值等事实句。
  • 不适配:需要语料外常识或计算工具才能答的题——低分可能是缺工具,不是生成失控。

答案相关性

  • 含义:答的是不是所问,不管是否幻觉。
  • 计算:常用问句与答案嵌入余弦,或 LLM-as-judge 打 0–1。
  • 适配:跑题、拒答过度、Agent 绕远路。
  • 不适配:单独当上线门禁——相关但胡编会漏。必须与 Faithfulness 联用。

引用覆盖率

  • 含义:事实句是否都挂了可回溯 span。
  • 计算:$\mathrm{CiteR}=|{c:\mathrm{has_citation}(c)}|/|C_{\mathrm{factual}}|$。
  • 适配:论文解读、审计;与引用精确率成对看(覆盖高、精确低 = 乱挂引用)。
  • 不适配:聊天式 FAQ、不展示引用。

任务成功率 / 违规拦截率

  • 含义:Agent 是否在步数与预算内完成可核验任务;护栏是否拦下违规输出。
  • 计算:成功次数 / 任务数;拦截次数 / 应拦样本数(漏拦单独报)。
  • 适配:Agentic、Guardrails。
  • 不适配:单次检索问答——用 Faithfulness + Relevancy。

主要难点

  • 长上下文注意力稀释。
  • Agent 链路不确定性与超时。

成熟解决方案

  • Long-context + 证据标记。
  • Agent 步数/预算/超时限制。
  • Grounded Generation 约束生成。
  • Guardrails 风险拦截与回退。

二级方法对比(含 100 篇生物学文献量级)

说明:本阶段成本主要在 推理侧(单次问答),与「100 篇文献」的关系体现为:针对该语料库的典型长上下文/多步任务的资源与耗时。假设使用 32k–128k 上下文窗口 的商用 API 或本地 24GB 级 GPU;生物问答常含 方法细节、统计与图表解读,token 消耗偏高。

二级方法 适用范围 特点 主流实现框架 100 篇文献·资源消耗(估算) 100 篇文献·时间消耗(估算)
Long-context RAG 小中库、愿付 token 换简化链路 少检索、多原文拼接,注意力稀释风险 Qwen-long / Claude / 本地 vLLM 长窗口 长上下文模型 显存 20–40 GB 或 API $/百万 token 为主 单次深度综述式问答:约 15–90 s(视总 token);100 篇不是一次吃完,通常按 批次文档 多次调用
Agentic RAG 多步检索、计算与比对 工具循环 + 预算/步数限制 LangGraph(默认可控);LlamaIndex Agent 多轮 LLM + 工具调用,GPU 16–48 GB 或 API 累加 单次复杂任务30 s–数 min;100 篇语料上跑 批处理评测 可达 数 GPU·h
Grounded Generation 强事实绑定、降幻觉 生成后 NLI/支撑度 过滤或重写 RAGAS Faithfulness + 生成后 NLI;TruLens groundedness 附加 NLI GPU 4–8 GB 每问+0.5–3 s
Guardrails 合规、医疗/生物安全提示 输入/输出策略与拦截 NeMo Guardrails / Guardrails AI 规则引擎 + 小分类器,增量极小 每问+5–80 ms(复杂策略则更高)

与二级文档映射

-------------本文结束感谢您的阅读-------------