当检索结果先被大模型“读”,再以答案形式交给用户,搜索系统真正要优化的,是为生成模型构造一份能支撑正确答案的可靠上下文。
百度联合中国科学院计算技术研究所与武汉大学的研究者围绕这一现状,提出答案支撑、内容可信与上下文组织三阶段框架,并结合百度搜索工业实践,梳理了从检索排序、可信度判断、结构化上下文组织到生成后反馈的优化链路。
网页搜索面向用户呈现排序结果;AI搜索则先组织检索信息,再由模型生成答案。
搜索的消费者变了
传统网页面向人:系统召回并排序网页,用户自己点击、阅读、比较来源,再形成结论。AI搜索则不同——检索结果先进入大模型,模型再直接生成答案。信息的主要消费者从“人”变成“模型”,检索目标也随之变化。
一篇网页和查询很相关,不代表它真的提供了回答所需的信息;来源看起来权威、页面发布时间很新,也不代表其中的信息适合当前问题、仍然有效或事实可靠;即使每篇文档单独都不错,直接按排名拼接,也可能造成重复、信息分散和关键条件被淹没。
三阶段:有用、可信、会组织
- Stage 1:答案支撑。
不再只问“文档与查询有多相关”,而是判断它是否真正贡献答案所需的信息。贡献既可以是直接给出答案,也可以是提供推导答案所需的事实、条件或前提。
- Stage 2:内容可信。
能帮助回答还不够,信息还必须能够支撑正确答案。来源可信判断来源是否适合当前领域与信息类型;动态可信区分页面发布时间与内容真正对应的时间状态;事实可信度则将文档中的事实拆成可独立核验的事实声明,并针对每条声明生成检索查询,寻找外部证据进行验证。
- Stage 3:上下文组织。
通过前两阶段的文档,还要被真正“组织”成适合模型使用的上下文。系统在单篇文档内抽取贡献答案的信息,在多文档之间去除重复、聚合互补内容,并按照答案逻辑进行结构化和排序,避免把一堆“好文档”简单拼成长上下文。
三阶段框架:从答案支撑、内容可信到上下文组织。
相比直接拼接,上下文组织对信息进行筛选、合并与重组。
从框架到工业优化
论文并不只停留在概念层面对AI搜索检索目标进行重新定义,而是进一步将三阶段框架映射到实际工业系统中。整体优化包括两个互补方向:生成前优化聚焦答案生成前的检索与上下文构造,生成后优化则利用答案层反馈,将生成结果反向归因到上游文档和上下文组织决策。
LLM大模型答案支撑排序:从“相关”走向“真正能帮助回答”
传统相关性排序模型更擅长判断查询与文档是否匹配,但“答案支撑”进一步关心的是:一篇文档究竟能不能为最终答案提供有效信息。模型既要识别直接包含答案的内容,也要发现那些虽然没有直接回答问题、却提供了推导答案所需事实、条件或前提的文档。
在工业实现中,为了兼顾大模型能力与线上检索效率,LLM大模型答案支撑排序模型采用可学习的文档瓶颈向量压缩文档信息。文档标题和正文可以提前离线编码,并压缩到这些瓶颈向量中;在线查询到来后,查询侧不再直接访问完整文档,而是通过瓶颈表示获取文档信息并完成打分。这样既能利用大模型理解复杂答案贡献关系的能力,也减少了在线阶段反复处理长文档带来的计算开销。
LLM大模型答案支撑排序:文档通过可学习瓶颈向量进行离线压缩,查询侧仅访问瓶颈表示完成在线匹配与排序。
内容可信:从“看起来可信”到“真正能给模型用”
仅找到能帮助回答的文档还不够。如果信息来自不合适的来源、已经过期,或事实本身有误,它反而可能把生成模型引向错误答案。因此第二阶段从来源、动态与事实可信三个维度继续判断信息能否作为正确答案生成的可靠依据。
在来源可信中,系统不再只依据政府网站、企业网站、个人作者等静态来源类别,而是进一步结合查询所需领域和内容生产者画像;在动态可信中,系统区分网页的发布时间与信息真正描述的内容时间,并根据查询建模过期时间点;在事实可信中,系统把影响答案生成的事实拆成独立事实声明,为每条声明生成检索查询,再根据外部检索证据判断其是否得到证实、被证伪或仍无法确定。
内容可信评估:分别从来源可信度、时效可信度和事实可信度三个维度评估文档,并通过非补偿式聚合决定文档是否保留
上下文组织:从单篇信息抽取到多文档协同组织
经过前两个阶段后,文档虽然整体值得保留,但并不意味着需要“整篇塞给模型”。上下文组织的目标,是在有限上下文预算下决定保留什么信息,以及这些信息应该如何组织。在工业实现中,这一过程主要包括两类技术路线。
第一类是分阶段的信息抽取+组织。
在单篇文档内部,信息抽取模块负责筛选真正有助于答案生成的信息。抽取式信息抽取模块采用基于查询的token级BIO标注,从原文中直接识别需要保留的连续片段,适合答案信息集中在局部文本中的情况;当关键信息分散在长文档不同位置,或隐含在复杂表格等结构关系中时,生成式信息抽取模块会先将文档切分为带编号的片段,再由LLM自回归生成需要保留的片段编号,从而选择非连续信息。
随后,集合级上下文组织模块从单篇文档进一步走向整个保留文档集合。多篇文档共同进入上下文后,系统需要处理重复信息、不同答案维度之间的覆盖失衡,以及互补信息分散等问题。上下文组织模块因此联合考虑整个文档集合,对相关信息进行聚合,并在有限上下文预算下分配不同信息的保留空间和组织顺序。也就是说,这一路径先回答“保留什么”,再回答“如何组织”。
两类文档信息抽取方式:抽取式信息抽取模块识别连续答案贡献片段;生成式信息抽取模块通过生成segment ID选择分散信息。
第二类是统一抽取与组织模型,将“保留什么”和“如何组织”放到同一个模型中完成。
如果信息抽取与上下文组织完全分开,前面的抽取模块可能提前删除一段单独看价值有限、但与其他文档组合后却很重要的信息;一旦被删除,后续的组织模块就无法恢复。统一抽取与组织模型因此直接联合建模文档级保留决策与信息片段级组织。
模型首先对每篇文档预测三种处理方式:完整保留、部分保留或丢弃。完整保留表示整篇文档进入后续处理;部分保留表示只保留其中选中的信息片段;丢弃则表示该文档不再进入后续上下文。随后,模型再对最终保留下来的信息片段预测组织顺序,决定它们在生成上下文中的排列。
因此,这一路径不再把“信息抽取”和“上下文组织”视为完全独立的两个步骤,而是在同一个模型中共同决定哪些内容进入上下文,以及这些内容以什么顺序进入上下文。
Unified Extractor–Organizer:先决定不同文档的保留粒度,再统一预测保留内容的组织顺序。
后验优化:让最终答案反过来指导检索前三个阶段都发生在答案生成之前,但AI搜索与传统网页搜索还有一个明显差异:用户反馈的对象发生了变化。传统搜索可以利用点击等文档级行为信号;而在AI搜索中,用户通常直接消费最终生成的答案,因此真实反馈不仅更加稀疏,也更难判断一次回答效果究竟应归因于哪些上游文档或上下文组织决策。
为此,系统进一步构建了基于代理反馈的生成后模拟器。它首先通过答案级评估器判断最终答案是否满足要求;当答案存在可定位的问题时,可以进一步触发补充检索与重新生成。对于通过评估的答案,系统还会结合成功生成轨迹,估计不同文档对最终答案的贡献,从而将答案层面的结果反向关联到上游的检索与上下文构造决策。
生成后优化:围绕答案评估、缺陷修正和来源归因三个环节,将答案层反馈反向关联到上游检索与上下文构造
由此,生成前优化尽可能在答案生成前构造高质量的生成上下文,生成后优化则从最终生成结果出发反向诊断上游决策,两者从不同方向共同优化最终答案表现。
检索变好了,答案真的会更好吗?
论文同时从检索侧和答案侧两个层面进行评测。结果显示,多项组件升级不仅改善了检索侧指标,也带来了最终答案层面的提升。例如,大模型答案支撑排序使自动答案通过率提升4.8个百分点;事实声明级验证带来4.2%的人工净增益;抽取式信息提取模块的人工净增益达到8.9%;集合级上下文组织模块则使查询级可用率提升7.2个百分点。
代表性组件升级对检索效果和最终答案表现的影响
从文档排序到可靠上下文
网页搜索关注的是“把哪些文档排在前面”,而AI搜索更进一步,需要把检索到的信息组织成可供大模型直接生成答案的上下文。
当信息消费者从人变成模型,搜索系统开始承担过去由用户完成的一部分工作:判断哪些信息值得用、哪些信息可以信、以及如何对分散且存在冗余的信息进行筛选、整合与组织成能够稳定支撑正确答案生成的上下文。
论文题目:From Ranked Documents to Reliable Contexts: An Answer-Oriented Context Construct Framework for AI Search
作者:Yunfei Zhong、Yinqiong Cai、Lixin Su、Haosheng Qian、Lixin Zou、Yixing Fan、Sheng Xu、Jiafeng Guo、Daiting Shi、Jingzhou He
研究机构:中国科学院计算技术研究所/中国科学院大学、百度、武汉大学
通讯作者:Yinqiong Cai
论文链接:https://arxiv.org/abs/2609.23354
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🎓
我们会 (尽量) 及时回复你 :)
🌟 点亮星标 🌟
科技前沿进展每日见



