Skip to content

Q33 · 什么是 Lost in the Middle?它对 RAG 设计有什么启示? ​

客服系统一次检索到十多段资料,其中真正能回答“耳机签收 20 天是否还能按普通退货政策申请”的一句话,夹在第六段:“耳机签收后 7 天内且未拆封,可提交普通退货申请。”模型的输入长度足够容纳所有段落,却回答“没看到明确期限”。这类现象提醒我们:资料进入上下文,不等于模型一定能同样可靠地找到并使用每个位置的资料。

“Lost in the Middle”(常译为“迷失在中间”)来自 Liu 等人的同名研究。作者控制答案所在资料的位置,观察一些受测语言模型在多文档问答中:答案放在输入开头或结尾时表现往往较好,放在长输入中间时显著变差;在另一项合成的键值查找任务中,一些模型也出现类似曲线,但并非所有模型都如此。这是特定任务、模型和输入安排下的实测现象,不是“所有模型永远读不懂中间文字”的定律。Liu et al., Lost in the Middle: How Language Models Use Long Contexts, TACL 2024

理解论文前,先认清几个词 ​

术语含义本文例子
上下文 / context本次请求提供给模型的可见文字、资料和问题退货资料段落与用户问题
上下文窗口模型一次能接收的输入和输出的容量约束,通常按 token 计算能放进多段政策资料的容量
Token模型处理文字时使用的基本片段;不等同于一个汉字或一个词长资料会占用大量 token
RAG先检索外部资料,再让模型根据资料生成答案查政策资料后答复用户
相关证据真正支持当前问题结论的资料“耳机签收后 7 天内”条款
干扰文档 / distractor一并提供、但不能回答该问题的资料物流说明、维修流程、其他商品政策
位置偏差同一相关证据放在输入不同位置时,回答质量可能改变第 1 段、第 6 段、第 12 段效果不同
重排 / rerank将已检索到的片段按问题相关性重新排序把 7 天条款放在上下文前部
裁剪 / truncation只保留若干片段或删减冗余内容,以控制输入长度从 12 段中保留能回答问题的 4 段
位置消融实验保持问题和证据内容不变,只改变证据放置位置,比较结果将同一 7 天条款轮流放首、中、尾

这里有两个容易混淆的“长度”。窗口够长意味着请求没有因超过容量而被直接拒绝或截断;有效利用意味着模型真的从输入中取出正确条款并据此作答。论文研究的是后者。若条款压根没被检索到,或在组装输入时被截掉,那是更早的检索/组装问题,不能称为“模型看到了却迷失在中间”。

原研究到底怎么做、看到了什么 ​

论文主要使用两类可控制位置的任务。第一类是多文档问答:给模型一个问题和多段文档,其中恰好一段含答案,其余是干扰资料;研究者把含答案的那段放到不同位置,比较答题准确率。论文使用 NaturalQuestions-Open 的问答,文档取自维基百科段落,测试包含 10、20、30 篇资料的输入。第二类是键值查找:把许多随机键和值放入类似 JSON 的长文本,要求模型找出指定键的值,以减少自然语言理解因素。原论文实验设置 · 键值查找任务

“首尾较好、中间较差”不是凭感觉说的。论文附表中,在10 篇文档的多文档问答设置下,受测 GPT-3.5-Turbo 的答案文档放第 1 位时准确率约 76.8%,放第 5 位约 61.2%,放第 10 位约 62.4%。这三个数只说明该论文的模型与实验设置;不能拿来预测今天某个模型或中文客服系统的准确率。原论文附表 5

论文也报告了重要例外:在合成键值任务中,Claude-1.3 及其 100K 版本在受测长度上接近满分;其他受测模型更容易在中间位置出错。作者还测试了把查询放在资料前后两处:它使合成键值查找接近满分,却几乎没有改变多文档问答的整体位置趋势。因此“把问题再写一遍”不是通用修复。原论文键值实验与查询位置分析 · 原论文 §4.2

论文并未证明一个适用于所有模型的单一内部原因。不要把观察结果直接解释成“模型的注意力一定只看两端”或“中间 token 完全不可见”。更准确的说法是:在这些任务里,相关信息的放置位置会显著影响部分模型的正确使用率;你的模型、语言、资料长度和问题类型,需要自己做位置测试。

一份退货资料怎样把关键条款埋在中间 ​

本文使用一组虚构数据:当前日期为 2026-09-26;用户的耳机订单 B204 于 2026-09-06 签收、未拆封;当前政策写“耳机签收后 7 天内且未拆封,可提交普通退货申请”。因此签收 20 天已超出这条普通政策范围;特殊情形可以交人工核查。订单归属和签收日期由业务系统核实,不靠 RAG 猜测。

假设检索器找到 12 段政策相关资料:第 1 段是总则,第 2~5 段是配送与维修,第 6 段是那句耳机 7 天条款,第 7~12 段是其他商品、争议处理与联系方式。第 6 段确实已进入模型输入,模型看得到;但若回答“资料未提具体期限”,就发生了“有证据但未用上”的失败。这里的错答只是说明风险的教学轨迹,不是声称本例在真实模型上跑出论文中的准确率。

做一个公平的三位置对照:保留同一问题、同一条 7 天证据、相同的 11 段干扰资料、同一模型和解码设置,只把关键段落放到第 1、6、12 位,观察答复与引用是否变化。若第 1、12 位能给出“20 天超过 7 天”,第 6 位却说“没有期限”,这才是该系统存在位置敏感性的直接证据。若三处都错,应先检查证据内容是否完整、订单事实是否提供以及生成规则,而不是武断归因于“中间”。

长政策卷轴的中间藏着耳机退货七天条款,相关证据被提取并优先放在精简资料前部

图中长卷轴把资料的开头、中间、结尾直观分开,红框是同一条已存在的关键证据;下方的精简卡片表示 RAG 可以在检索、重排与组装后把它放到更显眼的位置。图说的是“中间证据可能被漏用”,不表示第 6 段一定失败,也不表示把任何内容机械移到第一位就一定正确。

对 RAG 设计有哪几条具体启示 ​

第一,先让正确片段进入候选,再谈位置。 若检索阶段漏掉“耳机 7 天”,模型不可能从上下文中使用它。应先看源文档、解析、切块、召回和过滤条件,确认候选包含正确片段;相关性与生效日期都要核实。位置优化发生在“已有正确候选”之后。把没有检索到证据的错答称为 Lost in the Middle,会把团队带去调错误的环节。

第二,把高相关、有效的证据安排在上下文前部。 重排候选并优先送入最能回答问题的段落,既符合论文发现的首部优势,也避免关键片段淹没在十几段相似资料中。论文作者明确提出,有效重排、把相关文档推近开头,可能有助于阅读器利用检索上下文;这是从实验得到的设计方向,仍需在具体系统验证。原论文 §5

第三,少放无用资料,但不能把必要证据裁掉。 top-k 中的 k 是给模型的候选数量,不是越大越好。更多片段可能提高检索覆盖,却也增加干扰和长度;论文的开放域问答案例中,从 20 篇加到 50 篇,检索召回继续增长,答题收益却很小。可以试去重、压缩冗余、保留标题与出处,再对照更小的 k;但一个问题若需要“期限”和“例外”两段,裁剪时必须保住两段。作者把适当减少检索文档数也列为潜在方向。原论文开放域问答案例

第四,测实际送进模型的顺序和位置。 检索接口的排序不一定等于最终 prompt 顺序;模板可能先放历史对话、工具日志、长系统说明,再放政策。应记录脱敏后的片段 ID、有效期、输入中的相对位置、总 token、模型实际答案与引用。评测时既看正确证据是否被检索到,也看它在首/中/尾三个位置的答案正确率与证据引用率。论文明确把“相关信息在不同位置时表现差距是否很小”作为检验长上下文利用能力的一种方式。原论文引言

第五,不把“放尾部”当成无条件优化。 原论文在受测设置里观察到尾部也常表现较好,但生产 prompt 可能在末尾放用户追问、输出格式、工具结果;业务问题也可能要综合多段证据而非找一段。更稳妥的默认做法是先保证检索质量、压缩噪声、把关键证据放前,同时对目标模型实测首/中/尾顺序。不同模型、任务和提示结构可能有不同结果。

怎么评测和排查,不被长上下文误导 ​

可先建一份小型、人工核验的政策问答集,覆盖“单一关键段落”“两个条件分散在不同段落”“旧版与新版相邻”“无答案应说明不知道”。为每题记录标准证据的片段 ID 与应答要点,固定同一组片段,分别进行:

对照想排除的混淆因素应看什么
原排序 vs 相关段落置前是否只是候选顺序问题答案正确率、引用是否指向关键条款
第 1 / 中间 / 最后一位同一证据的位置影响各位置准确率及最差与最好差距
4 / 8 / 12 段资料候选越多是否反而稀释证据检索覆盖、答案质量、延迟和 token
完整条款 vs 删减版压缩是否删掉“未拆封”等必要条件答案条件是否完整、是否误判

这里 4 / 8 / 12 只是实验档位示例,不是论文或行业推荐的固定参数。若缩短资料后答案变好,也要确认不是因为旧版或必要例外被误删;若换模型后中间位置表现好,也应如实记录,而不是强行套用原论文曲线。对生产系统,更重要的是同时报告检索命中与最终答对:前者高、后者低,才说明阅读/排序/生成值得深入;前者低,先修检索。

面试时可以这样回答 ​

Lost in the Middle 是 Liu 等人在长上下文实验中观察到的位置敏感现象:多文档问答中,正确资料在开头或结尾时往往更容易被一些模型用对,在中间时准确率下降;合成键值任务里也有类似结果,但存在表现稳定的模型。因此长上下文窗口只表示“装得下”,不保证各位置都“用得好”。对 RAG,我先确认正确证据已经检索进来,再重排并优先放前、裁掉无关或重复资料,同时保留回答必需的多段证据和来源。比如 7 天耳机退货条款夹在第 6 段,模型答“无期限”,我会固定资料做首/中/尾位置对照,并比较检索命中、答案正确与引用,判断是否真的由位置造成。不能一律说“中间必错”,也不能靠增大上下文窗口替代检索质量与评测。

参考资料 ​

最后更新2026-09-26
难度P0
频率very-high
阅读21 min
主题lost-in-the-middle / long-context / rag
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题