
LoHoSearch:GPT-5.5 也只答对 34.74%,长程搜索难在关系链
美团 LongCat 用 762 万实体知识图谱自动构造 544 道搜索题,结果显示模型的难点已从找到网页转向维护候选、关系和长轨迹上下文。
34.74% 暴露的不是搜索入口,而是长程链条
在 LoHoSearch 上,GPT-5.5 的准确率最高也只有 34.74%。这不是说它连网页都搜不明白,而是说当题目同时扩大候选空间、叠加多条关系约束,并要求智能体持续保留中间证据时,现有搜索 Agent 很难把一条长链走完。LoHoSearch 是美团 LongCat 团队发布的长程搜索评测基准,官方技术文章发表于 2026 年 7 月 24 日。1
这项工作的切口很明确:BrowseComp 等人工出题基准在过去一年快速接近饱和,出题者很难凭个人经验系统控制实体热度、候选规模和关系结构。LoHoSearch 试着把出题放回一张大知识图谱里,让机器先找到「难在哪里」,再把难度写成问题。论文把它定义为 Long-Horizon Search Agents 基准,包含 544 道人工核验题,覆盖 11 个领域。2
难度来自两根轴:候选有多宽,关系有多紧
LoHoSearch 从英文维基百科构建知识图谱。官方文章给出的规模是 762 万个实体和 2.65 亿条有向边;论文摘要将其概括为超过 700 万个实体。每个页面可视为实体节点,页面中的链接构成关系边,实体入度则可用来衡量热度。12
题目生成主要控制两个维度:
| 难度维度 | 具体做法 | 读者该如何理解 |
|---|---|---|
| 搜索空间 | 选择单条关系下候选很多的实体,再用多条条件逐步排除 | 每个条件都可能对应一长串候选,搜到一个相关页面不等于找到答案。 |
| 结构复杂度 | 用树结构扩大候选空间,用图结构加入交叉约束和环形依赖 | 题目不只是条件更多,还要求把来自不同路径的证据闭合起来。 |
树结构题和图结构题的差异,是这套基准最有用的设计之一。官方文章的探针实验中,DeepSeek-V4-Flash 在树结构题上的准确率为 11.89%,图结构题只有 8.01%。这不能单独证明图结构一定更接近所有真实搜索任务,却说明结构复杂度确实能在相近搜索条件外再增加一道门槛。13
自动出题还要经过质量筛选
从子图到自然语言题目,中间并不是一次生成。流程先检查题目是否覆盖子图中的关系,再让搜索 Agent 验证答案是否满足全部条件,之后过滤多答案题和过于容易的题目,最后交给人工审核。官方文章披露,75.5% 的题目直接通过人工复核,22.3% 经标注员微调后接受,2.2% 因严重问题被丢弃。最终数据集为 544 道题,Hugging Face 页面也显示其 benchmark split 包含 544 行。14
这里有一个需要收窄的地方:图谱内的唯一答案,不等于现实互联网中的唯一答案。论文提到,29.2% 的题目人工无法完全排除知识图谱外的替代答案;评测还依赖 LLM judge,数据集本身是静态快照,且难度过滤使用了单一搜索 Agent。LoHoSearch 的 34.74% 适合被读成「在这套问题定义和评测协议下,最强模型仍有大块任务没有完成」,不适合被读成通用搜索准确率。3
长轨迹变长后,简单的上下文管理不够用了
在 DeepSeek-V4-Flash 的对照实验中,BrowseComp 正确轨迹平均需要 35 次工具调用,LoHoSearch 增至 61 次;中位数从 26 次升到 59 次。题目变难的地方不只是「多搜几次」,而是每次搜索都可能改变候选集合,后续还要回头核验前面留下的关系。13
论文进一步比较了 Summary、Discard-all 和 Verify 等上下文策略。对 DeepSeek-V4-Flash 而言,表现最好的组合是 Discard-all + Verify,成绩从基线 10.02% 提到 16.82%,绝对提升 6.8 个百分点。这个增益并非没有价值,但它小于同类策略在 BrowseComp 上的提升,说明把历史轨迹压短或重新开始搜索,不能自动补上长程关系维护的缺口。3
这也是 LoHoSearch 比单看榜单更有用的地方。它把「模型找不到答案」拆成了更具体的工程问题:候选空间是否被及时缩小,关系证据是否被正确保留,模型是否知道何时需要验证,以及置信度是否足以支撑最终提交。论文报告的另一个信号是,DeepSeek-V4-Flash 进行 16 次独立采样后,pass@16 达到 38.3%,但 best-of-N 只有 24.6%,两者的差距说明模型能偶尔找到答案,却不总能判断哪一个答案更可信。1
这套基准适合拿来测什么
LoHoSearch 的价值不在于给搜索 Agent 再加一张排行榜,而在于提供了一个能压出长链错误的测试场。若要复测,至少应该同时记录最终准确率、工具调用长度、树结构与图结构差异、重复采样收益和答案校准误差,而不能只看一次提交是否正确。
它目前仍是英文静态基准,答案唯一性主要在知识图谱内验证,评测分数也受 judge 设计影响。对工程团队来说,最稳妥的结论是:在开放式资料检索中,搜索入口和网页阅读能力已经不是全部问题;真正难的是让 Agent 在几十次工具调用后仍知道哪些关系已经证实、哪些候选还没有排除。23
开源入口: LoHoSearch 论文、Hugging Face 数据集。
Related content
- Sign in to comment.
