LoHoSearch - 美团推出的下一代搜索智能体评测基准

时间:2026-07-22 07:36:49 来源:互联网

LoHoSearch是搜索智能体评测基准,依托知识图谱自动生成多领域题目,通过控制搜索空间与结构复杂度制造高难度挑战,为长程推理能力提供未饱和的区分标准。

LoHoSearch是什么

该基准由技术团队推出,基于覆盖762万维基百科实体、2.65亿条关系边的知识图谱自动生成题目,收录544道经人工核验的高质量题目,覆盖音乐、影视、地理等11个领域。当前最强模型GPT-5.5准确率仅34.74%,远低于其在BrowseComp上的表现,为长程搜索推理与上下文管理提供更具区分度的评测标准。

img_6a6002919676f30.webp

LoHoSearch的主要功能

  1. 知识图谱自动化建图:以完整英文维基百科为数据源,构建包含762万实体节点与2.65亿条有向边的超大规模知识图谱,为每个实体标注Wikidata类型与入度热度,从而为全局视角选题提供基础。
  2. 双维度难度控制:从搜索空间与结构复杂度两个维度系统调控题目难度,突破人工出题的认知天花板。
  3. 树结构与图结构采样:树结构通过放大搜索空间制造难度,图结构则在巨大搜索空间之上引入环形依赖与交叉约束,进一步叠加结构复杂度。
  4. 自动化QA生成与验证:从子图抽取维基描述改写为自然语言题目,经关系提取、子图覆盖检查、答案满足度验证三层自动筛选,再辅以人工复核确保质量。
  5. 多模型性能评测:支持对主流搜索智能体进行标准化评测,输出准确率、工具调用次数、校准误差等核心指标,直观反映模型长程推理能力。

LoHoSearch的技术原理

  1. 知识图谱自动化构建:以完整英文维基百科为数据源,抽取762万个实体页面作为节点,提取正文内2.65亿条超链接作为有向边,为每个实体标注Wikidata P31类型与入度热度,构建全局知识网络。
  2. 双维度难度定义:从搜索空间和结构复杂度两个正交维度量化题目难度,突破人工出题的认知局限。
  3. 树结构子图采样:通过放大搜索空间制造难度,从单一答案节点向下展开多条独立分支,每条分支对应一个高候选空间的约束条件,使排除成本指数级上升。
  4. 图结构子图采样:在巨大搜索空间基础上引入环形依赖与交叉约束,多个条件节点彼此interconnected,求解需同时满足多组咬合关系,叠加结构复杂度形成双重挑战。
  5. 关系提取与自然语言生成:从采样子图中抽取各实体的维基百科描述,用大模型改写为连贯的自然语言问题,确保每个线索完整保留原始子图中的关系信息。

如何使用LoHoSearch

  1. 加载数据:通过datasets库直接加载meituan-longcat/LoHoSearch,获取544道题目与标准答案。
  2. 查看结构:数据集包含题目文本、对应子图结构、领域标签及经知识图谱校验的唯一答案。
  3. 接入评测:将题目输入待测搜索智能体,记录其推理轨迹与最终输出。
  4. 自动判分:对照数据集提供的标准答案,验证模型输出是否满足全部约束条件并统计准确率。
  5. 对比分析:用数据集附带的子图复杂度与领域标签,分维度分析模型在不同难度与主题下的表现。

LoHoSearch的核心优势

  1. 突破人工出题天花板:传统人工基准受限于标注者已知实体范围,LoHoSearch依托全局知识图谱,能系统识别高搜索空间与高结构复杂度的真难题。
  2. 难度显著高于现有基准:同一模型在BrowseComp上准确率58.84%,在LoHoSearch上仅10.02%,平均工具调用从35次增至61次,挑战强度提升74%。
  3. 区分度更强:现有上下文管理策略在BrowseComp上提升14.03%,在LoHoSearch上仅提升6.8%,更能真实反映策略在长程复杂场景下的边际效益。
  4. 结构复杂度独立可控:图结构题目准确率(8.01%)显著低于树结构(11.89%),证明结构复杂度是独立于搜索空间之外的额外难度来源,可被单独量化。

LoHoSearch的项目地址

  1. arXiv技术论文:https://arxiv.org/pdf/2606.12837

LoHoSearch的同类竞品对比

维度 LoHoSearch BrowseComp
出题方式 知识图谱自动化生成+人工核验 人工设计
题目数量 544道 数百道
覆盖领域 11个领域(音乐、影视、地理等) 未明确分领域
难度控制 搜索空间+结构复杂度双维度 人工主观控制
最强模型准确率 GPT-5.5:34.74% GPT-5.5 Pro:90.1%
工具调用中位数 59次 26次
上下文策略提升 +6.8% +14.03%
饱和状态 远未饱和,区分度高 已接近饱和
适用场景 长程搜索推理、上下文管理评测 基础搜索能力评测

LoHoSearch的应用场景

  1. 搜索智能体能力评测:为具备长程推理能力的搜索Agent提供高难度标准化测试,精准定位模型在复杂信息检索链条中的短板。
  2. 上下文管理策略验证:评估Summary、Discard-all、Verify等上下文压缩与验证策略在超长交互场景下的真实增益,避免在简单基准上高估策略效果。
  3. 模型迭代对标:为研究团队提供未饱和的评测标准,支撑模型版本迭代时的能力边界探测与性能对比。
  4. 搜索算法研究:为需要多步推理、交叉验证的复杂搜索算法研究提供可控难度的数据集与评测框架。
  5. 智能体产品选型:帮助企业在选型搜索智能体方案时,通过LoHoSearch区分不同模型在真实复杂查询场景下的实际表现。