详情

首页手游攻略 LoHoSearch - 美团LongCat发布的搜索智能体评测基准

LoHoSearch - 美团LongCat发布的搜索智能体评测基准

佚名 2026-07-24 07:44:14

LoHoSearch快速摘要

LoHoSearch是美团LongCat团队于2026年7月20日公开的搜索智能体评测基准,用于测试AI智能体在复杂信息检索、长程推理和上下文管理任务中的能力,通过知识图谱自动生成高难度问题,适用于大语言模型、AI Agent研究和搜索系统评估。

  • 工具名称:LoHoSearch
  • 开发公司:美团LongCat团队
  • 发布时间:2026年6月17日发布技术论文,7月20日由官方公众号正式公开
  • 主要功能:通过知识图谱自动生成复杂搜索任务,评估模型推理、检索和信息整合能力。
  • 使用要求:需要结合搜索工具、网页浏览工具或AI Agent框架进行测试
  • 开源情况:LoHoSearch数据集已公开,可通过Hugging Face获取544道人工验证问题。
  • 适用场景:适用于搜索智能体评测、模型对比、上下文管理研究和复杂检索算法测试。
  • 技术特点:基于覆盖762万个Wikipedia实体、2.65亿条关系边的知识图谱,通过搜索空间和结构复杂度控制难度。
  • 价格信息:数据集开放获取,当前未公布商业API价格或付费服务。
LoHoSearch – 美团LongCat推出的搜索智能体评测基准

LoHoSearch的核心优势

  • 知识图谱自动生成:基于Wikipedia构建762万个实体和2.65亿条关系边,通过全局知识网络自动发现高难度搜索任务,减少人工出题限制。
  • 双维度难度控制:结合搜索空间和结构复杂度设计任务,通过候选规模与多条件约束提升AI搜索智能体评测难度。
  • 高区分度能力评估:测试数据显示GPT-5.5在LoHoSearch准确率为34.74%,可有效区分不同模型长程搜索推理能力。
  • 长程推理能力测试:通过多步骤检索和隐藏实体推理评估Agent能力,正确轨迹平均需要61次工具调用。
  • 上下文管理研究:支持测试Summary、Verify等策略,据实验数据显示最佳策略可提升DeepSeek-V4-Flash准确率6.8%。

LoHoSearch的主要功能

  • 知识图谱任务生成:将Wikipedia实体和关系转换为复杂问题,自动生成隐藏答案的搜索任务,测试AI Agent检索能力。
  • 搜索智能体评测:支持search和browse工具调用,通过准确率、工具次数等指标分析模型搜索推理性能。
  • 复杂问题验证:采用自动验证与人工审核机制,筛选544道唯一答案问题,覆盖音乐、影视、地理等11个领域。
  • 模型性能分析:提供准确率、校准误差、工具调用次数等数据,帮助研究不同AI模型能力差异。
  • 上下文策略测试:支持评估长程任务中的信息管理方法,分析上下文压缩和验证策略实际效果。

LoHoSearch的技术原理

  • 知识图谱架构:采用Wikipedia知识网络,将762万个实体作为节点、2.65亿条链接作为边,构建搜索任务基础。
  • 自动采样机制:通过树结构和图结构生成问题,利用搜索空间与结构复杂度控制任务难度。
  • 自然语言生成:利用大语言模型改写知识图谱关系,将实体约束转换为自然语言搜索问题。
  • 答案验证机制:结合知识图谱校验、搜索Agent验证和人工审核,确保问题答案唯一可靠。
  • Agent评测机制:模拟真实搜索流程,通过工具调用、推理轨迹和最终答案评估模型能力。

LoHoSearch与主流模型评测基准对比

对比维度LoHoSearchBrowseComp
任务生成方式知识图谱自动生成+人工审核人工设计问题
问题数量544道人工验证问题数百道任务
难度控制搜索空间+结构复杂度双控制人工经验控制
最高模型准确率GPT-5.5达到34.74%GPT-5.5 Pro约90%以上
工具调用需求平均61次调用平均35次左右
上下文策略提升最高提升6.8%最高提升14.03%

LoHoSearch与BrowseComp均用于评测搜索智能体能力,但测试重点存在差异。BrowseComp采用人工设计题目,主要衡量模型的信息检索与多步搜索能力;LoHoSearch基于覆盖762万维基百科实体的知识图谱自动生成问题,通过搜索空间和结构复杂度控制难度,更侧重长程搜索推理与上下文管理能力。据论文测试显示,GPT-5.5在LoHoSearch上的准确率为34.74%,而DeepSeek-V4-Flash在BrowseComp上的准确率为58.84%、LoHoSearch上仅为10.02%,说明LoHoSearch对复杂约束、多轮工具调用和信息整合能力提出了更高要求。

如何使用LoHoSearch

  1. 加载数据集:通过Python datasets库加载meituan-longcat/LoHoSearch数据集,获取544道人工验证问题、标准答案、领域标签和子图结构,为搜索智能体评测准备测试数据。
  2. 配置评测环境:准备支持search和browse工具的AI搜索智能体,将模型上下文设置为200K tokens左右,模拟论文中的标准测试环境,确保Agent能够完成多步骤检索任务。
  3. 执行智能体测试:将LoHoSearch问题输入待测AI Agent,让模型通过搜索、网页浏览和推理过程寻找答案,同时记录工具调用次数、推理轨迹和最终输出结果。
  4. 自动验证结果:使用评测流程检查模型答案是否满足问题中的全部关系约束,并结合标准答案计算准确率,分析模型在长程搜索任务中的实际表现。
  5. 分析评测数据:结合准确率、工具调用次数、子图复杂度和领域标签,对比不同模型在搜索空间、结构复杂度和上下文管理方面的能力差异。

LoHoSearch的局限性

  • 题目规模有限:当前LoHoSearch包含544道人工验证问题,虽然覆盖11个领域,但相比开放世界知识规模仍有限,原因在于人工审核需要成本。
  • 依赖知识图谱质量:LoHoSearch基于Wikipedia关系数据构建,部分领域知识更新可能存在延迟,原因是知识图谱来源受原始数据影响。
  • 评测环境限制:当前测试主要针对具备搜索和浏览工具的Agent,实时语音、多模态交互等能力未覆盖,原因是基准设计目标集中于搜索推理。

LoHoSearch相关资源

  • HuggingFace模型库:meituan-longcat/LoHoSearch
  • arXiv技术论文:https://arxiv.org/pdf/2606.12837

LoHoSearch的典型应用场景

  • 搜索智能体评测:用于测试AI智能体在复杂信息检索、多步推理和长程搜索任务中的综合能力。
  • 上下文管理研究:用于验证摘要、压缩、重启等策略在长链路搜索中的实际效果。
  • 模型能力对比:通过统一测试标准评估不同AI模型的搜索推理性能和能力差异。
  • 搜索算法优化:为多轮检索、工具调用和复杂约束推理算法提供实验数据支持。
  • 智能体产品测试:帮助企业评估搜索型AI智能体在复杂场景中的适用能力。

LoHoSearch常见问题

LoHoSearch怎么用?

LoHoSearch需要结合AI搜索智能体使用,通过Hugging Face加载数据集,将问题输入支持search和browse工具的Agent,再统计答案准确率。

LoHoSearch如何计费?

LoHoSearch数据集目前免费开放使用,没有公布API价格或商业计费方案。

LoHoSearch和BrowseComp哪个好?

两者定位不同,LoHoSearch更适合测试长程搜索推理能力。根据论文数据,GPT-5.5在LoHoSearch准确率34.74%,任务工具调用需求更高;BrowseComp更适合基础搜索能力测试,选择时需根据评测目标决定。

LoHoSearch支持实时搜索吗?

LoHoSearch本身不是搜索工具,不提供实时搜索功能,而是评测数据集。使用时需要连接具备搜索能力的Agent。

点击查看更多
推荐专题
热门阅读