LoHoSearch – 美团推出的下一代搜索智能体评测基准AI工具14小时前发布AI小集02LoHoSearch是什么LoHoSearch 是美团 LongCat 团队推出的下一代搜索智能体评测基准,基于覆盖 762 万维基百科实体、2.65 亿条关系边的知识图谱自动生成题目,替代传统人工出题模式。基准收录 544 道经人工核验的高质量题目,覆盖音乐、影视、地理等 11 个领域,通过控制搜索空间与结构复杂度双维度制造挑战。当前最强模型GPT-5.5准确率仅 34.74%,远低于其在 BrowseComp 上 90% 以上的表现,为长程搜索推理与上下文管理提供更具区分度的评测标准。LoHoSearch的主要功能知识图谱自动化建图:用完整英文维基百科为数据源,构建 762 万实体节点与 2.65 亿条有向边的超大规模知识图谱,每个实体标注 Wikidata 类型与入度热度,为全局视角选题提供基础。双维度难度控制:从搜索空间与结构复杂度两个维度系统调控题目难度,突破人工出题的认知天花板。树结构与图结构采样:树结构通过放大搜索空间制造难度,图结构则在巨大搜索空间之上引入环形依赖与交叉约束,进一步叠加结构复杂度。自动化 QA 生成与验证:从子图抽取维基描述改写为自然语言题目,经关系提取、子图覆盖检查、答案满足度验证三层自动筛选,再辅以人工复核确保质量。多模型性能评测:支持对主流搜索智能体进行标准化评测,输出准确率、工具调用次数、校准误差等核心指标,直观反映模型长程推理能力。LoHoSearch的技术原理知识图谱自动化构建:用完整英文维基百科为数据源,抽取 762 万个实体页面作为节点,提取正文内 2.65 亿条超链接作为有向边,为每个实体标注 Wikidata P31 类型与入度热度,构建全局知识网络。双维度难度定义:从”搜索空间”和”结构复杂度”两个正交维度量化题目难度,突破人工出题的认知局限。树结构子图采样:通过放大搜索空间制造难度,从单一答案节点向下展开多条独立分支,每条分支对应一个高候选空间的约束条件,使排除成本指数级上升。图结构子图采样:在巨大搜索空间基础上引入环形依赖与交叉约束,多个条件节点彼此 interconnected,求解需同时满足多组咬合关系,叠加结构复杂度形成双重挑战。关系提取与自然语言生成:从采样子图中抽取各实体的维基百科描述,用大模型改写为连贯的自然语言问题,确保每个线索完整保留原始子图中的关系信息。如何使用LoHoSearch加载数据:通过datasets库直接加载meituan-longcat/LoHoSearch,获取 544 道题目与标准答案。查看结构:数据集包含题目文本、对应子图结构、领域标签及经知识图谱校验的唯一答案。接入评测:将题目输入待测搜索智能体,记录其推理轨迹与最终输出。自动判分:对照数据集提供的标准答案,验证模型输出是否满足全部约束条件并统计准确率。对比分析:用数据集附带的子图复杂度与领域标签,分维度分析模型在不同难度与主题下的表现。LoHoSearch的核心优势突破人工出题天花板:传统人工基准受限于标注者已知实体范围,LoHoSearch 依托全局知识图谱,能系统识别高搜索空间与高结构复杂度的”真难题”。难度显著高于现有基准:同一模型在 BrowseComp 上准确率 58.84%,在 LoHoSearch 上仅 10.02%,平均工具调用从 35 次增至 61 次,挑战强度提升 74%。区分度更强:现有上下文管理策略在 BrowseComp 上提升 14.03%,在 LoHoSearch 上仅提升 6.8%,更能真实反映策略在长程复杂场景下的边际效益。结构复杂度独立可控:图结构题目准确率(8.01%)显著低于树结构(11.89%),证明结构复杂度是独立于搜索空间之外的额外难度来源,可被单独量化。LoHoSearch的项目地址HuggingFace模型库:https://huggingface.co/datasets/meituan-longcat/LoHoSearcharXiv技术论文:https://arxiv.org/pdf/2606.12837LoHoSearch的同类竞品对比维度LoHoSearchBrowseComp出题方式知识图谱自动化生成 + 人工核验人工设计题目数量544 道数百道覆盖领域11 个领域(音乐、影视、地理等)未明确分领域难度控制搜索空间 + 结构复杂度双维度人工主观控制最强模型准确率GPT-5.5:34.74%GPT-5.5 Pro:90.1%工具调用中位数59 次26 次上下文策略提升+6.8%+14.03%饱和状态远未饱和,区分度高已接近饱和适用场景长程搜索推理、上下文管理评测基础搜索能力评测LoHoSearch的应用场景搜索智能体能力评测:为具备长程推理能力的搜索 Agent 提供高难度标准化测试,精准定位模型在复杂信息检索链条中的短板。上下文管理策略验证:评估 Summary、Discard-all、Verify 等上下文压缩与验证策略在超长交互场景下的真实增益,避免在简单基准上高估策略效果。模型迭代对标:为研究团队提供未饱和的评测标准,支撑模型版本迭代时的能力边界探测与性能对比。搜索算法研究:为需要多步推理、交叉验证的复杂搜索算法研究提供可控难度的数据集与评测框架。智能体产品选型:帮助企业在选型搜索智能体方案时,通过 LoHoSearch 区分不同模型在真实复杂查询场景下的实际表现。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Qwen-Audio-3.0-TTS - 阿里通义千问推出的语音合成模型下一篇vivago R1- 智象未来推出的无限时长多模态创作智能体相关文章Silimini – AI动态照片应用,静态照片转换成生动的动态表情AI小集2Qwen3-Next – 阿里通义开源的混合架构模型AI小集3Ideogram – 免费的AI文本到图像生成工具AI小集6Ruyi – 图森未来推出的图生视频大模型AI小集3cpmGO – 面壁智能推出的首个纯端侧汽车智能助手AI小集3OLMoE – 完全开源的大语言模型,基于混合专家(MoE)架构AI小集2暂无评论再想想发表评论暂无评论…热门工具豆包LibTV绘蛙AIAiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录Nile天工短剧工作台V2FunDuck.aiPixPix泡泡AI最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!2分钟前Matrix -Game3.5 – 昆仑万维开源的实时流式交互世界模型48分钟前vivago R1- 智象未来推出的无限时长多模态创作智能体49分钟前Qwen-Audio-3.0-TTS – 阿里通义千问推出的语音合成模型14小时前MiniCPM-Robot – 面壁智能开源的具身智能 VLA 模型系列14小时前CloudBase – 腾讯云推出的全栈应用云开发平台21小时前Qwen3.8-Max-Preview – 阿里通义推出的最新一代基座模型1天前Tempolor v4.7 – 趣丸科技推出的旗舰级AI音乐生成大模型1天前Emochi AI – AI 虚拟陪伴聊天应用,海量 AI 角色沉浸式对话1天前MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型1天前JoyfulWords – AI内容创作平台,一键把想法变成文章和PPT3天前Triverse AI – AI 3D 内容生成平台,生产高精度 3D 资产3天前Wan-Streamer v0.2 – 阿里通义推出的全模态理解与生成模型4天前StaffDeck – 面壁智能等开源的企业级数字员工平台4天前Nemotron 3 Embed – 英伟达开源的文本嵌入模型系列4天前