LoHoSearch 开源后,搜索智能体评测该往真实任务靠一靠了
搜索智能体的评测,开始有点像真实工作了
美团技术团队最近开源了 LoHoSearch,一个面向 Search Agent 的评测基准。基于公开摘要可见,它想解决的问题很直接:现有一些搜索智能体评测已经被顶尖模型刷到很高分,准确率从早期的 30% 区间涨到 90% 以上后,继续拿它们区分模型能力就有点费劲了。本文由本站基于公开热点摘要整理和原创分析生成,原文来源:https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html。
分数太满,反而不好用
评测基准最尴尬的状态,不是模型分数低,而是大家都高。分数拉不开以后,研发团队很容易陷入一种错觉:看起来模型都会搜索、会浏览、会回答,但一放进真实任务,就开始在细节上漏东西。对做后端和平台的人来说,这种落差很熟悉。压测报告里接口延迟漂亮,不代表灰度一开就不会被慢查询、缓存击穿、权限边界这些小事拖住。
Search Agent 也是类似。用户不会只问一个干净、短小、答案藏在首页的问题。实际场景里,它可能要跨多个来源查证,还要处理页面变化、信息冲突、时间线不清、同名实体混在一起这些脏活。一个基准如果太快饱和,就很难告诉我们模型到底是会做搜索推理,还是刚好熟悉那套题型。
知识图谱像一把比较硬的尺子
LoHoSearch 的看点在于用知识图谱校准搜索智能体能力。摘要没有展开技术细节,我不补编实现方案,但这个方向本身挺实际。知识图谱至少能把“答案对不对”从纯文本相似度里拉出来一部分,让评测更接近实体、关系和路径的验证。搜索任务里,最怕模型把看起来相关的段落拼成一个顺口答案,读着没毛病,落库或者给用户决策时却是错的。
如果这类评测以后进到团队选型流程,我会先看两件事。第一,它能不能覆盖我们业务里的长尾查询,比如别名、历史版本、跨语言资料、过期文档。第二,评测结果能不能拆开看,而不是只给一个总分。生产环境排障时,总分没什么用,具体是检索漏了、网页解析坏了、推理链断了,还是引用来源不可靠,才决定谁来修、怎么回滚。
真正麻烦的不是会搜,而是能不能接得住
搜索智能体听起来像一个应用层能力,但落地时会牵到很多基础设施问题。抓取频率怎么控,外部站点失败怎么降级,缓存多久合适,搜索过程要不要全链路记录,用户问到敏感内容怎么审计,这些都不在演示视频里,却会出现在值班群里。小团队更要小心,模型能力强一点当然好,但如果它每次任务都要烧很多 token、跑很久、调用一堆外部页面,成本和稳定性很快会变成主问题。
所以我更愿意把 LoHoSearch 这类基准看成一块“上线前的试金石”,而不是排行榜玩具。它提醒我们,Search Agent 的进步不能只看答题分数,还要看复杂任务里有没有稳定的证据链。对普通团队来说,短期内不一定要自己训练或改模型,但可以借这个思路改内部验收:挑一批真实问题,保留来源、步骤和失败原因,让模型在接近线上环境的条件下跑。分数好看可以加分,能解释为什么错,才更适合进生产。