搜索智能体到底有多强,过去一年基本是BrowseComp说了算。但这个标尺正在失灵——它在10个月内就把模型成绩从30%一路推到了90%,基准测试本身的意义正快速被刷没。7月17日,美团LongCat抛出了一块更硬的试金石LoHoSearch,意图把搜索智能体重新逼回爬坡区。
LoHoSearch的难题不是人写的,而是从一个囊括762万个实体的维基百科知识图谱里自动生成的。正因为这种机器生成的出身,它在搜索空间和结构复杂度上,抵达了人类标注者根本无法稳定设计出的难度上限。换句话说,过去的基准靠人脑出题,题目再难也有天花板;LoHoSearch把出题权交给图谱,难度天花板被彻底掀开。

结果相当刺眼。在11个前沿模型的测试中,最佳成绩只有34.74%,紧随其后的三个模型集中在15%到16%左右;而同一批顶尖模型在BrowseComp上眼下能拿到约90%的分数。差距之大,直观说明LoHoSearch把搜索智能体真正的短板暴露了出来。更有意思的是上下文策略的边际效用:在LoHoSearch上,最好的上下文策略只带来6.8个百分点的提升,而同样的操作在BrowseComp上能换回14个百分点——这意味着靠提示和上下文工程去补能力的老办法,在这套新基准里几乎失灵。
这套基准本身有544道问题,覆盖11个领域,问题采用树状与图结构组织,且已经开源。当老基准被刷到顶、搜索agent的真正挑战才刚开始,LoHoSearch很可能成为下一个绕不开的必测项。
教育部公布2025年科研优秀成果奖名单,蚂蚁集团旗下支付宝公司参与的两项成果获工程技术一等奖,涉及知识图谱和复杂服务系统关键技术。
深圳推出全国首个劳动争议仲裁智能辅助办案系统,实现全案由覆盖、全流程赋能和全方位支撑。该系统显著提升效率,仲裁员阅卷效率提高50%,裁决书制作时间缩短近半,整体办案周期大幅缩短,标志着人工智能与劳动仲裁结合迈出重要一步。
Stack Overflow推出企业级产品Stack Internal,通过MCP接口提供技术问答元数据及可靠性评分,帮助AI代理避免生成错误信息。CEO透露已有大型客户付费使用,商业模式类似Reddit的内容授权。
AI基础设施领域新创公司Supermemory获260万美元种子轮融资,由前Cloudflare高管创立。该公司致力于解决AI应用的“记忆”难题,通过通用记忆API处理非结构化数据并构建知识图谱,为用户提供高度个性化的上下文服务。
腾讯优图实验室开源图检索增强生成框架Youtu-GraphRAG,通过大语言模型+RAG模式将知识组织成图谱,提升复杂问答任务的准确性和可追溯性。适用于企业知识库、科研文档解析等知识密集型场景,创新实现从图构建到检索的全流程优化。

关注 “悠AI” 更多干货技巧行业动态