-
aaideit_admin 管理员
Keenable AI开源NEEDLE:每小时重建查询集的实时搜索基准测试
当被测对象可以查阅答案时,如何对网页搜索API进行基准测试?搜索智能体拥有获取工具。如果黄金标签存在于公共数据集中,智能体可以在评估过程中下载它们并完全跳过检索。当答案已经编码在模型的参数记忆中时,也会产生类似的问题:正确的回答不再证明网页搜索有效。
Keenable的方案是NEEDLE——一个实时开源基准测试,从新鲜公共源重建查询集,而非冻结单一数据集。新闻查询每小时从RSS订阅和Google Trends重新生成;金融、学术、法律和罕见实体查询每天从SEC XBRL、arXiv、Europe PMC、CourtListener和公共智能体日志重新生成。
NEEDLE架构
NEEDLE代表News、Everyday、Expert、Deep-tail和Legal Evaluation(新闻、日常、专家、深度尾部和法律评估)。每个垂直领域模拟不同的智能体意图:
- 新闻:从约124个精选RSS源和Google Trends中提取最新条目生成关键词查询
- 金融:从Wikidata和GLEIF查询注册信息,以及SEC XBRL的单季度10-Q表格
- 学术:将一篇论文转化为四种查询风格:降级标题、仅全文细节、自然语言线索、犹豫的似曾相识描述
- 深度尾部:从DeepResearchGym、OpenResearcher和LRAT等公共智能体轨迹发布中采样罕见词查询
- 法律:从14个联邦法院和eCFR章节提取最新的CourtListener意见
评分机制
评分沿相同线路分裂。新闻和深度尾部没有单一正确答案,因此LLM裁判对每个结果评级0到4,工具报告nDCG@5并带有重复URL惩罚。金融报告answer-recall@5:事实是否在顶级5摘要内到达智能体。学术和法律是已知项目任务,通过标识符匹配评分。
性能表现
数字显示7天平均值(截至2026-08-28)。金融接近解决:Exa 0.910,Keenable 0.872,Perplexity 0.871,Google 0.847,对抗0.965的终极上限。学术分散,Keenable 0.774对Tavily 0.310对抗0.869上限。深度尾部最难且最接近真实智能体流量:Exa以0.557领先,Keenable紧随其后0.470,Bing仅0.199。
延迟是另一个重要指标,因为智能体每个任务调用搜索数十次。Keenable-realtime 193ms p50 / 284ms p95,Exa 1,876 / 2,955,Bing 2,767 / 9,381。
本文源自「MarkTechPost」