热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Keenable开源NEEDLE基准 实时刷题防刷榜

# Keenable 开源 NEEDLE 实时搜索基准 防止模型作弊刷榜 ## 时间 2026-08-31 ## 地点 美国(Keenable AI 团队) ## 人物 Ilya Gusev(联合创始人、前 Amazon Alexa/AGI 团队科学家);Andrey Styskin(联合创始人、前 Yandex 搜索负责人);Matthias Petri ## 事件详情 AI 搜索 API 创业公司 Keenable AI 于 8 月 31 日开源发布 NEEDLE 实时搜索基准(News, Everyday, Expert, Deep-tail, Legal Evaluation)。 NEEDLE 突破传统静态评测的两大缺陷:搜索 Agent 可直接读取公开答案库跳过检索、模型参数记忆污染评测。它每小时从 124 个 RSS 源和 Google Trends 重建新闻查询,每日从 SEC XBRL、arXiv、Europe PMC、CourtListener 与公开 Agent 日志重建金融/学术/法律/小众实体四类查询,从根本上消除固定题库过拟合可能。 整套基准以 MIT 协议开源,支持 Python CLI 通过 `uv sync` 一键安装。同一协议下串行调用 15 个搜索 API(Keenable、Exa、Bing、Perplexity、Google、Tavily 等),统一 2000 字符证据切片、同一时段运行。 另一关键创新是"ultimate"汇总基准引擎:把 15 家 API 返回结果合并去重后作为行业理论上限,每条查询衡量"现实-上限"差距,从而分辨"排序问题"与"整个行业都搜不到"的检索短板。 7 天滚动数据(截至 2026-08-28):金融类接近解决(Exa 0.910 / Keenable 0.872 / Perplexity 0.871 / Google 0.847,ultimate 0.965);学术类 Keenable 0.774 到 Tavily 0.310 分化(ultimate 0.869);深尾类最贴近真实 Agent 场景,Exa 0.557 / Keenable 0.470 / Bing 0.199。延迟方面 Keenable-realtime p50 193ms / p95 284ms,远胜 Exa(1876/2955ms)与 Bing(2767/9381ms)。 ## 背景 搜索 Agent 化趋势下,Exa、Bing、Perplexity、Tavily 等通用搜索 API 已成 LLM 应用标配。但 BrowseComp 等老牌基准因题库固定,Agent 可下载答案跳过真实检索;甚至 MMLU 等基准因长期使用也出现选项重排后准确率显著下降的污染问题。Keenable 用 NEEDLE 给整个搜索评测体系"打了实时补丁"。 ## 影响 NEEDLE 为 Keenable 自家 1000 亿+网页索引(p95 延迟低于 250ms)提供差异化的客观评测坐标。 15 家头部搜索 API 在统一协议下被透明对比,倒逼 Exa、Google、Bing 等厂商刷新"独家基准"话术,回归真实质量竞争。 动态题库 + ultimate 汇总基准将成为智能体搜索评测新范式,被 Hugging Face Datasets、arXiv 后续工作引用概率较高。 ## 总结 Keenable 用开源 NEEDLE 把搜索评测"从期末考试改成随堂测验",每小时重建题库 + 行业 ultimate 上限,让"模型记忆刷榜"成为历史。 ## 参考来源 1. https://www.marktechpost.com/2026/08/31/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour/ 2. https://keenableai.github.io/needle/ 3. https://github.com/keenableai/needle 4. https://keenable.ai/blog/needle-the-benchmark-your-search-engine-can-t-memorize 5. https://huggingface.co/datasets/keenable-ai/needle-results 6. https://hn.today/go/FJOoj6wT 7. https://aipulselab.tech/news/keenable-ai-open-sources-needle-a-live-search-benchmark-that-rebuilds-its-query-set-every-hour-36a9e0 8. https://wpnews.pro/news/needle-rebuilds-search-benchmarks-before-engines-can-memorize-them ## 标签 Keenable, NEEDLE, AI搜索, 智能体, 评测基准, 开源, 搜索API ## URL Tag keenable needle search benchmark live queries ai agent