时间:2026年8月8日
地点:美国(Pokee AI 公司)
人物:Pokee AI 研究团队;创始人朱哲清
事件详情:
Pokee AI 于 8 月 8 日发布 Pokee-Isaac 28B 模型,这是一款专为 Agent 任务设计的 28B 参数纯文本基础模型,原生支持 1000 万 token 上下文窗口,单卡 B200 即可部署运行。该模型主打"客户边界内"部署,可在企业 VPC、本地数据中心或终端设备上运行,数据全程不离开客户网络。Pokee 团队在 RULER 长上下文评测中以 10M 长度 93.3% 得分位列榜首,GPT-5.6 Luna 与 Gemini 3.5 Flash Lite 在 512K 后出现上下文溢出。在 BFCL v4 函数调用基准上 Isaac 以 70.94 分领先 GPT-5.6 Luna 的 70.61 分,τ³-bench 四域平均 0.662 同样为全场最高。
背景:
Pokee AI 由前 Meta 应用强化学习部门负责人朱哲清于 2024 年 10 月创办,团队主打"强化学习驱动的 Agent"技术路线,已于 2025 年 10 月发表 PokeeResearch-7B 论文,验证 7B 参数小模型在深度研究任务上的能力。Isaac 28B 是公司首次推出企业级长上下文 Agent 模型,旨在解决金融、医疗、政务、法务等受监管行业无法将数据上传第三方云的痛点。模型原生支持 vLLM 与 SGLang Day-0 部署,官方列出可在 RTX 4090 单卡起跑、Intel Arc Pro B70、Core Ultra Series 3 与高通 Snapdragon X2 Elite 上运行,覆盖云端 GPU 与边缘 NPU 全栈硬件生态。
影响:
- 让金融、医疗、政务、法务等数据不能出域的企业首次拥有可在本地运行的 10M token 级 Agent 模型,单卡部署大幅降低合规 AI 推理门槛
- 单 B200 即可吞吐 13.7 万 token/秒预填,TTFT 在 1M token 时 23.6 秒、10M token 时 72.9 秒,长上下文推理成本明显低于云端订阅价 $0.15/百万输入 token、$1.00/百万输出 token
- 行业云端长上下文基线如 GPT-5.6 Luna、Gemini 3.5 Flash Lite 在 1M 以上即出现上下文失效,Isaac 直接填补 10M 段的评测与部署空白
总结:
Pokee-Isaac 28B 是 2026 年 8 月长上下文 Agent 模型赛道的重要里程碑,把 10M token 这一过去只在 Llama 4 Scout 等极少数模型上亮相的窗口,拉到了企业客户边界内、单卡可跑的实用门槛。Pokee AI 用强化学习底座切入 Agent 推理层,瞄准的正是大模型 API 无法覆盖的合规与私有部署市场。如果该模型能在企业真实工作流中兑现 BFCL、τ³-bench 上的领先表现,将推动"Agent 模型可私有部署"成为受监管行业的新标配,对当前以云端 API 为主的 Agent 服务格局形成实质冲击。
参考来源:
- https://www.marktechpost.com/2026/08/08/pokee-ai-releases-pokee-isaac-28b-a-10m-token-context-agentic-model-built-to-run-inside-the-customer-boundary/
- https://pokee.ai/
- https://console.pokee.ai/model
- https://console.pokee.ai/
- https://www.leiphone.com/category/ai/vwGwJe9UAAQ6HRCJ.html
- https://www.toutiao.com/article/7498650829705036297/