时间:2026 年 9 月 7 日
地点:美国雷德蒙德 / 中国上海
人物:Boxiu Li、Zimo Wen、Yijia Fan(共同一作),Microsoft Research 团队 + 上海交通大学、复旦大学、南京大学、清华大学、香港大学等校联合团队
事件详情:微软与上海交通大学联合发布并开源 Argus,一个面向长程推理任务的通用代理运行时(agentic runtime)。Argus 在 27 个研究项目、累计 1548 小时真实运行时长中完成跨领域任务,平均每 40.7 小时才请求一次人工介入,工作负载利用率 95.1%~98.7%。系统由 Manager、Planner、Engineer、Reviewer 四角色协作分工,避免代理陷入局部爬山解。基准测试上,Argus 在 SWE-Bench Pro 跑出约 78% 的成绩(Direct Copilot 为 59%,使用 token 量为 1.41 倍),在 AARRI-Bench 研究任务中达到 76.8%,数学数据合成任务取得 28.0 分的领先差。Argus 还解出困扰学界 20 年的数学猜想,并把优化过的 RWKV6 kernel 合并进上游 Flash Linear Attention 仓库。代码与运行轨迹已在 GitHub 公开,并附上业内首个数学猜想端到端筛选日志。
背景:长程推理是当前 AI Agent 的核心痛点。传统 Agent 在没有密集反馈时容易陷入局部解、重复无效尝试。Argus 通过"证据门控"的记忆、技能、流程验证器、路由决策等持久化机制,将"自我进化"与模型权重解耦,让运行时不更新模型也能累积可信经验。它同时兼容 Pi、Codex、Claude Code、DeepSeek Harness 等多套底层 harness,实现"一个任务内多种 agent 后端共存"。
影响:Argus 把"自动执行"升级为"自主研究"——从单次任务交付,进化为跨数日的多领域连续探索。这对科研自动化、企业级 Agent、GPU 算子优化、芯片设计等场景均有借鉴意义,也为 OpenAI、Google DeepMind、Anthropic 等前沿实验室正在比拼的"长程智能"竞赛提供了一条开源工程路线。
总结:微软 + 上交开源 Argus,用 1548 小时真实运行、20 年数学猜想破题、SWE-Bench Pro 78% 的硬指标,把"AI 自己搞科研"从演示推向可复现的工程现实。
参考来源:
1. Argus arXiv 论文:https://arxiv.org/pdf/2608.05144
2. Gist.Science 论文解读:https://gist.science/paper/2608.05144
3. Guavy 报道(Microsoft Unveils Evidence-Driven AI System for Long-Horizon Research Tasks):https://guavy.com/wire/stocks/microsoft-unveils-evidence-driven-ai-system-for-long-horizon-research-02Z6QVbkx3cxAQc0ZyVVWy
4. 腾讯新闻(解决 20 年数学难题!微软开源 Argus 用证据驱动 1548 小时自动研究):https://so.html5.qq.com/page/real/search_news?docid=70000021_1956a9e1a3c72052
5. Guavy 报道(Argus Enables Autonomous Research for Long-Term Agents):https://guavy.com/wire/stocks/argus-enables-autonomous-research-for-long-term-agents-1gh2lzvblxgr4UZJ7t30AE
6. C114 Pro(Microsoft and Collaborators Open-Source Argus):https://www.c114pro.com/ainews/192113.html
7. 36 氪首发(解决 20 年数学难题,微软开源 Argus):https://36kr.com/p/3972642030055688








