时间:2026年8月20日
地点:杭州(阿里巴巴达摩院/通义千问团队)
人物:阿里巴巴通义千问团队
事件详情:阿里千问大模型官方公众号8月20日正式推出Qwen-UI-Agent,一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、PC电脑端、网页端以及深度搜索(DeepSearch)环境。移动端MobileWorld得分82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9个百分点;真机基准MobileWorld-Real达92.2%,AndroidDaily高达97.5%接近满分;电脑端OSWorld-Verified达79.5%,OSWorld-v2 Partial分数40.0%且比基线节省58%执行步数;浏览器WebArena以73.6%位列所有对比模型第一;GUI定位ScreenSpot-Pro达81.5%。模型在多项GUI任务上全面对标或超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等海外旗舰。
背景:CLI、MCP等工具快速拓展智能体能力边界,但大量既有数字生态仍未工具化,GUI仍是数字世界最广泛、最通用的交互入口。Qwen-UI-Agent搭建了覆盖100+台真实手机、150+应用的真机移动环境用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准(400+任务、100+应用),打通「从模拟到真实」的最后一公里。模型支持GUI图形操作+CLI命令行混合动作,电脑任务中CLI动作占比近半,约40%动作以批量形式输出,可大幅缩短执行轨迹。支持超100步超长轨迹在线强化学习训练,约10000个并发环境同时rollout。
影响:Qwen-UI-Agent将安全判断贯穿任务执行全过程——违法或高风险请求直接拒绝并终止任务;支付、数据删除、隐私授权等敏感场景须在关键步骤主动停手、向用户说明情况并获得明确确认后才执行。模型依托Harness框架具备主动服务能力,支持手机、电脑跨设备任务接力,并可与DeepSearch深度搜索联动。这是国内首个面向真实设备场景的GUI智能体基座模型,标志着国产Agent从「工具调用」迈向「屏幕即接口」的下一代形态。技术报告已在arXiv发布(2607.28227),代码已在GitHub(Tongyi-MAI/MAI-UI)开源。
总结:Qwen-UI-Agent通过「真机训练+GUI/CLI混合动作+安全机制内嵌」三位一体的设计,将AI Agent能力从API调用层级推向图形界面操作层级。其在MobileWorld、WebArena、ScreenSpot-Pro等多个GUI基准上同时超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等海外旗舰,意味着中国AI Agent已具备在复杂真实世界环境中独立完成任务的能力,「屏幕即接口」将逐步取代「工具调用」成为下一代Agent主流形态。
参考来源:
1. IT之家 - 阿里发布 Qwen-UI-Agent,主打让模型真正「会用」每一块屏幕: https://www.ithome.com/0/992/239.htm
2. 新浪科技 - 阿里发布Qwen-UI-Agent:让模型会用每一块屏幕!手机电脑全覆盖: https://tech.sina.cn/2026-08-20/detail-ininyncp8655228.d.html
3. 凤凰网科技 - 阿里发布Qwen-UI-Agent,主打让模型真正「会用」每一块屏幕: https://tech.ifeng.com/c/8vkQXvDBufq
4. 腾讯新闻 - 阿里发布Qwen-UI-Agent,移动端基准超越GPT 5.6与Claude Opus 4.8: https://news.qq.com/rain/a/20260820A0DK0S00
5. 网易 - Qwen-UI-Agent:让模型真正「会用」每一块屏幕: https://www.163.com/dy/article/L4PVVC2T0511DDOK.html
6. arXiv - Qwen-UI-Agent Technical Report: https://arxiv.org/abs/2607.28227
7. GitHub - Tongyi-MAI/MAI-UI: https://github.com/Tongyi-MAI/MAI-UI









