MMSkills Skill:把视觉 Agent 操作能力技能化的开源框架

总结

MMSkills 是一个将视觉 Agent 轨迹转化为可复用多模态技能包的开源框架,每个技能由文本流程、运行时状态卡和多视角视觉关键帧组成。与纯文本技能不同,MMSkills 让 Agent 在执行任务时能够”看见”当前界面状态,对照技能包中的视觉证据做判断,而不是靠猜测。2026 年 5 月发布后即登顶 Hugging Face Daily Papers 榜首,目前开源库已收录 515 个跨桌面系统的技能,覆盖 Ubuntu、macOS、VAB-Minecraft 和 Mario 等环境,benchmark 中 Qwen3-VL-8B 在 OSWorld 上提升 +14.62 分,是当前视觉 Agent 技能化方向最值得关注的新项目。

功能与原则

MMSkills 解决的核心问题是:当前视觉 Agent(如 GPT-4o、Qwen3-VL)在 GUI 操作时容易”看不见自己在干什么”——纯文本指令无法描述当前界面的具体状态,导致 Agent 重复点击、选错菜单或卡在中间步骤。

MMSkills 的设计原则:

  • 多模态证据驱动:技能包包含视觉关键帧,Agent 实时截图与技能中的状态截图对比,判断当前步骤是否正确
  • 分支加载(Branch Loading):Agent 在决策点临时开启技能分支,加载相关技能文件,获取结构化指引后返回主分支继续执行,避免技能信息撑爆主上下文
  • 技能即轨迹蒸馏:从公开的 Agent 轨迹数据中自动生成技能,而非人工撰写——训练数据来源于 OSWorld 评测轨迹,覆盖真实桌面操作
  • 模型无关:适配任意支持截图输入的视觉语言模型,不绑定特定 API

认可度

  • Hugging Face 排名:2026 年 5 月 18 日登顶 Hugging Face Daily Papers 榜首
  • 技能库规模:515 个 MMSkills,覆盖 Ubuntu 桌面、macOS、VAB-Minecraft、Super Mario Bros. 多个环境,包含 Chrome、GIMP、LibreOffice Calc/Impress/Writer、Thunderbird、VLC、VS Code 等主流应用
  • Benchmark 提升(OSWorld,视觉 Agent 桌面操作标准评测):
Model No Skill MMSkills Gain
Gemini 3.1 Pro 44.08 50.11 +6.03
Gemini 3 Flash 36.65 47.97 +11.32
Qwen3-VL-235B 21.34 39.17 +17.83
Qwen3-VL-8B-Instruct 10.78 25.40 +14.62
  • 论文引用:arXiv:2605.13527,已发布在 Hugging Face Papers
  • 生态适配:已支持 Codex、OpenClaw、Claude Code 三大主流 AI 编程 Agent

链接

GitHub(核心代码):https://github.com/DeepExperience/MMSkills

GitHub(Agent 适配器 + 技能库):https://github.com/zkangning/MMSkills_for_Visual_Agents

项目主页:https://zkangning.github.io/MMSkills_for_Visual_Agents/

技能库检索页:https://zkangning.github.io/MMSkills_for_Visual_Agents/skills.html

Demo 视频对比:https://zkangning.github.io/MMSkills_for_Visual_Agents/cases.html

Hugging Face 数据集:https://huggingface.co/datasets/zhangkangning/mmskills

原作者

Kangning Zhang(张康宁)及其团队,项目隶属于 DeepExperience 研究组织,同时在 GitHub 上以 zkangning 账号维护配套的技能库和适配器。该团队专注于多模态 AI Agent、视觉语言模型和桌面自动化研究,论文作者还包括 Shuai Shao、Qingyao Li、Jianghao Lin 等,分布于多所高校和研究机构。

介绍

传统的 AI Agent 技能(Skill)多以纯文本 Markdown 形式存在,告诉 Agent”做什么步骤”,但无法描述”当前界面长什么样”。当你让 Agent”打开 Chrome 书签管理器”时,纯文本技能只能描述操作路径,无法告诉 Agent 当前屏幕上是哪个菜单、哪个按钮处于高亮状态——Agent 只能靠猜测,错了就陷入重试循环。

MMSkills 的核心创新是把视觉状态直接嵌入技能包。每个 MMSkill 包含三部分:SKILL.md(文本流程描述)、运行时状态卡(Runtime State Cards,截图+状态描述)、多视角视觉关键帧(Visual Keyframes,操作前后的界面截图)。当 Agent 执行任务时,运行时系统会比较当前屏幕与技能中的状态卡,判断是否进入正确的操作分支。

在技术实现上,MMSkills 从 OSWorld 公开评测轨迹中自动提取成功案例,合并同类轨迹形成技能草稿,再经过人工审核后收入 Hugging Face 技能库。Agent 在推理时不需要加载全部 515 个技能——系统通过 skill_skill_top_k 参数只取最相关的 6 个技能包,按需下载到本地缓存。

此外,MMSkills 在 2026 年 6 月新增了对 macOSWorld、VAB-Minecraft 和 GamingAgent 的 benchmark 适配器,意味着技能化方法不再局限于桌面评测,而是扩展到了 macOS 应用自动化、我的世界游戏 Agent 和游戏控制场景。

特点

  • 多模态技能包:文本流程 + 视觉状态卡 + 关键帧三合一,Agent 真正”看得见”自己在操作什么
  • 分支加载机制:轻量级技能提示常驻主上下文,需要时临时开启技能分支读取状态卡,不污染主上下文窗口
  • 轨迹自动蒸馏:从公开 OSWorld 轨迹自动生成技能,无需人工编写,降低技能构建成本
  • 模型无关设计:支持 GPT-4o、Gemini、Qwen3-VL 等任意视觉语言模型,不绑定特定 API
  • 跨平台技能库:515 个技能覆盖 Ubuntu、macOS、浏览器、办公套件、游戏等多种场景
  • 即装即用适配器:Codex 一行命令安装,OpenClaw 和 Claude Code 通过同一包格式复用
  • 显著 benchmark 提升:小型模型(Qwen3-VL-8B)提升幅度最大(+14.62),说明技能化对资源受限场景价值最高

使用方法

安装 MMSkills 技能适配器(以 Codex 为例)

一行命令安装到 Codex:

curl -fsSL https://raw.githubusercontent.com/zkangning/MMSkills_for_Visual_Agents/main/scripts/install_codex_mmskills.sh | bash

安装后重启 Codex,即可通过 $mmskills 指令调用。

手动安装(OpenClaw / Claude Code)

# 克隆技能库
git clone https://github.com/zkangning/MMSkills_for_Visual_Agents.git
cd MMSkills_for_Visual_Agents

# 创建 Python 虚拟环境
python3 -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt

# 安装到 OSWorld(包含运行时 + 技能 + 任务映射)
python3 scripts/install_into_osworld.py /path/to/OSWorld --with-runner --with-skills

OSWorld 评测示例

python run.py 
  --agent_type mm_skill 
  --model gpt-4o 
  --api_backend openai 
  --observation_type screenshot 
  --action_space pyautogui 
  --max_steps 20 
  --skills_library_dir skills_library 
  --task_skill_mapping_root task_skill_mappings/task_skill_mapping.json 
  --skill_mode multimodal 
  --task_skill_top_k 6 
  --domain chrome 
  --result_dir results/mm_skill_multimodal

按需搜索和下载技能

# 搜索相关技能
python scripts/search_skills.py "chrome bookmark" --package ubuntu

# 下载指定技能到本地缓存
python scripts/download_skill.py ubuntu/chrome/CHROME_Manage_Bookmarks_Reading_List_And_Shortcuts

# 查看技能内容
python scripts/inspect_skill.py ~/.cache/mmskills/skills/ubuntu/chrome/CHROME_Manage_Bookmarks_Reading

使用场景与人群

适用场景:

  • 视觉语言模型(VLM)在桌面 GUI 操作场景下的任务自动化(浏览器控制、文档编辑、文件管理)
  • AI 编程 Agent(Claude Code、Codex、OpenClaw)的 GUI 操作能力增强
  • 多模态 AI 研究:评估技能化方法对视觉 Agent 性能的影响
  • 游戏 AI:Minecraft、Super Mario 等游戏环境中的任务自动化

目标用户:

  • AI Agent 研究人员:需要标准化的多模态技能 benchmark 和评估框架
  • 视觉语言模型开发者:希望在 GUI 自动化场景下提升模型表现
  • AI 编程工具用户:希望 Claude Code / Codex 在桌面操作任务上更可靠
  • 游戏 AI 研究者:需要可复用的游戏技能库

输入与输出案例

案例一:LibreOffice Calc 图表创建

  • 输入:让 Agent”在当前表格中创建一个聚类柱状图,数据范围是 A1:D5″
  • 无技能 Agent 行为:直接插入图表,但默认范围选错(用了 A1:B5),导致图表数据不完整,需要手动回退
  • MMSkills Agent 行为:加载 skills_library/ubuntu/libreoffice/LIBREOFFICE_Create_Chart_From_Selected_Range/ 技能包,对照状态卡确认当前选区范围,视觉关键帧显示正确的选中状态,Agent 先确认选区再插入图表,一次完成
  • 效果:减少重复操作和回退次数,任务完成率提升

案例二:VS Code 安装本地 VSIX 扩展

  • 输入:让 Agent”在 VS Code 中安装当前目录下的 extension.vsix 文件”
  • 无技能 Agent:在 Extensions 面板搜索”VSIX”,没有从本地文件安装的选项,陷入尝试循环
  • MMSkills Agent:加载技能包,对照视觉状态卡确认 “Install from VSIX” 选项在哪个子菜单,视觉关键帧展示正确路径:先点三点菜单 → 选择 “Install from VSIX” → 导航到文件 → 确认安装
  • 效果:消除探索成本,Agent 行为可预期

数据来源:项目 GitHub(DeepExperience/MMSkills)、MMSkills 项目主页(zkangning.github.io/MMSkills_for_Visual_Agents)、arXiv:2605.13527,截至 2026 年 7 月。


GitHub: https://github.com/DeepExperience/MMSkills

评论区

0 条评论

登录后可评论。

查看完整榜单
查看完整榜单
查看完整榜单