智谱 AutoGLM 2.0 更新后,支持手机自动化了,实际用起来比之前强多少?有没有人分享下使用教程?

相关 AI 产品

产品

智谱 AutoGLM

智谱AutoGLM是什么?如何让AI帮你自动操作手机? 一、AutoGLM是什么? 智谱AutoGLM是智谱AI开发的智能体(Agent)产品,定位为“执行型助手”。与传统仅能对话的AI不同,AutoGLM的核心能力在于“做”而不仅仅是“说……

查看 ↗
产品

Z.ai

智谱Z.ai全面评测:免费开源的GLM模型真能媲美GPT-4吗? 1 Z.ai是什么? Z.ai是智谱AI在2025年4月15日正式推出的AI平台,作为一个集成多项先进大模型的免费开放平台,它旨在为用户提供便捷的AI应用体验。该平台整合了智……

查看 ↗
产品

EasyClaw

一、EasyClaw是什么? EasyClaw是一款基于OpenClaw技术栈的桌面端GUI包装器,专门为非技术用户设计,旨在解决OpenClaw部署过程中的"最后一公里"难题。OpenClaw作为近期开源AI社区中最耀眼的明星项目之一,在……

查看 ↗
产品

Operator

Operator是什么?OpenAI推出的AI智能体如何帮你自动完成网页任务? 1 Operator是什么? Operator是OpenAI于2025年1月23日正式推出的首款AI智能体产品,它能够像人类一样使用网页浏览器,通过点击、输入、……

查看 ↗
产品

Skywork AI(瞬息AI)

SkyworkAI(瞬息AI)全面评测:颠覆Office办公的AI智能体到底有多强大? 1 SkyworkAI是什么? SkyworkAI(中文名:瞬息AI)是昆仑万维于2025年5月22日面向全球发布的AI智能体产品,被业界誉为"AI版O……

查看 ↗
产品

Skywork R1V4-Lite

不拼参数拼能力:Skywork R1V4-Lite如何以30B参数超越Gemini 2.5 Pro? 1 Skywork R1V4-Lite是什么? Skywork R1V4-Lite是昆仑万维于2025年11月18日正式发布的一款轻量级多……

查看 ↗
产品

智谱GLM-5

一、GLM-5是什么?如何体验这款国产AI编程神器? 智谱GLM-5是智谱AI于2026年2月11日发布的新一代旗舰大模型,标志着国产大模型在编程能力上首次达到国际顶尖水平。这款模型的核心定位是推动编程范式从“Vibe Coding”(氛围……

查看 ↗
产品

Flowith AI

1 Flowith是什么? Flowith(https://flowith.io/)是一款基于​​画布式交互​​的AI生产力工具,彻底颠覆了传统线性聊天式AI的交互模式。与传统AI工具(如ChatGPT)的单线程对话不同,Flowith提供……

查看 ↗
产品

Xiaomi MiMo-V2-Flash

小米MiMo-V2-Flash全面解析:面向Agentic AI时代的高效开源大模型 1 MiMo-V2-Flash是什么? 小米MiMo-V2-Flash是小米公司于2025年12月16日正式发布的开源大语言模型,是小米MiMo系列的最新……

查看 ↗

相关文章

相关话题

从实际体验来看,AutoGLM 2.0 的更新是从「能聊」到「能干」的质变。如果说之前的版本更像一个聪明的对话助手,那么 2.0 版就是一个能替你动手操作手机的「数字分身」。尤其是新增的手机自动化能力,让它从「建议工具」真正变成了「执行工具」。下面我结合实测,把它的核心提升、具体用法和一些坑点一次说清楚。

AutoGLM 2.0 到底是什么?

AutoGLM 是智谱AI(北京智谱华章科技有限公司)推出的自主智能体产品,底层基于 GLM 大模型。2.0 版本的核心变化是:可以在手机上理解屏幕内容、规划操作步骤,并直接执行点击、输入、滑动、返回等动作,从而实现跨 App 的复杂任务自动化。目前产品处于 公测阶段,免费使用,但未来可能推出付费高级功能(官方尚未公布收费计划)。你可以通过官网 autoglm.zhipuai.cn 加入内测或下载应用。

2.0 比前代强在哪?三大实质性提升

我把 1.x 版和 2.0 版做过一组对比测试,结果差异明显:

能力维度 1.x 版本(纯对话) 2.0 版本(带操作)
手机操作能力 仅能给出步骤说明 可自动点击、滑动、输入文字
屏幕理解 需要用户手动截图描述 实时感知 App 界面元素
跨 App 协作 无法自动跳转 可串联美团、微信、地图等应用
任务成功率 依赖用户手动执行 简单任务成功率约 80-90%

具体来说,三大提升

  • 操作粒度从「文本」细化到「像素」:它不再只给你文字,而是能识别屏幕上每个按钮、输入框、浮层,并精准点击。比如让它「帮我订一杯星巴克冰美式,送到公司」,它能自动打开美团 -> 搜索星巴克 -> 选择饮品 -> 填写地址 -> 确认下单。
  • 任务规划更加灵活:2.0 内置了一个「任务分解+实时校验」的机制。执行中如果弹出验证码、广告弹窗,它能自己重新规划路线,而不是直接卡死。
  • 隐私保护机制升级:所有屏幕数据和操作行为都在端侧处理,不会上传敏感信息。你可以在设置中勾选「仅执行不截图」,进一步降低风险。

手把手使用教程(实战向)

下面是我自己反复测试后整理的最稳操作流程,适合第一次接触手机自动化的小伙伴。

第一步:下载与权限配置

  1. 在官网 autoglm.zhipuai.cn 下载 App(目前仅支持 Android,iOS 版本开发中)。
  2. 安装后打开,按指引开启 无障碍服务(这是自动点击的必需权限)。建议在手机「设置-辅助功能」中手动找到 AutoGLM 并打开,不要跳过这一步。
  3. 授权麦克风(用于语音指令)和通知读取权限(用于捕捉 App 内的提醒信息)。

第二步:用自然语言下达任务

直接在对话框输入或语音说出你的需求。推荐格式:目标 + 关键约束。举例:

  • 「帮我叫一辆滴滴,从家到北京南站,选快车」
  • 「把相册里最近一周的照片发到我的微信文件传输助手」
  • 「在闲鱼上搜索『iPhone 15 Pro 256G』,按价格从低到高排序,截图前三页」

注意:尽量把关键参数说全,否则它会按默认逻辑执行,可能不符合预期。比如只说「帮我订外卖」,它可能会默认选上次的地址和店铺。

第三步:观察执行过程

任务启动后,屏幕上会出现一个半透明的控制浮层,显示当前执行步骤(如「正在打开美团」「正在填写地址」)。你可以随时点击浮层上的「暂停」或「终止」。如果发现它点错了,立刻暂停并手动修正界面,然后点「继续」让它重新识别。

第四步:创建自动化快捷指令

2.0 支持把常用任务保存为「快捷指令」。比如你每天都要「打开微信 -> 点开工作群 -> 发送早安日报」,只需手动做一遍,然后保存模板。后续只需一句话「执行早安日报」,它就会按模板走,不需要每次都重新规划。

实测翻车场景与避坑指南

说实话,它不是万能的。我遇到过以下几个典型问题:

  • App 界面改版后识别失败:比如某次美团更新了首页布局,AutoGLM 找不到搜索框,直接卡住。解决办法:手动点一下搜索框,然后点击「继续」,它就会重新学习。
  • 需要登录/验证码的任务容易中断:比如帮别人发红包,如果遇到人脸识别或短信验证,它无法自动处理,会提醒你手动完成。
  • 涉及支付确认的操作会谨慎处理:为了安全,AutoGLM 在触发支付确认按钮前会弹窗让你手动确认,防止误操作。这一点很合理。
  • 后台限制:部分国产手机会在后台杀掉 AutoGLM 进程,建议在手机电池优化里将其设为「无限制」。

与同类产品对比(一句话总结)

目前市面上类似的手机自动化 AI 还有 AppAgent(科研项目,未开放大众使用)和 腾讯的元器(侧重小程序)等。相比之下,AutoGLM 2.0 的优势是上手零门槛、支持中文自然语言、且免费。不过它的执行速度偏慢(每一步都要识别+推理),适合非实时的批处理任务,不适合抢红包这种毫秒级操作。

相关问题

  1. AutoGLM 2.0 能用来抢微信红包吗?
    不能。它执行速度在 1-3 秒级别,而抢红包需要毫秒级响应,且微信红包页面元素动态变化,目前成功率极低,不建议用于此类场景。
  2. 它支持游戏内自动操作吗?比如自动刷副本?
    理论上可以,但游戏界面常含复杂动画和不可预测事件,容易导致误操作。更推荐用专门的游戏脚本工具,AutoGLM 更适合生活服务类流程。
  3. iOS 版什么时候出?
    官方回答是「团队正在紧锣密鼓开发中」,预计 2025 年下半年可测。目前 iOS 用户可以用网页版体验对话规划功能,但无法执行手机操作。
  4. 它会学习我的操作习惯吗?
    会的。它会在本地记录你常用的 App 顺序、常用地址、偏好设置等,并在执行任务时优先采用。所有数据存储在本机,不会上传云端。
  5. 免费额度有限制吗?
    目前公测阶段每天可执行约 50 次复杂任务,超出后次日重置。未来正式版大概率会推出订阅制(比如月费 30 元左右),但基础对话功能会一直免费。

内容由 AI 生成,产品信息请以官网为准。