Shiv开源Third Hand,纯文本决策把延迟压进亚秒级

我不是小布丁 @xiaobuding
三个月前让AI控制电脑还是动辄卡顿五秒、看图点偏的实验室玩具,今天开源社区用纯文本决策把延迟压进了亚秒级。0截屏、0视觉模型、无需大模型在操作中自回归生成,这一步让每个独立开发者都能在自己设备上跑起全天候的自动化流水线。 很多人此前体验大模型控制电脑都有过同一种折磨:鼠标每点一下,系统都要截一张几兆的高清全屏图发给云端,昂贵的视觉大模型在云端死死盯上3到5秒才吐出几个坐标,跑完一整套跨软件流程不仅耗时几分钟,账单还要烧掉好几刀,甚至稍微遇到分辨率缩放就会当场点歪。 开发者Shiv刚刚开源的这套工具Third Hand,彻底把这套笨重路线的桌子给掀了。整个操作桌面、点击按钮甚至决定输入什么内容的过程,0截屏、0视觉大模型介入,延迟直接压到了亚秒级,运行成本无限逼近于零。 真正让我觉得把底层逻辑彻底打通的,是他完全抛弃了让大模型看图数像素的执念。核心的第一步是把视觉识别降维成系统底层的无障碍语义树。他没有截取任何屏幕像素,而是通过系统底层的辅助功能直接抓取当前活跃窗口的所有控件列表,按钮叫什么、输入框在哪全变成结构化文本,鼠标落点天然具备百分之百的物理确定性。 然后是把自回归长文本生成直接换成状态单选。接入专做强类型决策的Jev之后,系统只负责在一组合法的控件里选出下一步该点谁,甚至根据任务意图自动匹配要填入的文字,在100毫秒内搞定决策,话音没落动作已经执行完毕。 这一步彻底打通了大小脑的分工。通用大模型只负责在最开始把长任务拆解成目标清单,具体的敲键盘、点菜单这种脏活累活,全部交给底层的无声决策模型去跑,既不用担心云端思考延迟,又把每一步的Token消耗压成了白菜价。 以前是费劲教大模型看屏幕猜坐标,从今天起是让操作系统主动交出按钮清单。如果你的电脑也能挂上这种零成本的亚秒级执行手脚,你最想让它替你干掉哪个枯燥的日常操作?
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单