jev的出现,人类语音控制电脑的时代即将来临!推荐一个实验性的开源项目macbrow,直接让你开口指挥Mac和Chrome。
在jev没有问世之前,面向大模型的computer use技术延迟太大,导致语音指挥Mac和浏览器非常不实用。jev的system one的本质,让这种成为可能。
作者本机实测:
⚡ 1.6秒:说完指令到预告片播放
⚡ 3.7秒:一句追问修改返程日期
⚡ 11秒:把吸尘器加入亚马逊购物车
遇到不会的操作,还能调用LLM写新工具,经过检查后缓存复用。Agent提速的关键,可能不是让大模型想得更快,而是少让它生成。
MIT开源,目前仍是实验原型,默认拦截删除文件、付款等危险操作,别拿主力机冒险。
项目地址:github.com/timpratim/macb…
macbrow这个项目的核心思路是把语音识别、意图理解和屏幕操作串成一条流水线。以前的语音助手比如Siri,本质上还是在手机上跑,而且只能调用预设的接口。macbrow不一样,它直接操作桌面环境,理论上可以做任何鼠标键盘能做的事情。
我试了一下,让它打开浏览器搜索某个技术文档,整个过程确实很流畅。不过有个问题,它需要先学习你的操作习惯,刚开始用的时候会有点慢。而且因为是实验性质的,稳定性还差点意思,偶尔会识别错指令。
但这个方向确实很有意思。想象一下,以后写代码的时候,直接说"帮我把这个函数重构一下",它就能自动定位代码、理解逻辑、执行修改。或者做设计的时候,说"把这个按钮往左移20像素",它就能直接操作设计工具。
目前这个项目还是MIT开源,代码质量不错,文档也挺详细的。如果你对AI桌面操作感兴趣,可以去看看源码,甚至贡献一些代码。不过提醒一下,别在主力机上跑,万一出问题就麻烦了。
话题来源 @LinearUncle
❤️31 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












