过去大家看GPT、Claude操控浏览器,体验其实并不好,因为真的太慢了,中间还经常卡死。让大模型写一堆长篇大论去操作网页,本质上就是杀鸡用牛刀。
在网页上点按钮,本质上就是一个离散的多选题,根本不需要AI会写诗。JEV拿到DOM结构,以做分类题的速度毫秒级选出该点的元素,只有在需要打字输入时才偶尔回退给小模型。
黑客松冠军开发者gregpr07刚刚拿JEV做了个开源的微型浏览器Agent,让它自主打开网页查机票。整个过程耗时仅仅7秒,成本只要$0.0039(折合人民币不到3分钱)。作者特意注明:演示视频是1倍速,没有任何加速剪辑。
我昨天试了一下,把JEV接入Browser Use,处理速度确实快很多。以前用GPT处理一个网页操作要好几秒,这个几乎秒出结果。而且成本低很多,对于高频调用的场景,这个优势很明显。
JEV的核心思路是把LLM从"生成文本"变成"输出决策"。很多场景其实不需要完整的文本输出,只需要一个决策结果。比如网页操作、分类、排序、判断这些任务,用JEV处理效率高很多。
对于做AI应用开发的人来说,这个模型值得试试。速度快、成本低、输出侧免费,这三个点已经能解决大部分日常需求了。
项目地址:github.com/browser-use/je…
话题来源 @SUOHA_AI
150.3K阅读 ❤️950 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应











