昨天刷到一个开源项目让我挺兴奋的——laya-mlx,一个基于文本输出概率的分类系统,作者把它移植到了MLX框架上,号称比Jev快50倍。
先说背景。Jev是最近很火的一个轻量级分类模型,很多人拿它做文本分类、意图识别之类的任务。但Jev有个问题,就是推理速度不够快,尤其是在需要高并发的场景下。
laya-mlx的作者mizorewww做了一件事:把这套分类逻辑移植到苹果的MLX框架上,然后做了一系列性能优化。结果呢?在他的M3 Max上,这个模型能以每秒60次决策的速度玩贪吃蛇——对,就是那个经典的贪吃蛇游戏,每秒做60次方向判断。
这个速度意味着什么?如果你在做一个需要实时分类的AI应用,比如聊天机器人的意图识别、内容审核的实时过滤、或者游戏AI的决策系统,60次/秒的推理速度基本可以满足绝大多数实时场景了。
更关键的是,laya-mlx的内存占用最高只有1GB。这意味着你不需要什么高端GPU,一台普通的MacBook就能跑起来。作者在视频里展示了在本地M3 Max上运行的效果,整个过程非常流畅。
几个技术细节:
- 基于MLX框架,原生支持苹果芯片的统一内存架构
- 文本输出概率分类,不是传统的embedding+分类器方案
- 开源,代码在GitHub上:github.com/mizorewww/laya…
如果你之前用过Jev但觉得速度跟不上,或者你正在找一个轻量级的本地分类方案,laya-mlx值得试试。特别是做端侧AI应用的,这个项目的思路和实现都挺有参考价值。
不过要注意,laya-mlx目前还是一个比较新的项目,功能和稳定性可能还在迭代中。如果你要在生产环境用,建议先在测试环境跑一段时间看看效果。
30 浏览 0 评论
0 反应
















