时间:2026年7月26日
地点:GitHub 开源社区
人物:开发者 slvDev
事件详情:GitHub 用户 slvDev 近日开源项目 esp32-ai,在价值约 8 美元的 ESP32-S3 微控制器上跑通了一个 28.9M(2890 万)参数的语言模型,模型以 4-bit 量化后大小仅 14.9MB,端到端生成速度约 9.5 token/s。这是迄今在如此低成本 MCU 上部署的最大规模 LLM,参数规模约为此前 ESP32 系列上 260K 模型(260K TinyStories)的 111 倍。模型绝大部分权重(25M)以查找表形式驻留在 16MB flash 中,每次推理仅从 flash 读取约 450 字节送入 512KB SRAM 的"思考核心",整体思路直接借鉴 Google Gemma 3n/Gemma 4 的 Per-Layer Embeddings 设计。
背景:传统 MCU 部署 LLM 一直受限于 SRAM 容量——ESP32-S3 仅 512KB SRAM,过去要加载整个模型权重几乎不可能,因此社区一直停留在 26 万参数级别。Google 在 Gemma 3n 与 Gemma 4 中引入的 Per-Layer Embeddings 把大量 embedding 权重下放到 flash、只把激活所需的若干行调入 RAM,从而在手机和入门 GPU 上跑通大模型。slvDev 把同一思路移植到 MCU 的存储布局上,证明了 Per-Layer Embeddings 在嵌入式场景同样有效。
影响:
- 边缘 LLM 部署门槛骤降——8 美元开发板即可跑出近 1000 万参数的局部语言模型,AI Agent / 离线语音助手 / 智能玩具等场景的硬件 BOM 成本大幅压缩
- 模型架构创新向"非 GPU 友好"方向延伸——Per-Layer Embeddings 思路让"大模型"和"低成本硬件"不再对立
- 数据隐私 / 离线 AI 体验升级——模型完全运行在本地、零网络请求,为医疗、工业、车载等高隐私场景提供原生方案
- 开源嵌入式 AI 生态加速——为后续 50M-100M 级别 LLM 跑在 MCU 上铺平道路,未来 1-2 年可能出现"百元价位 LLM 终端"产品
总结:esp32-ai 用 28.9M 参数 + 14.9MB 4-bit 模型 + 9.5 token/s 的实测数据,把"LLM 必须依赖数据中心"这一默认假设击碎。其核心是把 Gemma 4 的 Per-Layer Embeddings 重新映射到 MCU 的 flash/SRAM 存储层级,仅在每个 token 处理时按需调用小段 embedding。配合 ESP32-S3 8 美元起步的成本,意味着离线 AI 助手、私密本地推理、低门槛创客硬件都将迎来一波新的应用爆发,AI 普惠从"云端订阅"走向"单机自洽"的拐点正在临近。
参考来源:
- https://github.com/slvDev/esp32-ai
- https://news.ycombinator.com/item?id=49050512
- https://x.com/slvDev









