配了三年 AI 推理,每次都要为 GPU 服务器买单——今天 WebLLM 把这件事从根上变了,LLM 直接跑在浏览器里

隐私敏感场景里,让 AI 处理一段会议记录,你敢不敢把录音上传到第三方服务器?医疗、法律、金融领域,这个问题卡了很多人很久——但其实 2026 年的浏览器,已经可以直接跑 LLM 了,零网络延迟,零服务器账单,数据从来不用离开用户的设备。

这件事靠的是 WebLLM。

旧路子走到头了

跑 LLM 的常规做法是调 API——OpenAI、Google、Anthropic 的接口,把用户数据发到云端,模型返回结果。稳定是稳定,但有三个绕不开的问题:

成本。 一次对话消耗的 token 数量乘以单价,大规模使用场景下账单涨得很快。有团队测算过,面向用户的 AI 功能里,推理成本可以占到整体服务成本的 60%~70%。

延迟。 数据往返一趟,50ms~200ms 是正常的。对话式 AI 还好,如果是实时翻译、屏幕阅读器辅助、输入法联想这类场景,每多 100ms 用户都能感受到。

隐私。 用户数据在服务器端留存,这件事在很多行业是不合规的。医疗病历、法律咨询记录、财务流水——这类内容根本不该上云,但很多产品又需要 AI 能力。

WebLLM 怎么做的

WebLLM 是 MLC(Machine Learning Compilation)团队做的开源项目,把 Llama、Phi、Gemma 这些主流 LLM 直接编译成能在浏览器里跑的形式,底层靠 WebGPU 加速。

核心代码不到 10 行:

import { CreateMLCEngine } from "@mlc-ai/web-llm";

const engine = await CreateMLCEngine("Phi-3.5-mini-instruct-q4f16_1-MLC", {
  initProgressCallback: (progress) => {
    console.log(`Loading: ${progress.text}`);
  }
});

const reply = await engine.chat.completions.create({
  messages: [{ role: "user", content: "用一句话解释量子计算" }],
  temperature: 0.7,
  max_tokens: 128,
});
console.log(reply.choices[0].message.content);

模型文件在首次加载后缓存到 IndexedDB,后续直接读缓存,零网络请求。实测数据(M2 MacBook Air + Chrome 130):

设备 tok/s
M2 MacBook Air Chrome 70~80
M2 MacBook Air Safari 18 50~60
iPhone 15 Pro Safari 18 18~22
$300 Chromebook Chrome 4~6

3B 参数量化模型(Q4)在高端设备上能跑到每秒 70 个 token,日常交互已经可用。不是要替代云端 API,而是把必须上云的场景压缩到真正需要的时候。

三个真正能用上的场景

医疗记录处理。 诊疗记录不离开医院内网,本地跑 LLM 做结构化提取,生成摘要、标注异常项,完全不离院。

法律文档辅助。 合同条款分析、合规检查这类任务,涉及大量商业机密,本地推理保证了数据主权。

离线 AI 功能。 网络不稳定的环境里——飞机、船上、偏远工地——浏览器里跑的 LLM 照常工作,不依赖服务器。

选框架有个判断树

不是所有场景都适合 WebLLM。按需选择:

  • 对话式聊天 UI(Llama / Phi / Mistral) → WebLLM
  • Whisper、CLIP、图像分割、embeddings → Transformers.js(Hugging Face 官方,100+ 模型支持)
  • 有 NPU 的设备(2026 年新 Mac、Windows AI PC) → WebNN,比 WebGPU 再快 2~4 倍,但目前模型覆盖还小
  • 追求最小 bundle,单次任务 → Transformers.js + WASM only 模式

下一步怎么试

  1. 装 @mlc-ai/web-llm:npm install @mlc-ai/web-llm
  2. 选一个量化模型开始:Phi-3.5-mini(2GB)、Llama-3.2-3B(2GB)体积适中,主流设备跑得动
  3. 先做渐进增强:用 navigator.gpu 检测 WebGPU 支持,不支持时 fallback 到云端 API,用户无感知
  4. 模型文件走 CDN(jsDelivr 或 Cloudflare)首次加载慢,做好 loading UI

2026 年了,LLM 不一定非要跑在服务器上。

评论区

0 条评论

登录后可评论。

小智·AI工具控 15 阅读