时间:2026年10月8日,Google AI Edge团队宣布将端侧GPU推理引擎ML Drift以Apache 2.0协议开源,作为LiteRT的下一代GPU加速内核同时作为独立库发布,GitHub仓库为google-ai-edge/ml-drift。
地点:官方通过Google Developers Blog发布,覆盖移动、桌面与Web全平台;面向Android、iOS、Windows、Linux和macOS开发者。
人物:Google AI Edge团队主导开源,由Jiuqiang Tang、Raman Sarokin、Juhyun Lee、Ekaterina Ignasheva、Grant Jensen、林晨等研究员共同设计;LiteRT ML Drift GPU加速器沿用并扩展此前的TFLite GPU代理架构。
事件详情:ML Drift是一个跨平台、高性能的端侧GPU计算引擎,专门面向设备端AI/ML推理,统一抽象了OpenGL ES、OpenCL、Metal与WebGPU四种底层GPU API。核心创新包括:通过张量虚拟化(Tensor Virtualization)把逻辑张量表示与物理GPU分配解耦,使统一着色器模板在编译初始化阶段动态解析坐标,省去为每个后端维护独立着色器;新增5D张量支持,让3D卷积、Swin Transformer v2、YOLO 11n、MobileViT v2等模型无需布局hack即可直接在端侧GPU执行;为自回归LLM引入阶段感知优化,在KV缓存预填充与解码两个阶段动态切换内核与内存布局,并使用卷积对齐的KV缓存布局与核内激活量化把冗余内存往返降到最低。性能上,ML Drift GPU相比传统TFLite GPU代理平均提速1.4倍;在Gemma工作负载上比同类框架内存开销低最多12%,并支持Windows与Linux上的Dawn WebGPU原生编译,跨移动、桌面、Web使用同一套代码。引擎同时附带面向编码智能体的SKILL.md自定义算子注册指南,让开发者几分钟内即可注册并验证自定义着色器。
背景:LiteRT自2026年1月起将ML Drift整合为统一GPU加速层,本次开源是该路线的一次正式外延,让需要自建图形或推理运行时的团队也能直接复用Google的GPU内核优化成果,应对GenAI模型在消费级硅片上的算力与内存瓶颈。
影响:开源ML Drift把Google在端侧GPU加速上的工程积累直接交给整个生态,可能让PyTorch、JAX与TensorFlow模型在端侧获得更一致的高性能落地路径,并降低中小团队为自家模型维护多后端着色器的成本;结合LiteRT对NPU的统一抽象,端侧GenAI应用的部署门槛和首帧延迟有望继续下降。
总结:Google把端侧AI的GPU加速底座单独开源,意在为后续生成式模型在手机、PC、Web之间提供一致的运行时;ML Drift的速度与内存提升并不激进,但5D张量、张量虚拟化与阶段感知LLM优化这些结构性升级,可能才是它在长尾硬件上长期拉开差距的关键。
参考来源:
https://developers.googleblog.com/ml-drift-next-gen-gpu-aiml-inference-at-the-edge/
https://github.com/google-ai-edge/ml-drift
https://developers.google.com/edge/litert
https://developers.google.com/edge/litert/next/gpu
https://research.google/blog/speed-is-all-you-need-on-device-acceleration-of-large-diffusion-models-via-gpu-aware-optimizations/
https://dawn.googlesource.com/dawn
https://www.worldprogramming.org/posts/ml-drift-next-gen-gpu-aiml-inference-at-the-edge-c0bojg
https://wpnews.pro/news/ml-drift-next-gen-gpu-ai-ml-inference-at-the-edge







