时间:2026 年 10 月 4 日
地点:美国/Reddit r/LocalLLaMA 社区
人物:Reddit 用户 u/StayLameBro(开发者),开源项目 backburner 作者
事件详情:开发者通过 USB-C 数据线将 iPhone 17 Pro Max 外接至搭载 M4 Pro 芯片、配备 24GB 统一内存的 MacBook Pro,借助自研开源工具 backburner 将阿里通义千问 Qwen3.8-27B 大模型的推理任务拆分为两部分——MacBook Pro 负责每个 256 token 批次的前 40 层神经网络计算并把激活数据流传输至手机,iPhone 则利用 A19 Pro 芯片的 GPU 运行第 41 至 64 层,与此同时 Mac 启动下一批数据。实测显示,16K 上下文下模型预填充速度从每秒 109 个 token 提升至每秒 157 个 token,性能提升达 44%;8K 上下文从每秒 132 个 token 提升到每秒 177 个 token(+35%),32K 上下文从每秒 101 个 token 提升到每秒 130 个 token(+29%)。在 140K 超长上下文场景下,单 token 写入耗时从 279 毫秒压缩到 176 毫秒,借助神经网络引擎还可把上下文扩展到 196K-229K token。backburner 是 llama.cpp 的 fork,通过 MIT 协议在 GitHub 开源,工具一行 curl 命令即可安装。
背景:24GB 统一内存的 MacBook Pro 在本地运行 27B 参数大模型时,预填充阶段(读取输入提示词)会遭遇严重的内存带宽瓶颈;A19 Pro 芯片具备神经网络引擎、Metal 4 张量运算 GPU 矩阵单元,原本定位为手机 SoC,本次被开发者改造为大模型推理协处理器。MacBook Pro 与 iPhone 之间通过 10Gb/s USB-C 线缆连接,模型后半段约 5.1GB 被复制到手机上。
影响:这是大语言模型推理领域首次实现消费级手机与笔记本电脑的流水线式协同计算。它把单台设备的内存上限扩展为双设备算力之和,让普通用户以不到 2000 美元的总投入获得接近专业级 GPU 集群的预填充性能。开源社区已开始把 backburner 的协同范式应用到其他本地 agent 场景,预填充加速可显著缩短编码 agent 读取大文件、长会话上下文的等待时间。同时也意味着未来 iPhone 等设备可能进入和内存、固态硬盘一样的供货紧缺阶段。
总结:开源工具 backburner 让 iPhone 临时充当 MacBook Pro 的"第二块 GPU",把消费级硬件的协同计算潜力展示给开发者社区,为本地 AI 推理提供了低成本、可扩展的新路径。
参考来源:
1. https://m.ithome.com/html/1009586.htm
2. https://wccftech.com/iphone-17-pro-max-m4-pro-macbook-pro-44-percent-faster-prefill-27b-ai-model
3. https://post.smzdm.com/p/aomvlo0n/
4. https://traictory.com/news/2026-10-04-iphone-second-gpu-backburner
5. https://mindpattern.ai/f/28416
6. https://www.myzaker.com/article/6ac1d81f8e9f09566537939a
7. https://github.com/StayLameBro/backburner







