昊梵体育网

一根USB-C线让iPhone变身Mac外置GPU,AI预填充性能最高提升44%

如果您喜欢这篇文章欢迎大家评论区留言点个关注吧! 一根USB-C线,让iPhone变成了MacBook的"外置显卡"。1
如果您喜欢这篇文章欢迎大家评论区留言点个关注吧!
一根USB-C线,让iPhone变成了MacBook的"外置显卡"。10月4日,IT之家报道:一名开发者通过自制开源软件"backburner",将iPhone 17 Pro Max外接至搭载M4 Pro芯片的MacBook Pro,两台设备协同运行通义千问Qwen3.8-27B大模型——实测AI模型预填充性能最高提升44%。
先把这个实验的技术逻辑拆开。大语言模型的推理分为两个阶段:"预填充"(把输入的提示词一次性读完)与"生成"(逐字输出回答)。对于长篇文档或长对话场景,预填充往往占据大部分耗时——而这恰恰是可以并行的计算。这位Reddit用户的方案是流水线式分工:MacBook Pro负责每个256 token批次的前40层神经网络计算,通过USB-C接口把中间激活数据流传给iPhone;iPhone 17 Pro Max的A19 Pro芯片GPU随即接手第41至64层的计算,与此同时Mac已经开始处理下一批数据——两台设备的算力被折叠进同一条流水线。

实测数据相当可观:8K上下文长度下,预填充速度从每秒132个token提升至177个(+35%);16K上下文下从109跃升至157(+44%);32K上下文下从101提升至130(+29%)。神经网络引擎也没有闲置——每16K长度的历史上下文会被编译为一套神经网络引擎专用模型,在140K超长上下文场景下,单token写入耗时从279毫秒压缩至176毫秒。用GPU运算的手机端,速度相比纯CPU方案提升约2.4倍。
再把"预填充"与"生成"两个阶段的经济学讲透。为什么这个实验选择在预填充环节做加速?因为生成阶段的每个token都依赖上一个token的输出,天然串行,无法并行;而预填充是把整段输入并行"吞下去",计算密度高、可切分性强——把后24层切给iPhone,恰好是在不破坏串行依赖的前提下,把最重的并行计算任务"外包"了出去。这种"分层切分"(Layer Splitting)是分布式推理的经典手法,此前多用于服务器集群的多卡互联,如今被一根USB-C线复制到了桌面——技术民主化的又一个注脚。
这个实验最迷人的地方,在于它无意间揭示了一个被忽视的事实:你口袋里的iPhone,可能是苹果生态里最大的"闲置算力池"。每一代iPhone的芯片性能都在碾压上代MacBook Air,但手机形态注定了这些算力大部分时间在休眠。当24GB统一内存的MacBook Pro被270亿参数模型"卡脖子"时,8GB内存的iPhone反而因为只承担部分层级的计算而游刃有余——异构设备协同推理,把"内存墙"变成了"算力网络"。
放到行业的坐标系里看,这个实验与两条产业暗线交汇。第一条是端侧AI的内存困境:7月,美国初创公司PrismML刚把阿里270亿参数的Qwen模型压缩进iPhone 17 Pro;此前太平洋科技的实测显示,iPhone 17 Pro Max原生仅能流畅运行8B参数模型,14B以上基本无法启动——手机单机跑大模型的天花板清晰可见。而"手机+电脑"的分布式方案,等于用一根线把两个"跑不动"的设备拼成了一台"跑得动"的设备。第二条是苹果自己的伏笔:传闻中驱动iPhone 18 Pro系列的A20 Pro芯片配备双16核神经网络引擎,其在专用神经网络任务上的数据吞吐能力甚至超过芯片内置的7核GPU——这篇实验论文里特意写下的展望,几乎是为下一代iPhone预热的注脚。
当然,诚实的边界同样清晰。开发者自己指出了局限:在64K上下文以内,iPhone并不会加速文本生成,逐字输出的工作依然全部由Mac完成;整套方案是实验性质的开源项目(GitHub搜索"backburner"可下载),需要一定的动手能力;USB-C的带宽与延迟、手机持续满载的散热与功耗,都是尚未工程化的粗糙地带。它证明的是"可行性",而非"产品化"。

放到更宏观的视角,这个实验还与"存储涨价"的大周期暗合。2026年内存价格暴涨,大容量MacBook的升级成本水涨船高——而"用现有设备凑算力"的分布式方案,本质上是对硬件升级通胀的一种民间对冲:不花钱买新内存,而是盘活存量设备的闲置算力。这种"算力拾荒"思维,在消费级市场或许稚嫩,但在企业级AI infra领域已是显学——英伟达的NVLink、AMD的Infinity Fabric,玩的都是"把多个计算单元缝成一台机器"的魔术。桌面端的这根USB-C线,不过是把数据中心的哲学塞进了口袋。
对苹果而言,这个实验更像一封用户写给库比蒂诺的"需求建议书"。苹果生态的协同能力一直是其最厚的护城河,但协同的边界至今停留在"数据同步"(隔空投送、通用剪贴板、接力);而backburner证明,协同完全可以进化到"算力共享"的层级——当用户愿意自己写代码来实现这个功能时,说明需求是真实且迫切的。苹果若在未来的macOS与iOS更新中内置"设备协同推理"(哪怕只支持Mac+iPhone两设备),都将是对Windows阵营"统一内存"叙事的一次漂亮反击:你的算力不在一块芯片里,而在你的整个生态里。
对用户而言,这个实验的启示远比数字本身实用。如果你正在Mac上探索本地大模型(无论是出于隐私、成本还是折腾的乐趣),遇到内存瓶颈时不必急着换机——先检查抽屉里那台旧iPhone,它可能正以"算力外援"的身份等着被召唤。而随着苹果生态协同的深入(从通用剪贴板到如今的算力共享),"全家桶"的定价逻辑正在被重新定义:你买的不是一件件孤立的设备,而是一张可以按需组合的分布式计算网络。一个进阶提醒:此类分布式推理方案目前仅适合"折腾型玩家"与开发者,普通用户不建议在生产环境中依赖——USB-C线缆的稳定性、iPhone长时间满载的发热、以及macOS更新可能带来的兼容性中断,都是未经企业级验证的变量。它的正确打开方式是"周末实验":感受异构计算的乐趣,理解端侧AI的边界,然后静待苹果或开源社区把它打磨成开箱即用的功能。
展望后续,两个观察点值得记下:其一,开源社区对backburner的迭代速度——若有人将其封装为Mac App Store可用的图形界面应用,这个实验将从"极客玩具"走向"大众工具";其二,A20 Pro(iPhone 18 Pro)的神经网络引擎规格若真如传闻所言超越GPU,那么下一代iPhone作为"外置NPU"的协同价值将翻倍——届时苹果官方是否会顺势推出"算力接力"功能,将是WWDC 2027最值得期待的悬念之一。
【个人观点】 在我看来,这个44%是2026年端侧AI领域最动人的数字——它不属于任何一家巨头的发布会,而属于一个Reddit用户的周末实验。它证明了一件事:当行业把"更大模型"与"更强单设备"绑定时,真正的创新可能来自另一个方向——把身边所有设备的算力"缝"起来。但我也想泼两盆冷水:其一,这终究是极客的浪漫而非大众的方案——编译环境、模型拆分、带宽调优,每一道门槛都过滤掉了99%的用户;除非苹果或开源社区把它做成"一键开启"的功能,否则它只能停留在GitHub的星标里,而历史经验告诉我们,苹果对这类"野性"用法的态度向来是既不支持也不封杀,让它自生自灭。其二,这个实验无意间暴露了苹果产品线的尴尬——24GB内存的MacBook Pro连27B模型都跑不满,而手机却有空闲算力可以外借;在AI工作流成为生产力标配的今天,苹果入门款Mac的内存定价策略(8GB起步的黄金年代)正在变成对自家生态的反噬。总体而言,我乐见这种"民间智慧"对巨头形成的倒逼——当用户开始自己拼接算力网络时,离苹果官方推出"设备协同推理"功能的那一天,或许就不远了。技术的进步,从来都是这样:先有人证明"可能",再有人做成"产品",最后所有人习以为常。
免责声明:以上内容基于IT之家及公开报道整理,开源项目使用风险自担,仅供参考,不构成任何购买或投资建议。您会尝试用iPhone给Mac加速吗?欢迎评论区留言交流,喜欢本文也麻烦点个关注吧!