新闻
评论区
评论区苹果MacBook Pro外接iPhone 17 Pro Max运行AI模型,预填充性能最高提升44%
配图:评论区苹果MacBook Pro外接iPhone 17 Pro Max运行AI模型,预填充性能最高提升44%
新闻导读
评论区苹果MacBook Pro外接iPhone 17 Pro Max运行AI模型,预填充性能最高提升44%夜间开深色模式刷天文专题特别有氛围,示意也清楚。图示和类比都挺到位,读完往往能记住核心观点,而不是只剩“好神奇”。导出长图给不爱装应用的长辈,关键信息还在。在心理健康话题上,克制本身就显得专业。有问题就来翻,有收获就收藏,节奏刚刚好。细节体验也在线,长时间用不会觉得被敷衍。
IT之家 10 月 4 日消息,Qwen3.8‑27B 是一款性能不错的人工智能模型,但前提是设备拥有足够的显存与系统内存。搭载 M4 Pro 芯片的 MacBook Pro 仅有 24GB 统一内存,在运行该 AI 模型时,预填充速度会因此受到限制。据 Wccftech 报道,有一名用户通过 USB‑C 接口将 iPhone 17 Pro Max 外接至这台便携 Mac 电脑上,并借助自制软件,使得该 AI 模型的预填充性能最高提升了 44%。
IT之家注意到,为突破这台 Mac 24GB 统一内存的上限,Reddit 用户“u/StayLameBro”采用两种方式,把运算任务拆分交给 Mac 本机和 iPhone 17 Pro Max 协同处理。针对预填充加速,MacBook Pro 负责处理每一批 256 个 token 当中的第 1 至 40 层,再将激活值数据流传输到手机端;与此同时,iPhone 利用 A19 Pro 的 GPU 运行第 41 至 64 层,而 Mac 这边则已经开始处理下一批数据。依靠 GPU 运算,手机端的运行速度相比不使用 GPU 时提升约 2.4 倍。
整套方案里,神经网络引擎也没有闲置。每 16K 长度的旧上下文会被编译为一套神经网络引擎模型。在 140K 上下文长度下,相较于仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒缩短至 176 毫秒。拿将一份 2000token 的文件预填充并保存会话这项任务来看性能表现:上下文设为 8K 时,仅靠 Mac 本机的速度是每秒 132 个 token;外接 iPhone 之后达到每秒 177 个 token,性能提升 35%。上下文设为 16K 时,速度从每秒 109 个 token 上涨至每秒 157 个 token,增幅高达 44%。
当上下文窗口设置为 32K 时,预填充速度从每秒 101 个 token 提升至每秒 130 个 token,性能改善 29%。把 iPhone 17 Pro Max 外接在 M4 Pro 版 MacBook Pro 上,使用这套自制软件,按理可以得到十分出色的预填充速度。可惜正如这名 Reddit 用户指出的,现实并没有这么美好,这套方案还存在若干局限。举例来说,在 64K 以内的场景,手机并不会加速文本生成,文本生成的工作依旧全部交由 Mac 完成。
另外值得一提的是,驱动 iPhone 18 Pro 以及 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大的性能余量。一方面它本身的整体性能更强;另一方面它配备双 16 核神经网络引擎。据称,针对专门适配神经网络处理器的任务,这款引擎的数据吞吐能力甚至超过该系统级芯片内置的 7 核 GPU。这套自制软件目前已经开源,可以在 GitHub 上下载,项目名称叫作“backburner”。
即便仅仅作为一项实验,也能够看出预填充速度提升带来的收益相当可观。后续自然还有继续挖掘性能潜力的空间;不过这或许也意味着,未来 iPhone 这类设备也有可能步入和内存、固态硬盘一样的供货紧缺阶段。
网友观点
查找体验意外地好,搜完相关条目会串成一条线,不再是散落的冷知识碎片。大话题能串成小课,读完有脉络,不是散落的信息碎片。很多生活现象背后的原理讲得清楚,不装腔作势,也不故意卖萌到尴尬。概念关系图帮助把术语放到网络里,不再孤立背词。大人补课不掉价,小孩问为什么也好用,双方都受益。
免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://www.gxycedu.cn/sitemap.xml?id=ou1snc-787719


评论区
热门讨论 · 占位展示期待你的精彩发言。