
苹果这几天连续更新了 M6、M5 Pro、M5 Max、M5 Ultra 四款芯片以及搭载它们的 Mac mini 和 Mac Studio。一句话概括苹果正式进入 2nm 时代Mac 本地跑大模型这件事从能跑变成了能认真跑。新品今天起接受预购9 月 22 日开售。这次发布的技术本质是什么先说硬件层面的变化。M6 是苹果首款 2nm 工艺芯片采用 12 核 CPU、12 核 GPU 和双 16 核神经引擎统一内存带宽最高 170GB/s多线程性能相比 M5 提升约 1.2 倍。搭载 M6 的 Mac miniAI 性能最高提升 4 倍、CPU 性能提升 40%支持 Wi-Fi 7 和蓝牙 6最高可选 32GB 统一内存同系列另一档 M5 Pro 版最高支持 64GB 统一内存和 307GB/s 的内存带宽。一口气发四款芯片、两款机器这个节奏本身就说明苹果把本地 AI 算力当成了产品主线而不是顺带升级。更大的看点是 M5 Ultra。据苹果官方介绍这是苹果首个四芯片封装架构最高 36 核 CPU、80 核 GPU统一内存带宽达到 1.2TB/s比 M3 Ultra 提升 50%。搭载它的 Mac Studio 最高可选 512GB 统一内存AI 计算性能最高提升 4.3 倍存储速度提升 2 倍四台集群还能带来最高 3 倍的分布式 AI 推理速度提升。价格方面Mac Studio 的 M5 Max 版起售价 19999 元M5 Ultra 版起售价 46999 元最高 512GB 内存版本预计 10 月底上市。苹果同时强调开发者可借助 Core ML 等框架对两款新芯片做自动优化。为什么这些数字对 AI 开发者有意义因为大模型推理最吃的是内存容量 内存带宽而不是单纯算力。苹果的统一内存架构让内存可以直接当显存用M5 Ultra 的 512GB 容量加上 1.2TB/s 带宽意味着几十 B 甚至上百 B 参数的模型可以整体装进内存里推理不需要切片、不需要频繁换入换出。这和几年前本地只能跑 7B、13B 小模型是本质区别也正好接上了开源模型一路变大的趋势——模型越做越大苹果就把本地能装下的上限一路抬高。没变的是什么生态没变。本地推理还是 Ollama、MLX、llama.cpp 那一套工具链跑的也还是那些开源模型——苹果提供的是更大的容器不是新的模型。工艺从 5nm、3nm 走到 2nm改变的是能效和密度改变的依然是一台机器能装下多大模型这件事而不是模型本身。对普通开发者意味着什么对做 AI 应用开发的打工人来说最实际的影响是本地调试成本降下来了。以前想试一个 70B 的开源模型要么租云 GPU要么在公司机器上排队现在一台 M5 Ultra 的 Mac Studio 就能全量跑开发、测试、部署同一台机器搞定。对医疗、金融、有私有代码的企业场景数据不出本机这点吸引力更大很多企业迟迟不上大模型应用卡点不是模型能力而是数据合规本地推理正好绕开了这一层。但也要清醒46999 元起步的 M5 Ultra 版不是个人消费的是公司采购的。普通开发者更多是公司买、我来用的角色省下的云 GPU 成本进了公司的账我们能拿到的是更顺手的开发环境。怎么选、怎么用、有哪些坑选配置按模型规模来大致可以这样对号入座需求建议配置跑 7B-14B 小模型、日常开发M6 版 Mac mini最高 32GB 统一内存跑 32B-70B 中大型模型M5 Pro / M5 Max全量跑 70B-100B 模型M5 Ultra512GB 版本实际跑起来很简单工具链都是现成的# 用 Ollama 直接拉模型统一内存会自动当显存用ollama pull qwen3:32b ollama run qwen3:32b# 用苹果自家 MLX 框架做本地推理实验pipinstallmlx python-cimport mlx.core as mx; print(mx.array([1,2,3]))# llama.cpp 系工具也通用按需编译 CPU/GPU 版本gitclone https://github.com/ggerganov/llama.cpp几个坑值得提前知道AI 性能提升 4.3 倍是特定工作负载下的数字拿跑分当实际收益会失望买之前用自己真实的模型任务测一遍。统一内存不是无限的显存模型超过内存容量时会走 SSD 交换速度断崖式下跌这是本地推理最容易踩的坑。512GB 版本 10 月底才上市现在预购的是 36GB-256GB 区间真有全量跑大模型需求的得等。本地开源模型 ≠ 云端旗舰模型。代码生成、复杂推理这些任务上开源模型和闭源旗舰仍有差距本地跑主要图的是数据安全和成本不是能力天花板。我的建议是先拿现有机器加 Ollama 把工作流跑通用自己项目里的真实任务对比一下模型输出确认能力满足需求再决定要不要等 512GB 版本。硬件升级解决的是跑不跑得动解决不了模型行不行。本地推理的硬件瓶颈正在一步步松绑接下来真正拼的就是模型本身了。你怎么看 Mac 本地跑大模型这条路线评论区聊聊。