尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

4台Mac跑出32.5 t/s:exo 本地AI集群搭建完整指南

4台Mac跑出32.5 t/s:exo 本地AI集群搭建完整指南 4台Mac跑出32.5 t/sexo 本地AI集群搭建完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo给家里加一台机器推理反而变慢——用 TCP 组网的 llama.cpp 实测就是这样。exo 是一套把闲置 Mac 拼成本地 AI 集群的开源框架走 Thunderbolt 5 的 RDMA 链路同样的 4 台 M3 Ultra Mac Studio 反而越加越快Qwen3 235B 从单节点 19.5 t/s 升到 4 节点 31.9 t/s而 TCP 方案从 20.4 t/s 掉到 15.2 t/s。下面把它的原理、硬件门槛、部署步骤和真实基准数据一次讲清楚。 先看懂数据加机器为什么可能变慢这张图来自 4 台 M3 Ultra Mac Studio 的实测黄色是 exoRDMA蓝色是 llama.cppTCP节点越多TCP 越吃亏llama.cpp 从 1 到 4 节点速度 20.4 → 17.2 → 15.2 t/s 一路下跌。原因不复杂——模型按层切开之后每生成一个 token 都要把中间结果在机器间来回传TCP 的延迟被放大成了瓶颈。RDMA 把设备间延迟压掉约 99%RDMARemote Direct Memory Access远程直接内存访问让网卡绕过内核直接读写对方内存。exo 首发支持 Thunderbolt 5 RDMA4 节点时比 TCP 方案快约 110%31.9 对 15.2 t/s。一句话总结瓶颈不在算力在链路。机器越多对网络的要求越高。 三块核心机制自动发现、拓扑感知、张量并行exo 的集群能力来自三个设计理解它们有助于你做配置决策。自动发现装上就跑每台设备启动 exo 后会自动发现同网络里的其他节点不用手填 IP 和端口。同一网络想跑多套互不干扰的集群用EXO_LIBP2P_NAMESPACE指定一个自定义命名空间即可。拓扑感知按链路质量决定切法exo 会实时记录设备间的带宽与延迟再决定模型怎么切链路慢的节点之间少放通信链路快RDMA的节点之间多放。你不需要自己画架构图。张量并行2 机约 1.8 倍、4 机约 3.2 倍除了按层流水线切分Pipelineexo 还支持张量并行Tensor Parallelism把每一层的权重矩阵横向切开多机同时算同一层。官方数据2 台设备最高约 1.8 倍加速4 台最高约 3.2 倍。每台节点都会提供 dashboard 和 API默认http://localhost:52415兼容 OpenAI Chat Completions、OpenAI Responses、Claude Messages 和 Ollama 四套接口——现有客户端基本只换 base URL 就能用。模型从 HuggingFace 按需拉取自定义模型的trust_remote_code默认关闭确认信任后再手动放开。上面是 4 台 512GB M3 Ultra Mac Studio 的集群视图DeepSeek v3.18-bit与 Kimi-K2-Thinking4-bit两个模型同时挂在集群里。️ 30 分钟跑通第一套 exo 集群安装与硬件门槛先确认你属于哪个场景目标场景硬件门槛网络要求参考效果单机体验小模型任意 Apple Silicon Mac8GB 内存起步无需Llama-3.2-1B 这类小模型即装即用双机张量并行2 台 M4 Max / M3 Ultra 级 MacTB5 直连最高约 1.8 倍加速4 机跑超大模型4 台 M3 Ultra各 512GBTB5 全互联两两直连6 条线DeepSeek 671B 8-bit32.5 t/sLinux 尝鲜任意 Linux 主机局域网目前仅 CPU 推理GPU 支持开发中安装三步装 exomacOS 最简单执行brew install --cask exo装好后台应用要求 macOS Tahoe 26.2 及以上走源码的话克隆仓库、构建 dashboard 后运行uv run exo。等自动组网在第二台设备上重复安装打开 dashboard 就能看到两台互相发现零配置。建第一个实例选一个小模型如 Llama-3.2-1B-Instruct-4bitexo 会列出所有合法分片方案pipeline / tensor × 节点数挑一个确认等实例 ready 就能开聊。进阶开启 Thunderbolt 5 RDMA想要基准图里的性能还得开 RDMA关机 → 长按电源键 10 秒进恢复模式 → 终端执行rdma_ctl enable→ 重启。支持机型限 Thunderbolt 5M4 Pro Mac mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio。 实测数据对比单节点 vs 4 节点推理速度以下数字全部来自同一套 4 × M3 Ultra Mac Studio 集群的公开实测Jeff Geerling 测试环境单位 t/stokens/秒模型节点数llama.cppTCPexoRDMA提升幅度Qwen3 235B A22B120.419.5-5%Qwen3 235B A22B217.226.252%Qwen3 235B A22B415.231.9110%DeepSeek V3.1 671B114.821.143%DeepSeek V3.1 671B216.027.874%DeepSeek V3.1 671B414.632.5123%Kimi K2 Thinking 1T218.521.617%Kimi K2 Thinking 1T416.428.373%三个观察单节点基本打平单台机器上没有集群开销两组数据差距在 ±5% 以内说明多机收益全部来自 RDMA 链路。扩展性DeepSeek 671B 从 1 到 4 节点exo 21.1 → 27.8 → 32.5 t/s 接近线性增长而 llama.cpp 基本是平的。功耗很克制官方 4 节点拓扑截图里每台 Mac Studio 负载下温度 35~38°C、功耗 13~15W内存各占约 172GB / 512GB。⚠️ 避坑RDMA 开启的 5 个硬性条件性能好看是有前提的官方 README 列的 caveat 建议逐条对照全互联RDMA 集群里每台设备必须直连所有其他设备4 台就是 6 条线漏一根就退化成 TCP。线材必须用支持 TB5 的线缆普通 TB4 线跑不了 RDMA。口位Mac Studio 上紧挨以太网口的那个 TB5 口不能用接线时绕开。系统版本所有设备的 macOS 版本必须完全一致beta 版本号都要对得上否则 RDMA 口互相发现不了。OS 门槛RDMA 是 macOS 26.2 新增能力macOS 版 App 同样要求 Tahoe 26.2 起。其他常见坑Linux 用户当前只能 CPU 跑别抱 Mac 级性能预期。模型来源自定义模型需要trust_remote_code时默认被拦截属安全设计确认信任后再开。图像模型默认关闭需要时设EXO_ENABLE_IMAGE_MODELStrue启用。接口细节完整端点说明见 docs/api.md。上图就是 README 强调的全互联4 台 Mac 两两直连拓扑视图里能看到每台的内存占用、温度和功耗。✅ 执行清单从单机到双机的最小路径别一上来就买 4 台 Mac Studio。按下面顺序走每一步都有可验证的结果第一步单机跑通准备一台 Apple Silicon MacM1 起即可安装 exobrew install --cask exo或源码方式打开 dashboard确认 52415 端口可访问拉一个 1B~3B 小模型实例发出第一条对话第二步加第二台机器第二台设备装好 exo确认 dashboard 里两台互相可见用/instance/previews接口对比 pipeline 与 tensor 方案跑一遍bench/exo_bench.py记录单机 vs 双机的 prompt / 生成速度第三步评估要不要上 RDMA核对两台是否都是 TB5 机型、系统版本是否一致按上文步骤开启rdma_ctl复测对比满足 4 机全互联条件后再考虑 671B 级模型最低门槛的起点一台闲置 MacBook 一个小模型对话。跑通单机 52415 端口出字这一步后面所有扩容都是同一套流程的重复。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表