尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何把多台 Mac 拼成 AI 推理集群:Exo 完整部署指南

如何把多台 Mac 拼成 AI 推理集群:Exo 完整部署指南 如何把多台 Mac 拼成 AI 推理集群Exo 完整部署指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo目标模型装不进单机显存时常规解法是买一台更贵的服务器但桌面已有的机器可能就够了。Exo 是一个把多台现有设备拼成一个 AI 集群的分布式推理工具节点自动互相发现模型自动切分到各台机器设备越多推理越快。30 秒启动集群环境依赖一句话带过装好 uv、node 和 Rust 工具链即可macOS 上编译 MLX 还需要 Xcode。然后是三行单行命令git clone https://gitcode.com/GitHub_Trending/exo8/exocd exo/dashboard npm install npm run builduv run exo起来之后浏览器打开http://localhost:52415同一个页面既是管理面板也是 API 入口。集群里任意一台节点都能作为入口看到的状态是一致的。Exo 替你干了哪些活节点自动发现零地址配置同一局域网里的机器装好 exo 后会自动发现彼此不需要注册、填地址或指定主从。某台机器掉线或重启时集群通过分布式算法重新选出 master 并自动恢复相关逻辑在 src/exo/shared/election.py 里。切分方案自动算不用管哪层放哪台机器创建实例前你可以先用 /instance/previews 预览所有可行的切分方案系统会依据每台机器的空闲内存、当前负载和各条链路的实际带宽与延迟来选最优解核心逻辑在 src/exo/master/placement.py。开启张量并行后双机集群比单机快 1.8 倍四机可到 3.2 倍。RDMA 让机器间通信接近免费分布式推理最大的开销通常在机器之间的数据搬运。macOS 26.2 配合雷雳 5在恢复模式执行一次rdma_ctl enable后重启设备间延迟可降约 99%。实测数据4 台 M3 Ultra Mac Studio 跑 Qwen3-235B 达到 31.9 tokens/s而单机方案只有 20.4 tokens/s 左右。跑通之后只需要盯三件事线材和系统版本。用 RDMA 时所有节点必须用 TB5 线缆物理互联Mac Studio 上紧邻网口的雷雳口不能用且各台系统版本要完全一致连 beta 编号都不能差否则 RDMA 端口互相发现不了。集群隔离。同一网络跑多个 exo 集群时给每个集群设不同的EXO_LIBP2P_NAMESPACE环境变量避免节点串网只跑一个集群可以忽略这条。接入现有工具。API 兼容 OpenAI Chat Completions、Claude Messages 和 Ollama 三种协议客户端把请求地址指到 52415 端口就能直接用全部端点细节见 docs/api.md想验证切分方案的性能跑一下自带的 bench/exo_bench.py 即可。谁适合用 / 谁不适合适合你的场景手头有几台 Apple Silicon 机器尤其是带雷雳 5 的型号想本地跑 200B 以上开源模型的推理希望现有 OpenAI 兼容客户端和脚本不改动就能接入它解决不了的问题Linux 上目前是纯 CPU 运行没有 GPU 加速RDMA 需要雷雳物理互联普通局域网只能走较慢的常规分布式推理只做推理不承担训练任务如果你现在手里的资产就是几台 M 系列 Mac 加一个放不下单机的模型值得花半天用 exo 搭个测试集群部署成本远低于重新采购硬件。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表