尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

4步搭起家用分布式推理集群:exo多设备AI部署上手指南

4步搭起家用分布式推理集群:exo多设备AI部署上手指南 4步搭起家用分布式推理集群exo多设备AI部署上手指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo在一台电脑上跑大模型瓶颈始终是内存参数一超容量只能换更贵的硬件。exo 是家用分布式推理工具它把你手里的所有设备连成一个 AI 集群让几台普通机器合力跑下单机装不下的模型而且借助雷电 RDMA加设备真的会变快。一句话讲清原理exo 怎么做分布式推理exo 把大模型切分后铺到集群里的每台设备上设备在同局域网内自动互相发现不需要你手填 IP 或做网络配置。新增节点时它按各设备实时资源和链路带宽自动重新切分。在 M 系列 Mac 上还能启用 Thunderbolt 5 上的 RDMA设备间通信时延降低约 99%所以节点越多越快而不是越加越慢。核心能力拆解3 个让集群真正可用的场景自动发现同网段开机即组网零配置在一台新机器上装好 exo 后它会立刻发现局域网里其他已运行的 exo 节点并加入集群每台机器各自提供 dashboard 和 APIhttp://localhost:52415。同一网络里有多个集群时可以用EXO_LIBP2P_NAMESPACE变量做隔离避免节点误连。拓扑感知自动并行加机器时少做手动调优每加一台设备exo 会基于集群的实时拓扑视图设备资源 各链路带宽/时延评估全部切分方案并选最优的你不用自己决定哪层放哪台机器。官方数据张量并行在 2 设备上最高 1.8 倍加速4 设备上最高 3.2 倍加速。多标准 API现有工具直接接exo 同时提供 OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama 四种接口你现有的客户端和工具如 OpenWebUI基本可以原样接入也支持从 HuggingFace 加载自定义模型。详见 API 文档。环境与选型要求类型最低推荐macOS 设备Apple Silicon macOS Tahoe 26.2 及以上M3 Ultra Mac Studio、M4 Pro Mac Mini、M4 Max MacBook Pro带 TB5 口Linux 设备仅 CPU 推理GPU 支持开发中作为辅助节点或仅 CPU 场景依赖工具uv、node 18、rust nightlyNixnix run .#exo跳过大部分安装多设备互联同一局域网自动发现Thunderbolt 5 线缆全互联启用 RDMA存储模型权重的空闲空间EXO_MODELS_DIRS可指定外置盘NFS 只读共享目录EXO_MODELS_READ_ONLY_DIRS动手实操5 步从克隆到组网上线装依赖并克隆仓库按 官方 README 在 macOS 上装好 uv、node、rustnightly然后git clone https://gitcode.com/GitHub_Trending/exo8/exo。预期结果仓库出现在本地 exo/ 目录。构建 dashboardcd exo/dashboard npm install npm run build。预期结果构建完成无报错。每台设备启动 exo完成自动注册各机器执行uv run exo。预期结果http://localhost:52415打开 dashboard同局域网其他已启动的机器出现在集群列表里全程无需手动配置。下载模型并发起对话在 dashboard 选模型下载、创建实例开聊或用与 OpenAI 相同格式调 API。预期结果模型跨整集群运行每台设备分担一部分计算。可选启用 RDMA 拉开加速差距关机后长按电源键 10 秒进恢复模式在终端执行rdma_ctl enable再重启。 预期结果设备间时延降低约 99%张量并行收益最大化。效果验证4 节点集群分布式推理实测以下数据来自仓库内置的官方基准4 × M3 Ultra Mac Studio对比口径见 bench 方法说明Qwen3 235B8-bit单节点 19.5 t/s4 节点 31.9 t/s提速 63%同样 4 节点下 llama.cppTCP方案只有 15.2 t/s且节点越多越慢单节点 20.4 t/s。DeepSeek V3.1 671B8-bit单节点 21.1 t/s → 4 节点 32.5 t/s提速 54%llama.cppTCP4 节点为 14.6 t/s。Kimi K2 Thinking 1T4-bit2 节点 21.6 t/s → 4 节点 28.3 t/s再提速 31%。常见坑与排查RDMA 口互相发现不了先确认所有设备 macOS 版本完全一致连 beta 版本号都要一样再确认集群内设备两两用 TB5 线缆直连Mac Studio 上别用网口旁边的那个 Thunderbolt 5 口。macOS 应用请求修改系统设置 / 安装网络描述文件这是启用 RDMA 的前置操作属正常流程授予一次即可之后应用在后台运行。在 Linux 上期待 GPU 加速exo 目前在 Linux 只跑 CPUGPU 支持还在开发中。追求吞吐请以 Apple Silicon 机器为主节点Linux 机器做辅助。适合已经手里有 2 台及以上 Apple Silicon 设备、想用可控预算在本地跑大参数模型的用户。下一步很简单先在单台机器上跑通uv run exo打开 dashboard再把第二台机器接进同一局域网直接体感集群带来的速度差。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表