尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

exo AI集群管理快速上手:把多台设备连成本地分布式推理集群

exo AI集群管理快速上手:把多台设备连成本地分布式推理集群 exo AI集群管理快速上手把多台设备连成本地分布式推理集群【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个分布式 AI 推理集群管理工具在多台机器上各跑一个 exo 进程设备会自动互相发现、组网成一个集群无需手动配置。它能运行单台机器内存装不下的模型并且借助 Thunderbolt 5 上的 RDMA 与张量并行机器加得越多、推理反而越快。下文讲清它的工作原理、部署步骤、实测性能和常见坑。exo 是什么把闲置设备拼成一台大内存AI 服务器单机跑大模型的第一道坎是内存DeepSeek v3.1 671B8-bit这种模型一台机器根本装不下。exo 的定位就是解决单设备容量不够和加机器不加速两个问题——每台跑着 exo 的设备自动发现彼此Master 根据实时拓扑决定模型如何切分。官方演示环境里4 台 512GB 的 M3 Ultra Mac Studio 同时加载 DeepSeek v3.18-bit和 Kimi-K2-Thinking4-bit两个实例对外提供推理。对你的价值不迁移到云端用现有的 Mac或 Linux 机器就获得一套可以挂 OpenAI 兼容 API 的本地大模型服务模型下载、分片、调度都由集群自己完成。工作原理消息传递、事件溯源与拓扑感知调度每台节点src/exo/main.py中的 Node同时运行五个组件Master集群协调者负责模型放置决策是所有事件的唯一写入者Worker在本地节点执行下载、调度推理任务Runner独立进程跑推理崩了不影响控制面APIFastAPI 服务暴露 OpenAI 等兼容接口和仪表盘ElectionBully 算法选出 Master节点掉线后集群自动重新选举组件间通过 zenoh 的发布/订阅消息通信Rust 绑定层exo_rs状态采用事件溯源集群状态是不可变事件流逐条 apply 出来的src/exo/shared/apply.py这让调试和恢复都有据可查。调度上最关键的一点是拓扑感知自动并行exo 实时掌握每台设备的显存/内存占用以及每条链路间的带宽和延迟见下图仪表盘直接画出全网格拓扑和每链路速率据此在流水线并行与张量并行之间选出放置方案而不是简单平均分块。三步跑起来从 clone 到第一个可用模型前置依赖uv、node、rust构建 Rust 绑定需要 nightlymacOS 用户另需 Xcode 提供 Metal 工具链。git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exo第二条命令构建 Svelte 仪表盘必须执行API 直接托管其产物第三条启动完整节点。验证成功的方式浏览器打开http://localhost:52415/看到仪表盘且集群视图中出现本机或curl http://localhost:52415/state拿到节点与实例的 JSON 状态。同一局域网内的第二台机器重复同样的启动流程两边会自动互相发现无需填地址或端口。macOS 上也可以用brew install --cask exo装后台应用版要求 macOS Tahoe 26.2。实测性能加机器到底能快多少官方在 4 × M3 Ultra Mac Studio 上做了对比测试来源为 Jeff Geerling 的公开实测。以 Qwen3-235B8-bit为例配置exoRDMAllama.cppTCP单节点19.5 t/s20.4 t/s2 节点26.2 t/s17.2 t/s4 节点31.9 t/s15.2 t/s这张图说明了 exo 的核心卖点传统 TCP 方案在节点增加时同步开销吃掉加速收益4 节点反而比单节点慢而 RDMA 把设备间延迟官方标称降低 99%规模越大优势越明显。官方数据还给出张量并行在 2 台设备上约 1.8 倍、4 台设备上最高 3.2 倍的加速。DeepSeek v3.1 671B8-bit与 Kimi K2 Thinking原生 4-bit在同样 4 节点集群上也有对应基准图见docs/benchmarks/jeffgeerling/。API 兼容与实例管理四套接口任选exo 的 API 同时实现了四种格式现有客户端基本零改造接入OpenAI Chat Completions/v1/chat/completionsClaude Messages/v1/messagesOpenAI Responses/v1/responsesOllama/ollama/api/chat、/ollama/api/tags可直接接 OpenWebUI实例管理是异步的标准流程四步先GET /instance/previews?model_idxxx预览所有合法放置方案含分片方式和各节点内存增量挑一个POST /instance创建通过 SSE 端点/instance/await等待实例 ready然后发推理请求用完DELETE /instance/{id}释放。完整端点见 API 参考文档 和 API 类型定义。另外两个实用端点/models/add可从 HuggingFace 拉取任意 MLX 模型trust_remote_code默认关闭需显式开启/state和/events暴露集群状态与内部事件流方便接监控。 RDMA 开启与集群配置开启 RDMAmacOS 26.2硬件需 Thunderbolt 5M3 Ultra Mac Studio、M4 Max/Pro 系列关机后长按电源键进恢复模式在终端执行rdma_ctl enable重启。之后 exo 会自动接管配置。常用环境配置变量作用EXO_OFFLINEtrue离线模式只用本地模型EXO_MODELS_DIRS追加模型下载目录如外接 SSD按顺序找有空间的EXO_MODELS_READ_ONLY_DIRS指向 NFS 等只读预下载模型盘EXO_LIBP2P_NAMESPACE集群命名空间同网络跑多套集群互不串扰EXO_ENABLE_IMAGE_MODELStrue启用图像模型FLUX、Qwen-Imageuv run exo --no-worker可把某台机器只当协调节点只做网络与编排不跑推理适合网络好但算力弱的机器。macOS 应用版在 Advanced 设置里也可配置命名空间。避坑指南RDMA 接线、平台限制与验证RDMA 的官方注意事项踩中任何一条都连不上集群内每台设备必须两两直连全网格拓扑不能靠交换机线缆必须支持 TB5Mac Studio 上紧邻以太网口的那个 TB5 口不可用所有设备 macOS 版本必须完全一致连 beta 版本号都要相同否则 RDMA 端口互相发现失败从源码运行时需跑仓库内tmp/set_rdma_network_config.sh关闭 Thunderbolt Bridge 并为各 RDMA 口配 DHCP其他坑Linux 目前仅 CPU 推理GPU 支持还在开发中Linux 节点别指望性能日志在 Linux 位于~/.cache/exo/exo_log/自动轮转配置与数据遵循 XDG 目录规范改动过网络配置后重启应用不会自动复原网络 profile排障时留意性能验证不用信口头数据仓库自带 exo-bench对/bench/chat/completions端点发请求输出各放置方案下的 prefill/generation t/s、峰值内存和功耗并禁用 KV 前缀缓存、封禁 EOS 保证测量条件一致适合横向对比流水线/张量并行。它最适合谁exo 最适合手里有一批 Apple Silicon 机器尤其 Thunderbolt 5 设备、想在局域网内私有化运行百亿级以上模型并对外挂兼容 API 的团队Linux 用户只能先当 CPU 集群用GPU 支持尚在路上选型前务必确认这一限制。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表