尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Exo 分布式推理集群:从单台 Mac 到多节点加速的完整实操指南

Exo 分布式推理集群:从单台 Mac 到多节点加速的完整实操指南 Exo 分布式推理集群从单台 Mac 到多节点加速的完整实操指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExo 是一个分布式推理集群工具把多台设备自动组网成一个推理集群让单机内存装不下的大模型可以拆到多台设备上加载并且随设备增加继续提速。适合手上有几台 Apple Silicon 设备、想本地跑数百 B 参数模型、又希望现有客户端不用改协议的人。三步跑通最小可用的多节点推理环境检查Python 3.13用 uv 管理、Node.js 18、Rust nightly——macOS 与 Linux 通用macOS 另需 Xcode提供 MLX 编译用的 Metal ToolchainApple Silicon 硬件监控需要 macmon 工具要启用 RDMAmacOS 26.2、Thunderbolt 5 设备节点间全互联且各设备系统版本完全一致最小可运行配置git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exomacOS 上也可走 GUI 路径装官方 app要求 macOS Tahoe 26.2启动后授权安装网络配置应用常驻菜单栏即可。验证成功的标志启动后浏览器打开http://localhost:52415能看到 dashboard 的集群视图和本地节点卡片执行curl http://localhost:52415/models返回内置模型列表说明 API 已就绪。单台 MacBook 作为节点运行的界面如下。架构速览从发现到张量并行数据流向客户端请求 → 协调层放置决策 → 各节点 MLX 引擎 → 流式回传。核心模块拆解placement.py — 调度层结合实时拓扑与内存约束计算模型在各设备上的可行分片方案runner.py — 节点运行器承接任务、分发到推理引擎、上报进度、支持取消builder.py — MLX 推理引擎加载模型、构建张量并行分片与 KV 前缀缓存networking/src/swarm.rs — Rust 网络层节点自动发现与发布/订阅消息通道设计取舍选 MLX 而非 CUDA 后端原生针对 Apple Silicon 优化免驱动层代价是 Linux 目前只能跑 CPU没有中心服务器任何节点都能当协调层做放置决策少一个单点故障张量并行/流水线分片由调度层按链路带宽自动选用户不手动配置实测数据RDMA 与 TCP 的吞吐对比Qwen3 235B A22B8-bit解码吞吐ExoRDMA对 llama.cppTCP配置Exo (RDMA)llama.cpp (TCP)单节点19.5 t/s20.4 t/s2 节点26.2 t/s17.2 t/s4 节点31.9 t/s15.2 t/s测试环境4 台 512GB M3 Ultra Mac StudioThunderbolt 5 全互联数据来自 Jeff Geerling 的集群测试仓库内同图见 docs/benchmarks/。官方同时声明Tensor Parallel RDMA 把 TB5 链路上节点间延迟降低 99%张量并行在 2 台/4 台设备上分别最高提速 1.8 倍/3.2 倍。注意 TCP 方案节点越多吞吐反而越低RDMA 路径则随节点数继续提升。进阶与扩展基准、自定义模型与调优常用集成exo-bench — 测 prefill/decode 吞吐对比不同放置方案 — 走/bench/chat/completions端点HuggingFace 自定义模型 — 把 HF 上的模型拉进集群 —POST /models/add接口环境变量配置 — 存储/离线/隔离 —EXO_MODELS_DIRS、EXO_OFFLINE、EXO_LIBP2P_NAMESPACEexo-bench 输出 prompt_tps、generation_tps 与峰值内存可直接对比 ring 与 jaccl、pipeline 与 tensor 两类方案。性能调优清单优先启用 RDMA → 节点间延迟降低 99%前提是线缆全互联支持 TB5、各设备 macOS 版本完全一致网络好但算力弱的机器用--no-worker只挂协调层 → 避免参与推理拖累整体模型目录指到外挂 SSDEXO_MODELS_DIRS→ 系统盘空间紧张时的下载兜底加载前用/instance/previews预览全部可行放置 → 先选 pipeline 还是 tensor再拉起实例常见问题与坑节点互相发现不了基本是不在同网段或命名空间不同。用EXO_LIBP2P_NAMESPACE统一命名空间并确认同一二层网络。RDMA 端口发现失败官方明确 RDMA 口在不同 macOS 版本间可能互相不可见。检查所有设备版本完全一致beta 版本号也要相同。内存不够装不下模型换 4-bit 量化版本或减少参与节点用/instance/previews看各放置的memory_delta_by_node再决定。Linux 想用 GPU目前 Linux 仅 CPU 推理GPU 支持开发中可装mlx-cuda12/mlx-cuda13extra 试 CUDA 版 MLX。以上端点细节见 docs/api.md。适用边界适合Apple Silicon 多机组网、跑单机内存装不下的大模型给现有工具提供 OpenAI/Claude/Ollama 兼容 API 的本地推理替代用闲置 Mac 做推理原型验证不适合Linux 生产推理GPU 支持尚在开发追求最低首字延迟的线上服务——多机张量并行与单机高带宽方案相比没有延迟优势官方接口文档见 docs/api.md完整安装与 RDMA 配置以仓库 README 为准。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表