尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

4台Mac跑671B大模型:exo 分布式AI集群本地推理指南

4台Mac跑671B大模型:exo 分布式AI集群本地推理指南 4台Mac跑671B大模型exo 分布式AI集群本地推理指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个本地大模型分布式推理框架在多台 Apple Silicon 或 Linux 机器上各跑一条命令设备就会自动发现彼此、组成集群把单机装不下的大模型切开并行运行。Mac 用户也可以直接brew install --cask exo装菜单栏应用省去源码构建。一句话看懂它组网零配置每台机器装好就上线自动互相发现并展示实时拓扑不用手动填地址跑更大的模型把模型分片到多台设备的内存里总容量决定你能跑多大的本地大模型加机器真的会更快张量并行官方数据是 2 台最高 1.8 倍、4 台最高 3.2 倍换机器不换代价OpenAI、Claude、Ollama 等 API 格式全兼容现有客户端改个 base_url 就能用最短路径跑通第 1 步拉代码并构建仪表盘git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build会看到构建完成产物生成在dashboard/build这是后面网页控制界面的来源macOS 源码运行还需 Xcode、uv、node、rust nightly按 README 准备即可。第 2 步在第一台机器上启动cd exo uv run exo会看到本机集群服务和仪表盘启动在http://localhost:52415页面里出现当前这台节点。第 3 步在第二台机器上执行同样两条命令uv run exo会看到两台设备自动发现并组网成功仪表盘拓扑图和聊天界面里都能同时看到两个节点点 LAUNCH INSTANCE 就能分配第一个模型实例。按设备组合选玩法旧设备凑算力异构集群新旧配置差异大的机器可以直接混编调度器会按各设备的内存和链路带宽决定每个模型分片放哪台。内存有限但网络好的机器还能只当协调员不参与推理uv run exo --no-worker分片决策逻辑在 placement.py它对每条设备链路实时评估延迟与带宽后再给出放置方案。多台机器分摊大模型RDMA 高速直连4 台 512GB 的 M3 Ultra Mac Studio 通过 Thunderbolt 5 全互联把 DeepSeek v3.1 671B8-bit约 671GB远超单台容量切开后跑起来。开启 RDMA 需要 macOS 26.2关机后长按电源 10 秒进恢复模式在终端执行rdma_ctl enable重启后 exo 会自动接管。断网环境跑本地推理模型放在外置硬盘或共享存储里关掉联网即可完全离线EXO_OFFLINEtrue EXO_MODELS_DIRS/Volumes/SSD/exo-models uv run exo多集群共用一个局域网时再用EXO_LIBP2P_NAMESPACE名字给各自集群划分隔离空间避免误连。实测表现结论只要内存加得够、链路够快前沿规模模型可以在消费级 Mac 集群上本地推理且加机器有实测加速。以下数据来自 Jeff Geerling 的公开测试4 × M3 Ultra Mac Studio张量并行 RDMA over Thunderbolt 5集群总内存4 × 512GB 2TB成功运行的模型DeepSeek v3.1 671B8-bit、Qwen3-235B8-bit、Kimi K2 Thinking4-bit扩展速度张量并行下 2 台最高 1.8x、4 台最高 3.2x官方 README 口径设备间通信延迟RDMA over TB5 相比普通网络降低约 99%常见坑速查现象两台机器在同一局域网但始终发现不了彼此原因不在同一子网、防火墙拦了局域网流量或两边的EXO_LIBP2P_NAMESPACE不一致解法确认同子网、放行本地网络权限统一命名空间后重启 exo必要时看~/.cache/exo/exo_log/下的日志现象RDMA 没生效或直连不稳定原因两边 macOS 版本必须精确一致含 beta 版本号线缆非 TB5 规格或在 Mac Studio 上用了紧邻以太网口的那个 TB5 口解法对齐系统版本、换正规 TB5 线缆、避开以太网口旁边的端口现象Linux 节点推理速度远低于预期原因exo 在 Linux 上目前只跑 CPU没有 GPU 加速解法推理负载交给 Apple Silicon 机器Linux 机用--no-worker只做协调接入现有工具链exo 对外同时提供 OpenAI Chat Completions、Claude Messages、OpenAI Responses 和 Ollama 四套 API 端点意味着 LangChain、OpenWebUI 这类现成工具改个base_url就能指向你的集群自定义 HuggingFace 模型也能通过/models/add端点加载完整端点清单见 docs/api.md。最小可用示例import openai client openai.OpenAI(base_urlhttp://localhost:52415/v1, api_keynot-needed) r client.chat.completions.create( modelmlx-community/Llama-3.2-1B-Instruct-4bit, messages[{role: user, content: 你好}], )到这里集群已经能服务真实流量了。建议的下一步先用 1B 小模型在两台设备上跑通观察仪表盘里的自动并行方案调/instance/previews预览不同放置策略再决定用流水线还是张量并行有 TB5 的机器按上文开启 RDMA用bench/exo_bench.py量化加机器前后的吞吐差异【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表