exo 多机集群快速上手:本地跑通大模型的完整指南

exo 多机集群快速上手:本地跑通大模型的完整指南
exo 多机集群快速上手本地跑通大模型的完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 把多台 Mac 连成一个 AI 集群单机内存装不下的模型能跑起来而且机器越多跑得越快。4 台 M3 Ultra Mac Studio 实测 Qwen3-235B 解码 31.9 tokens/s约为普通 TCP 方案的 2 倍。 痛点一台 Mac 的内存为什么装不下大模型235B 参数模型就算 8-bit 量化也要 235GB 左右内存单机装不下买数据中心 GPU 又太贵。家里的 Mac 明明有内存却没人帮你调度哪台机器放哪层、走哪条链路、故障怎么恢复——exo 就是把这些全部自动化不用手动配置。 3 条命令拉起 exo 集群看界面前置条件装好uv和node源码构建还需rustmacOS 上已有 Nix 的话可直接nix run .#exo跳过以下步骤。git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exo第 1 条把源码拉到本机第 2 条构建 Web 仪表板就是浏览器里会看到的东西第 3 条启动集群进程几秒后打开http://localhost:52415/就能看到拓扑和聊天框跑起来之后界面长这样每台机器的内存、温度、功耗和正在跑的实例一目了然动作保留uv run exo窗口别关先在浏览器里确认拓扑里出现了本机。⚙️ exo 底层机制5 个核心模块各管一摊大白话每台机器跑一个 exo 进程互相广播发现、用 Erlang 风格消息传递在集群里跑。上层是 5 个角色各干一件事Master决定模型怎么切到哪些机器。切分是集群的核心难题由单一写入器排序所有事件保证两个节点不会各判各的见 src/exo/master/placement.py。Election网络抖动时也能选出明确 leader否则整个集群会卡在谁说了算上见 src/exo/shared/election.py。Worker每台机器上收集内存、温度、功耗是 Master 做切分的依据。Runner在独立进程里执行推理崩了只重启这一个不会拖垮整个集群。API暴露 OpenAI、Claude、Ollama 兼容端点现有工具直接接端点定义见 src/exo/api/types/api.py。动作调一次/instance/previews端点对比各切分方案的 memory_delta_by_node你就明白 Master 怎么想。 实测吞吐4 机 RDMA 对比 4 机 TCP 方案下表数字来自仓库 README 中的 4×M3 Ultra Mac Studio 集群测试Jeff Geerling 实测均为解码速度越高越好模型llama.cppTCP4 机exoRDMA4 机加速比Qwen3-235B8-bit15.2 t/s31.9 t/s约 2.1 倍DeepSeek V3.1 671B8-bit14.6 t/s32.5 t/s约 2.2 倍Kimi K2 Thinking原生 4-bit16.4 t/s28.3 t/s约 1.7 倍两边都是 4 台机器差别在网络层RDMA over Thunderbolt 把设备间延迟降 99%模型才能越加机器越快。README 里还写了张量并行 2 机 1.8 倍、4 机 3.2 倍的加速。动作用 bench/exo_bench.py 跑一遍自己的模型和机器数把数字验一遍。✅ 生产部署清单权限、网络、监控一次列全生产环境前逐项勾掉RDMAmacOS 26.2关机进恢复模式终端执行rdma_ctl enable后重启仅 Thunderbolt 5 机型受益权限macOS 应用会请求修改系统设置并安装网络配置文件这是它配置集群网络的方式需要同意线缆每台机器要用 TB5 线直连集群里每台其他机器全互联Mac Studio 上靠网口的 TB5 口不可用系统各机器 macOS 版本必须完全一致连 beta 编号都要一样隔离同一网络多个集群用EXO_LIBP2P_NAMESPACE分开监控仪表板实时显示各机内存/温度/功耗日志在~/.cache/exo/exo_log/自动轮转备份模型缓存在~/.exo/models共享存储用EXO_MODELS_READ_ONLY_DIRS指向 NFS动作先把 RDMA 恢复模式那步做了没开这个上面所有加速数据都不成立。❓ 高频卡点安装报错、权限申请、RDMA 不识别Q安装或编译报错macOS 先装 XcodeMLX 编译依赖它的 Metal 工具链看到 Metal 相关编译错误就装 Xcode 再试Linux 目前只跑 CPUGPU 支持还在开发中。Q应用要改系统设置安全吗macOS 应用需要装一个网络配置 profile 来设置集群网络属正常行为。用完在菜单栏图标 Advanced → Uninstall 可干净卸载。Q接了线但机器互相发现不了按顺序查线是否支持 TB5、是否全互联、靠网口那根线是否可用Studio 上不行、各机系统版本是否一致。源码运行时 README 提供了脚本用于禁用 Thunderbolt Bridge 并给 RDMA 口配 DHCP。Q量化精度掉了多少官方测试里 Qwen3、DeepSeek 用 8-bitKimi K2 是原生 4-bit4-bit 内存约减半671B 模型才能装进 4 台。上线前先看/instance/previews的 memory_delta_by_node确认每种方案实际占多少内存再定量化档位。Q集群拉起后要手动配模型吗不用。同网络设备自动发现模型列表仪表板自带也可以一键添加 HuggingFace 上的模型。动作优先过一遍第三个问题的线缆 系统版本两项多数发现不了的问题出在这里。先在一台机器上跑uv run exo打开 localhost:52415 确认集群拉起再插第二台看拓扑图长出来。模型装不下时用/instance/previews让切分方案用数字说话而不是猜。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

最新新闻

日新闻

周新闻

月新闻