用Exo搭建本地800亿参数AI集群
在上一篇文章 《我用16GB Mac Mini打造AI powerhouse——LM Studio Link如何改变一切》中,我探索了通过在强大的机器上使用LM Studio Link来在较小设备上运行AI模型的方法。 如果我想反其道而行之——将多台机器的CPU、GPU和RAM资源整合起来,运行单台机器无法处理的模型呢? 如果你手头有一堆较小的设备,想要将它们的能力整合起来以发挥更大作用呢? 来认识Exo。这正是这个问题的答案。 1、什么是Exo? Exo是由Exo Labs维护的一个开源项目。用一句话概括:它将你的所有设备连接成一个个人AI集群,让你可以运行那些永远无法装入任何单台机器的前沿模型。 核心能力一览: 自动设备发现——运行Exo的设备会自动在网络上找到彼此,无需手动配置。 拓扑感知自动并行——Exo会根据每台设备可用的RAM、CPU/GPU资源以及节点间的网络延迟,自动找出最优的模型分割方式。 张量并行——模型分片可在2台设备上实现高达1.8倍加速,在4台设备上实现3.2倍加速。 Thunderbolt 5上的RDMA——在支持的硬件(M4 Pro/Max)上,这可将设备间延迟降低高达99%。 MLX后端——使用苹果的MLX框架在Apple Silicon上进行GPU加速推理。 OpenAI兼容API——暴露http://localhost:52415/v1接口,任何支持OpenAI的工具都可以直接与你的集群通信。 支持54个以上模型——从小的Llama模型到671B参数的DeepSeek变体。 适用于Mac、Linux,甚至树莓派。 我的配置:Mac Mini M4…







