硬核博主Jeff Geerling用四台Mac Studio打造超大内存AI集群

在科技的浪潮中,YouTube博主Jeff Geerling以其独特的视角为我们展示了如何利用四台Mac Studio打造一个强大的AI集群。这一令人瞩目的实验不仅展示了苹果最新的硬件和软件技术,还为AI计算领域开辟了新的可能性。

Jeff在他的博文和视频中详细介绍了这次实验的过程,尤其是Thunderbolt 5接口在集群计算中的关键作用。苹果最新的macOS 26.2版本引入了对RDMA(Remote Direct Memory Access)over Thunderbolt 5的支持,使得多台Mac Studio能够像共享同一块大内存一样高效协同工作。简单来说,RDMA技术使得不同设备之间可以在内存层面快速交换数据,大幅度降低了延迟,这一表现显著优于传统的网络传输方式。

在这次测试中,Jeff将四台配备统一内存的Mac Studio组合成一个“集群”,共同形成了约1.5TB的内存池。这种创新的内存融合技术在运行超大AI模型时表现出了明显的优势,特别是在处理模型参数巨大的推理任务时,数据交换更加流畅。通过RDMA,各台机器之间的数据访问延迟从数百微秒降低到几十微秒,这一改进极大提升了协同计算的效率。

此外,Jeff还使用开源项目Exo 1.0来管理集群内的任务分配和内存共享,使得多台机器能够顺畅协作。尽管这一技术在实际应用中展现出了巨大的潜力,但也存在一些局限性,例如RDMA需要手动启用,设置过程较为复杂,且由于Thunderbolt连接的拓扑限制,目前最多只能通过点对点方式交叉连接四台机器。

在硬件配置方面,这套四机集群的成本接近4万美元,主要由Mac Studio本体构成。单台M3 Ultra Mac Studio在多核计算和AI推理任务中表现不亚于某些专业服务器,这使得其性价比相当可观。

尽管RDMA over Thunderbolt 5的技术进展令人振奋,但与传统的企业级互连技术(如QSFP或InfiniBand)相比,Thunderbolt的物理连接方式仍显得不够成熟。然而,Jeff Geerling的实验展示了在macOS平台上利用Thunderbolt 5 RDMA构建大内存AI计算集群的可能性。这对于研究者和开发者来说,意味着在桌面级硬件上实现超大规模模型运行的新思路,尤其是在不依赖大量GPU的情况下。

虽然仍然面临一些技术和生态限制,但这一进展无疑为本地AI开发和高性能计算(HPC)提供了重要的参考价值。未来,随着技术的不断进步,或许我们能够看到更多基于这一理念的创新应用,进一步推动AI技术的发展与普及。