发布日期:2026-09-18 11:21 点击次数:185

IT之家 10 月 17 日音讯,EXO Labs 昨日展示了其“散播式推理”新驱散,处罚了被部分网友戏称为“世纪艰巨”的选拔问题 —— 买 AI 小主机究竟是买 Mac Studio 照旧买英伟达 DGX Spark?
如图所示,EXO Labs 同期使用了两台 NVIDIA DGX Spark 与一台搭载 M3 Ultra 芯片的 Mac Studio,在 AI 大言语模子推理测试中获取 2.8 倍性能进步。

该驱散基于 EXO Labs 的开源名堂 EXO,该框架旨在让大言语模子(LLM)大概高效运转于不同硬件的羼杂环境中。
与传统仅依赖单一 GPU 或加快器的推理表情不同,EXO 可将职责负载自动分派到多种修复上,使台式机、条记本、就业器致使平板电脑与智高东谈主机构成通常 WiFi Mesh 集结的“AI Mesh”。
DGX Spark 与 M3 Ultra 的互补组合
正如 EXO 所述,3999 好意思元(IT之家注:现汇率约合 28505 元东谈主民币)的 DGX Spark 侧重揣测性能,而 5599 好意思元(现汇率约合 39910 元东谈主民币) Mac Studio 则在数据带宽上更具上风。在这里,EXO 平直将两台 DGX Spark 与一台 Mac Studio 组合成长入的 AI 系统。

大型言语模子的推理流程频繁分为两个阶段:
预填充(prefill)阶段:模子读取和处理输入领导,这一阶段主要受揣测性能驱散;解码(decode)阶段:模子一一生成新词元(token),此流程更依赖内存带宽。

EXO 的决议是将两阶段分派给不同修复实施:
DGX Spark 精良揣测密集的预填充当务,而 M3 Ultra 精良带宽明锐的解码任务。系统通过逐层传输模子的里面数据(称为 KV 缓存),完毕两台修复的同期职责,而非按序恭候。
在使用 Meta Llama-3.1 8B 模子进行的基准测试中,该羼杂架构相较单独使用 Mac Studio,推感性能进步 2.8 倍。测试中 DGX Spark 的预填充速率比 Mac Studio 快 3.8 倍,而 Mac Studio 的生成速率又比 DGX Spark 快 3.4 倍,完毕了性能互补。

“散播式推理”助力低本钱彭胀 AI 算力
EXO 的实践展示了一种不同于传统单机加快的 AI 彭胀念念路。将来 AI 性能的进步,或不再依赖单一大型加快器,而是通过更智能的硬件协同完毕举座算力的进步。
通常的理念也出当今 NVIDIA 自家的新一代 Rubin CPX 平台想象中:揣测密集型的高下文构建由 Rubin CPX 处理器完成,而具有高带宽 HBM3e 内存的步调 Rubin 芯片精良解码阶段,与 EXO 在现成硬件上完毕的旨趣一致。
EXO 1.0 仍处早期阶段
EXO 现时的早期造访版块 1.0 仍属实践性质,尚未全面公开。现存的开源版块 0.0.15-alpha 发布于 2025 年 3 月,后续版块策划引入自动拯救、KV 流式传输和异构硬件优化功能。
面前 EXO 还是商议级用具,尚不相宜平凡破费者平直使用,但其演示驱散标明:通过智能拯救不同硬件资源,散播式推理架构能在无需大型数据中心的前提下显贵进步 AI 性能。
上一篇:开yun体育网同期保留无缺的触控板和键盘-开云(中国)Kaiyun·体育官方网站-登录入口
下一篇:没有了