一套社区维护的 Docker 化 vLLM 部署方案,专门解决"如何把两台甚至八台 NVIDIA DGX Spark 组成推理集群"的工程难题,把多机组网、镜像分发、模型分发压缩成几条脚本命令。核心能力围绕集群自动发现、一键启动器、配方系统展开。DGX Spark(GB10 芯片)作为桌面级 AI 超算上市后,用户很快遇到痛点:单机 128GB 统一内存跑不动前沿大模型,而官方并未提供成熟的多机方案。

| 项目 | 内容 |
|---|---|
| 仓库链接 | https://github.com/eugr/spark-vllm-docker |
| 语言 / 许可证 | Shell · MIT |
| 总星标 | ⭐ 2,187 |
| 本月净增 | +297 |
| 榜单 | 星标增速榜第 47 名 |
一套社区维护的 Docker 化 vLLM 部署方案,专门解决"如何把两台甚至八台 NVIDIA DGX Spark 组成推理集群"的工程难题,把多机组网、镜像分发、模型分发压缩成几条脚本命令。
DGX Spark(GB10 芯片)作为桌面级 AI 超算上市后,用户很快遇到痛点:单机 128GB 统一内存跑不动前沿大模型,而官方并未提供成熟的多机方案。该项目以"买两台 Spark 合体"的叙事精准命中尝鲜者,Docker 封装又把门槛压到克隆仓库、跑三个脚本的级别——硬核硬件 + 开箱即用脚本的组合自然成为话题中心。
7. 加速加载:集成 fastsafetensors 与 InstantTensor 缩短大模型冷启动。
基础镜像 `nvidia/cuda:13.0.2-devel-ubuntu24.04`;PyTorch 2.13、自建 NCCL v2.30u1、CUTLASS DSL 4.7.0,目标架构锁定 Blackwell sm12x(12.1a)。针对 Spark 统一内存特性设置 `expandable_segments:True` 抗碎片,KV cache 支持 fp8。近期版本默认 no-Ray 多机后端(内存更低),`--ray` 可选。
至少一台 DGX Spark;节点间需配免密 SSH,且通信必须使用 ConnectX-7 接口 IP;从头编译 vLLM/flashinfer 约 20–40 分钟,默认直接拉取已测 nightly 镜像则数分钟可用。
单机:`git clone` 后执行 `./build-and-copy.sh`,再 `./launch-cluster.sh --solo exec vllm serve
家庭/实验室级 1M token 长上下文大模型私有部署;小团队低成本的离线推理服务;GB10 平台的 NCCL 多机调参实验;边缘侧不依赖云 API 的生产原型验证。
对比 Ollama/llama.cpp:后者易用但多机能力弱,本项目主打真正的张量并行集群;对比 NVIDIA 官方 Spark 文档:官方偏单机示例,本仓库填补了多机 vLLM 的空白;同类 Docker 化 vLLM 方案通常不针对 GB10/sm12x 做内核级适配,这是其护城河。
仓库 https://github.com/eugr/spark-vllm-docker · recipes/ 目录查看全部模型配方 · mods/ 目录浏览运行时补丁 · AGENT_RUNBOOK.md 面向 Agent 的运维手册