首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

eugr/spark-vllm-docker

一套社区维护的 Docker 化 vLLM 部署方案,专门解决"如何把两台甚至八台 NVIDIA DGX Spark 组成推理集群"的工程难题,把多机组网、镜像分发、模型分发压缩成几条脚本命令。核心能力围绕集群自动发现、一键启动器、配方系统展开。DGX Spark(GB10 芯片)作为桌面级 AI 超算上市后,用户很快遇到痛点:单机 128GB 统一内存跑不动前沿大模型,而官方并未提供成熟的多机方案。

语言
Shell
⭐ 总星标
2,187
📅 创建
早期项目
🍴 Forks
0
许可证
未标注
🔥 本月净增
+297
在 GitHub 打开 回到总表

配图

信息卡

项目内容
仓库链接https://github.com/eugr/spark-vllm-docker
语言 / 许可证Shell · MIT
总星标⭐ 2,187
本月净增+297
榜单星标增速榜第 47 名

一句话定位

一套社区维护的 Docker 化 vLLM 部署方案,专门解决"如何把两台甚至八台 NVIDIA DGX Spark 组成推理集群"的工程难题,把多机组网、镜像分发、模型分发压缩成几条脚本命令。

增速解读:为什么涨这么快

DGX Spark(GB10 芯片)作为桌面级 AI 超算上市后,用户很快遇到痛点:单机 128GB 统一内存跑不动前沿大模型,而官方并未提供成熟的多机方案。该项目以"买两台 Spark 合体"的叙事精准命中尝鲜者,Docker 封装又把门槛压到克隆仓库、跑三个脚本的级别——硬核硬件 + 开箱即用脚本的组合自然成为话题中心。

核心功能拆解

7. 加速加载:集成 fastsafetensors 与 InstantTensor 缩短大模型冷启动。

架构与技术栈浅析

基础镜像 `nvidia/cuda:13.0.2-devel-ubuntu24.04`;PyTorch 2.13、自建 NCCL v2.30u1、CUTLASS DSL 4.7.0,目标架构锁定 Blackwell sm12x(12.1a)。针对 Spark 统一内存特性设置 `expandable_segments:True` 抗碎片,KV cache 支持 fp8。近期版本默认 no-Ray 多机后端(内存更低),`--ray` 可选。

安装与环境要求

至少一台 DGX Spark;节点间需配免密 SSH,且通信必须使用 ConnectX-7 接口 IP;从头编译 vLLM/flashinfer 约 20–40 分钟,默认直接拉取已测 nightly 镜像则数分钟可用。

快速上手示例

单机:`git clone` 后执行 `./build-and-copy.sh`,再 `./launch-cluster.sh --solo exec vllm serve `。双机跑 GLM-5.2:头节点 `./run-recipe.sh --setup` 即可全自动完成下载与 `-tp` 分布式拉起;注意不要手动传 `--nnodes/--master-addr`,launcher 会接管。

进阶使用要点

典型应用场景

家庭/实验室级 1M token 长上下文大模型私有部署;小团队低成本的离线推理服务;GB10 平台的 NCCL 多机调参实验;边缘侧不依赖云 API 的生产原型验证。

同类生态位对比

对比 Ollama/llama.cpp:后者易用但多机能力弱,本项目主打真正的张量并行集群;对比 NVIDIA 官方 Spark 文档:官方偏单机示例,本仓库填补了多机 vLLM 的空白;同类 Docker 化 vLLM 方案通常不针对 GB10/sm12x 做内核级适配,这是其护城河。

资源导航

仓库 https://github.com/eugr/spark-vllm-docker · recipes/ 目录查看全部模型配方 · mods/ 目录浏览运行时补丁 · AGENT_RUNBOOK.md 面向 Agent 的运维手册

← 上一篇adongwanai/AgentGuide下一篇 →embabel/embabel-agent