一个 10 周、每天 30 分钟共 50 个 session 的学习路线图:以交付一个 OpenAI 兼容推理服务为主线,系统吃透 vLLM/SGLang 推理服务与优化。推理成本焦虑催生了巨大的学习需求,而市面内容多为碎片博客。作者 Akshay(@akshay_pachaar,ML 圈高影响力博主)的设计妙在"所有 session 服务于同一产物"——租 GPU 部署、上监控、千级并发压测、量化与投机解码优化、成本路由,最终发布可复现基准报告。

| 项目 | 内容 |
|---|---|
| 仓库 | patchy631/time-to-first-token |
| 语言 / 许可证 | HTML / CC BY 4.0 |
| 总星标 | ⭐ 765(截至 2026-08-26) |
| 创建时间 | 2026-08-02 |
| 榜单 | 近30天新星榜 第30名 |
一个 10 周、每天 30 分钟共 50 个 session 的学习路线图:以交付一个 OpenAI 兼容推理服务为主线,系统吃透 vLLM/SGLang 推理服务与优化。
推理成本焦虑催生了巨大的学习需求,而市面内容多为碎片博客。作者 Akshay(@akshay_pachaar,ML 圈高影响力博主)的设计妙在"所有 session 服务于同一产物"——租 GPU 部署、上监控、千级并发压测、量化与投机解码优化、成本路由,最终发布可复现基准报告。"Shipping One Service"的工程叙事 + 可勾选的进度追踪页面,让它从教程堆里一眼跳出。
7. Week8 分离式服务与 K8s 扩缩容;Week9 单位经济与 cost/latency/quality 路由器;Week10 发布基准报告并养成每周读论文习惯。
8. 配套 9 篇核心论文表:PagedAttention(SOSP'23)、Orca(OSDI'22)、SGLang(NeurIPS'24)、Sarathi-Serve(OSDI'24)、DistServe、Splitwise、Mooncake(FAST'25 best paper)、StreamingLLM、EAGLE。
主引擎 vLLM、对比引擎 SGLang;压测选 GuideLLM、vllm bench serve、genai-perf、LLMPerf 四件套交叉验证;部署走 Docker/kind/Helm(production-stack)/KEDA;监控 Prometheus+Grafana;边缘方向仅作可选第 10 周采样(ONNX Runtime/TensorRT-LLM/WebLLM),并明确其运维面与数据中心栈几乎不相交。
一张约 24GB 显存的卡跑 7–8B 模型即可起步,仅两处 session 需要 H100(推荐 RunPod/Modal/Lambda/vast.ai 租用);前置仅需 Python、transformers 架构级理解与命令行,不需要先会 serving/K8s/CUDA。
打开 README 从 Week1 出发即可;session 分 read/build/skim 三类(build 不可压缩);进度追踪三选一:本地网页(local storage + 12 字符同步码导出 JSON)、GitHub issue 模板打点、或 fork 后勾选 README;每周 5 次 + 2 缓冲日,总投入约 25 小时。课程另引 Stanford CS336、MIT 6.5940 EfficientML、GPU MODE 等外部资源。
发布基准前附 8 条检查清单;性能数据均注明"来源自述未独立复现";token 成本与 GPU 时价变动快,经济学 session 重方法论,须用自己的硬件重推;欢迎 issue/PR 修坏链、补视频纯文字版、贡献自己的 benchmark 报告。
对位于各类 awesome 列表和视频课程:它胜在单产物主线、read/build/skim 分层与成本意识(Week9 单位经济);资源皆指路权威一手出处而非自录内容,维护负担低、可信度高。
仓库:https://github.com/patchy631/time-to-first-token ;许可 CC BY 4.0("Use it, adapt it, teach from it.");作者 Twitter @akshay_pachaar。