首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

ggml-org/llama.cpp

让 LLM/VLM 推理在几乎一切硬件上"零依赖、极致性能"成为可能的传奇项目:一套纯 C/C++ 实现,撑起了从手机、Mac 到数据中心 GPU 集群的整个本地大模型推理生态。本地推理需求随边缘 AI 与隐私计算浪潮持续增长,而 llama.cpp 作为事实标准不断吸收最新硬件支持——后端矩阵近年被 VirtGPU、ZenDNN、WebGPU 等填得更满;分发渠道也日益友好:官网 llama.app 一键装机、winget/Docker/Release 二进制多线并行。

语言
C++
⭐ 总星标
125,753
📅 创建
早期项目
🍴 Forks
0
许可证
未标注
🔥 本月净增
+4,553
在 GitHub 打开 回到总表

配图

信息卡

项目内容
仓库ggml-org/llama.cpp
语言 / 许可证C++ / MIT
总星标⭐ 125753
本月净增星标+4553
榜单GitHub官方月度趋势榜 第36名

一句话定位

让 LLM/VLM 推理在几乎一切硬件上"零依赖、极致性能"成为可能的传奇项目:一套纯 C/C++ 实现,撑起了从手机、Mac 到数据中心 GPU 集群的整个本地大模型推理生态。

趋势解读:为什么火

本地推理需求随边缘 AI 与隐私计算浪潮持续增长,而 llama.cpp 作为事实标准不断吸收最新硬件支持——后端矩阵近年被 VirtGPU、ZenDNN、WebGPU 等填得更满;分发渠道也日益友好:官网 llama.app 一键装机、winget/Docker/Release 二进制多线并行。CLI 更名为 llama cli/serve 子命令形态进一步降低上手门槛。老树不停发新芽,12.5 万星之后仍在攀升。

核心功能拆解

7. CPU+GPU 混合推理:超过总显存的模型可拆层调度部分加速;

8. 产品级工具链:llama cli 终端对话、llama serve 提供 OpenAI 兼容 REST API 加内置 Web UI,GBNF 语法定义可精确约束输出格式。

架构与技术栈浅析

分层清晰:ggml 层提供张量算子、量化例程与内存池;llama 层负责 tokenizer、KV cache 与采样策略;tools 层交付 cli/server/completion 等用户入口。依赖刻意收敛为五个单头文件库——cpp-httplib(HTTP 服务)、stb 与 miniaudio(多模态图像/音频解码)、nlohmann/json、subprocess.h,清一色 MIT 或公有领域许可,维持了项目标志性的极简可移植性。维护上由 ggml-org 组织统筹,ggerganov 等核心维护者开放 PR 协作通道。

安装与环境要求

四条路径任选:访问 llama.app 按官网指引安装;`docker` 运行官方镜像(见 docs/docker.md);从 Releases 下载各平台预编译二进制;或克隆仓库参照 docs/build.md 从源码编译——纯 CPU 即可起步,按需开启 CUDA/Metal/Vulkan 等 backend 编译选项。

快速上手示例

llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF    # 直接从 HuggingFace 拉取模型开始对话
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF  # 启动 OpenAI 兼容 API 服务器

`serve` 会自动附带内置 Web UI,浏览器打开即是聊天界面,视觉语言模型会话中还支持贴图提问,效果如首页演示 GIF 所示。

进阶使用要点

典型应用场景

同类生态位对比

vLLM 擅长云端高吞吐批处理但绑定重型 Python/CUDA 栈;MLX 生态只在苹果平台出彩;llama.cpp 以广谱硬件兼容与极致轻量见长,常常是边缘设备唯一可行解。Ollama、LM Studio 等下游明星产品本质上都构建在它之上,可见其底座地位短期无可撼动。

资源导航

← 上一篇Lordog/dive-into-llms下一篇 →google/skills