llama.cpp:
一款纯 C/C++ 开发的开源大模型离线推理引擎,所有 AI 计算都在本地完成。
🚀 核心亮点
- • 纯 C/C++ 实现:无需额外依赖,轻量高效。
- • 跨平台支持:Linux、Windows、macOS,以及多种 GPU(CUDA、HIP、SYCL、Vulkan、WebGPU)。
- • 极致性能优化:支持 1.5–8 bit 量化,显著降低内存占用并加快推理速度。
- • 灵活部署:可直接运行二进制文件、Docker 部署,或通过 Hugging Face 下载模型。
- • 多种接口:CLI、OpenAI 兼容 API server、Web UI,满足不同使用场景。
- • 社区活跃:GitHub 上有十多万 Star,贡献者众多,生态完善。
安装
Docker Compose(纯 CPU 推理)
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server
container_name: llama
ports:
- 8080:8080
volumes:
- ./models:/models
command:
- "-m"
- "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
restart: always
Docker Compose(GPU 加速)
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-vulkan
container_name: llama
ports:
- 8080:8080
volumes:
- ./models:/models
devices:
- /dev/dri:/dev/dri
command:
- "-m"
- "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
restart: always
参数说明(更多参数建议去看文档)
/models(路径):存放模型
/dev/dri(硬件):透传核显功能
/models/Qwen3.5-0.8B-Q4_K_M.gguf(运行命令):根据实际情况,填写模型名称
TIP:llama.cpp 可以调节命令项很多,上面只给出了基础的参数。要想发挥设备全部性能,需要根据实际情况灵活配置。当然不管怎么样调节,提升性能效果都是有限的,最重要的还是硬件本身。
Docker Compose(根据设备情况特调)
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-vulkan
container_name: llama
devices:
- /dev/dri:/dev/dri
ports:
- "8080:8080"
volumes:
- ./models:/models
command:
- "-m"
- "/models/Qwen3.5-4B-Q4_K_M.gguf"
- "--chat-template-kwargs"
- '{"enable_thinking": false}'
- "--gpu-layers"
- "99"
- "--threads"
- "4"
restart: unless-stopped
准备
第一步,准备模型文件(GGUF 格式)。国内用户直接去魔塔社区下载,速度快不用科学上网。
https://www.modelscope.cn/models
筛选格式为 GGUF 的,至于选什么模型就看个人喜好了
下面是评测用到的模型
https://www.modelscope.cn/models/unsloth/Qwen3.5-0.8B-GGUFhttps://www.modelscope.cn/models/unsloth/Qwen3.5-2B-GGUFhttps://www.modelscope.cn/models/unsloth/Qwen3.5-4B-GGUF
### 使用
浏览器中输入 <span leaf="">http://NAS的IP:8080</span> 就能看到界面
TIP:为了截图效果更好,切换成深色模式
右下角可以添加上传文件资料
右下角显示当前正在运行的模型,点它还能看参数详情
日常聊天如果是用 0.8B 的模型,回复速度非常快的达到 33.21 t/s
底下的小圆点指示上下文长度,点击能看到输入和输出的速度
点击模型,可以看到具体的参数设置信息
同时支持添加 MCP 服务,扩展各种功能
有兴趣的可以部署试试,有可视化操作界面挺不错的
TIP:兼容 OpenAI 的协议,按要求填写 URL ,密钥随便填就行
模型可以正常识别和加载
如果是其他工具调用,首次有可能会嵌入提示词,所以回复会慢一点
### 测试
测试目的很直接:对比纯 CPU 和核显加速的差距,看不同模型大小的表现。为公平起见,全部用默认参数,关掉了思考模式。
测试硬件:
- • 处理器:12th Gen Intel(R) Core(TM) i5-1235U
- • 内存:32GB DDR5 4800MHz
测试对象:
- • llama.cpp:server(纯 CPU 推理)
- • llama.cpp:server-vulkan(GPU 加速)
测试模型:
- • Qwen3.5-0.8B-Q4_K_M.gguf
- • Qwen3.5-2B-Q4_K_M.gguf
- • Qwen3.5-4B-Q4_K_M.gguf
测试问题:
llama.cpp:server(纯 CPU 推理)
|
CPU |
GPU |
内存 |
耗时 |
生成速度 |
| Qwen3.5-0.8B |
16% |
0% |
3592MB |
22s |
27.87 t/s |
| Qwen3.5-2B |
16%-17% |
0% |
4093MB |
45s |
14.11 t/s |
| Qwen3.5-4B |
16%-17% |
0% |
10800MB |
1min 46s |
6.41 t/s |
llama.cpp:server-vulkan(GPU 加速)
|
CPU |
GPU |
内存 |
耗时 |
生成速度 |
| Qwen3.5-0.8B |
6%-9% |
29% |
4569MB |
17s |
31.08 t/s |
| Qwen3.5-2B |
5%-7% |
99% |
5906MB |
40s |
17.33 t/s |
| Qwen3.5-4B |
4%-5% |
100% |
12563MB |
1min 11s |
8.57 t/s |
llama.cpp:server-vulkan(特调)
|
CPU |
GPU |
内存 |
耗时 |
生成速度 |
| Qwen3.5-0.8B |
6% |
99% |
4689MB |
25s |
31.59 t/s |
| Qwen3.5-2B |
5%-7% |
99% |
5867MB |
32s |
17.37 t/s |
| Qwen3.5-4B |
4%-8% |
30% |
12256MB |
52s |
8.74 t/s |
总结
llama.cpp 算得上是本地跑大模型最成熟的方案,纯 C/C++ 写的推理运行效率高。日常使用中多数设备核显长期闲置,刚好可以借助本地 AI 推理充分利用硬件性能。相较纯 CPU 运行,开启核显加速后推理速度普遍有明显提升,还能大幅削减 CPU 负载。受限于硬件性能,只能流畅运行轻量化小模型,但完全可以胜任数据脱敏、模型微调、离线私人助手等场景。
综合推荐:⭐⭐⭐⭐(推理速度快,可自由调参)
使用体验:⭐⭐⭐(可视化界面,使用简单)
部署难易:⭐(非常简单)︎
