收起左侧

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

0
回复
25
查看
[ 复制链接 ]

210

主题

18

回帖

0

牛值

江湖新锐

社区上线纪念勋章fnOS1.0上线纪念勋章EVO2产品纪念

llama.cpp:

一款纯 C/C++ 开发的开源大模型离线推理引擎,所有 AI 计算都在本地完成。

🚀 核心亮点

  • • 纯 C/C++ 实现:无需额外依赖,轻量高效。
  • • 跨平台支持:Linux、Windows、macOS,以及多种 GPU(CUDA、HIP、SYCL、Vulkan、WebGPU)。
  • • 极致性能优化:支持 1.5–8 bit 量化,显著降低内存占用并加快推理速度。
  • • 灵活部署:可直接运行二进制文件、Docker 部署,或通过 Hugging Face 下载模型。
  • • 多种接口:CLI、OpenAI 兼容 API server、Web UI,满足不同使用场景。
  • • 社区活跃:GitHub 上有十多万 Star,贡献者众多,生态完善。

安装

Docker Compose(纯 CPU 推理)

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server
    container_name: llama
    ports:
      - 8080:8080
    volumes:
      - ./models:/models
    command:
      - "-m"
      - "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
    restart: always

Docker Compose(GPU 加速)

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-vulkan
    container_name: llama
    ports:
      - 8080:8080
    volumes:
      - ./models:/models
    devices:
      - /dev/dri:/dev/dri
    command:
      - "-m"
      - "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
    restart: always

参数说明(更多参数建议去看文档)

/models(路径):存放模型

/dev/dri(硬件):透传核显功能

/models/Qwen3.5-0.8B-Q4_K_M.gguf(运行命令):根据实际情况,填写模型名称

TIP:llama.cpp 可以调节命令项很多,上面只给出了基础的参数。要想发挥设备全部性能,需要根据实际情况灵活配置。当然不管怎么样调节,提升性能效果都是有限的,最重要的还是硬件本身。

Docker Compose(根据设备情况特调)

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-vulkan
    container_name: llama
    devices:
      - /dev/dri:/dev/dri
    ports:
      - "8080:8080"
    volumes:
      - ./models:/models
    command:
      - "-m"
      - "/models/Qwen3.5-4B-Q4_K_M.gguf"
      - "--chat-template-kwargs"
      - '{"enable_thinking": false}'
      - "--gpu-layers"
      - "99"
      - "--threads"
      - "4"
    restart: unless-stopped

准备

第一步,准备模型文件(GGUF 格式)。国内用户直接去魔塔社区下载,速度快不用科学上网。

https://www.modelscope.cn/models

筛选格式为 GGUF 的,至于选什么模型就看个人喜好了

下面是评测用到的模型

https://www.modelscope.cn/models/unsloth/Qwen3.5-0.8B-GGUFhttps://www.modelscope.cn/models/unsloth/Qwen3.5-2B-GGUFhttps://www.modelscope.cn/models/unsloth/Qwen3.5-4B-GGUF

### 使用

浏览器中输入 <span leaf="">http://NAS的IP:8080</span> 就能看到界面

TIP:为了截图效果更好,切换成深色模式

右下角可以添加上传文件资料

右下角显示当前正在运行的模型,点它还能看参数详情

日常聊天如果是用 0.8B 的模型,回复速度非常快的达到 33.21 t/s

底下的小圆点指示上下文长度,点击能看到输入和输出的速度

点击模型,可以看到具体的参数设置信息

同时支持添加 MCP 服务,扩展各种功能

有兴趣的可以部署试试,有可视化操作界面挺不错的

TIP:兼容 OpenAI 的协议,按要求填写 URL ,密钥随便填就行

模型可以正常识别和加载

如果是其他工具调用,首次有可能会嵌入提示词,所以回复会慢一点

### 测试

测试目的很直接:对比纯 CPU 和核显加速的差距,看不同模型大小的表现。为公平起见,全部用默认参数,关掉了思考模式。

测试硬件:

  • • 处理器:12th Gen Intel(R) Core(TM) i5-1235U
  • • 内存:32GB DDR5 4800MHz

测试对象:

  • • llama.cpp:server(纯 CPU 推理)
  • • llama.cpp:server-vulkan(GPU 加速)

测试模型:

  • • Qwen3.5-0.8B-Q4_K_M.gguf
  • • Qwen3.5-2B-Q4_K_M.gguf
  • • Qwen3.5-4B-Q4_K_M.gguf

测试问题:

  • • 我们为什么存在?

llama.cpp:server(纯 CPU 推理)

CPU GPU 内存 耗时 生成速度
Qwen3.5-0.8B 16% 0% 3592MB 22s 27.87 t/s
Qwen3.5-2B 16%-17% 0% 4093MB 45s 14.11 t/s
Qwen3.5-4B 16%-17% 0% 10800MB 1min 46s 6.41 t/s

llama.cpp:server-vulkan(GPU 加速)

CPU GPU 内存 耗时 生成速度
Qwen3.5-0.8B 6%-9% 29% 4569MB 17s 31.08 t/s
Qwen3.5-2B 5%-7% 99% 5906MB 40s 17.33 t/s
Qwen3.5-4B 4%-5% 100% 12563MB 1min 11s 8.57 t/s

llama.cpp:server-vulkan(特调)

CPU GPU 内存 耗时 生成速度
Qwen3.5-0.8B 6% 99% 4689MB 25s 31.59 t/s
Qwen3.5-2B 5%-7% 99% 5867MB 32s 17.37 t/s
Qwen3.5-4B 4%-8% 30% 12256MB 52s 8.74 t/s

总结

llama.cpp 算得上是本地跑大模型最成熟的方案,纯 C/C++ 写的推理运行效率高。日常使用中多数设备核显长期闲置,刚好可以借助本地 AI 推理充分利用硬件性能。相较纯 CPU 运行,开启核显加速后推理速度普遍有明显提升,还能大幅削减 CPU 负载。受限于硬件性能,只能流畅运行轻量化小模型,但完全可以胜任数据脱敏、模型微调、离线私人助手等场景。

综合推荐:⭐⭐⭐⭐(推理速度快,可自由调参)

使用体验:⭐⭐⭐(可视化界面,使用简单)

部署难易:⭐(非常简单)︎

收藏
送赞
分享
不定时分享 NAS 教程
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则