收起左侧

飞牛 fnOS 搭载 Tesla V100 + Ollama 运行 Qwen3.6-27B 全攻略

0
回复
133
查看
[ 复制链接 ]

1

主题

0

回帖

0

牛值

江湖小虾

飞牛 fnOS 搭载 Tesla V100 + Ollama 运行 Qwen3.6-27B 全攻略

项目 详情
日期 2026-08-07
飞牛系统版本 fnOS 1.2.0302(Debian 12 bookworm,内核 6.18.18.c938-trim)
GPU NVIDIA Tesla V100-SXM2-32GB(PCIe 版)
模型 Qwen3.6-27B(Q4_K_M 量化,GGUF 格式)

一、效果预览

$ nvidia-smi
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.142                Driver Version: 580.142        CUDA Version: 13.0     |
|   0  Tesla V100-SXM2-32GB           Off |   00000000:01:00.0 Off |                    0 |
| N/A   34C    P0             23W /  300W |       0MiB /  32768MiB |      0%      Default |
+-----------------------------------------------------------------------------------------+

推理时满载状态:

GPU 利用率 显存 功耗 温度
96% 19387MiB / 32768MiB 235W 80°C

结论: V100 满血 96% GPU 利用率,Qwen3.6-27B Q4_K_M 量化版完整加载到显存,推理速度飞快。


二、为什么选这个方案

对比项 飞牛内置方案 手动 Docker 方案
驱动安装 应用商店一键装 需要手动下载 .run 包
Ollama 应用商店一键装 需要 Docker + GPU 运行时
配置复杂度 ⭐ 极简 ⭐⭐⭐ 需要配 CTK
GPU 性能 CUDA 满血 CUDA 满血
维护难度 应用商店自动更新 手动管理容器

推荐飞牛内置方案,省心省力,效果一样。


三、硬件配置参考

组件 推荐
GPU Tesla V100-SXM2-32GB
CPU Intel i5-13600T
内存 64GB DDR5
存储 SSD/NVMe
电源 700W

四、完整安装步骤

步骤 1:确认 GPU 被系统识别

SSH 登录飞牛,执行:

lspci | grep -i nvidia

应该看到类似:

01:00.0 3D controller: NVIDIA Corporation GV100GL [Tesla V100 SXM2 32GB]

注意: 如果没看到,检查 PCIe 是否插好、电源是否接好。

步骤 2:安装 NVIDIA 580 驱动(以及NVIDIA Container Toolkit)

  1. 打开飞牛 Web 管理界面
  2. 进入 应用中心
  3. 搜索 "NVIDIA"
  4. 找到 "NVIDIA 580 驱动" 和NVIDIA Container Toolkit,都点击安装
  5. 等待安装完成(约 2-3 分钟)

安装完成后验证:

nvidia-smi

应该看到:

NVIDIA-SMI 580.142    Driver Version: 580.142    CUDA Version: 13.0
GPU: Tesla V100-SXM2-32GB    显存: 32768MiB

关键指标:

  • Driver Version: 580.142(与内核模块版本一致)
  • CUDA Version: 13.0
  • 显存完整识别 32GB

步骤 3:验证驱动全链路

# 检查设备节点
ls -la /dev/nvidia*

应该看到:

/dev/nvidia0

/dev/nvidiactl

/dev/nvidia-uvm

/dev/nvidia-uvm-tools

检查 GPU 详细信息

cat /proc/driver/nvidia/gpus/*/information

应该看到:

Model: Tesla V100-SXM2-32GB

GPU Excluded: No

步骤 4:安装 Ollama + Open-WebUI

  1. 在飞牛应用中心搜索 "Ollama"
  2. 找到 "AI 应用"(包含 Ollama + Open-WebUI),点击安装
  3. 等待安装完成

安装完成后,应用会自动启动。

步骤 5:拉取 Qwen3.6-27B 模型

在 Ollama 应用的 Web 界面(通常是 http://飞牛IP:11436),或者通过命令行:

ollama pull qwen3.6:27b

模型信息:

  • 参数量:27.8B
  • 量化:Q4_K_M
  • 格式:GGUF
  • 文件大小:约 17GB
  • 上下文长度:262144 tokens

步骤 6:验证 GPU 是否被使用

# 查看 GPU 状态
nvidia-smi

查看谁在用 GPU

nvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csv

推理时应该看到:

GPU-Util: 96%
显存占用: ~19387MiB
功耗: ~235W
温度: ~80°C
进程: llama-server 占用 19384MiB

五、简单测试

推理性能(Qwen3.6-27B Q4_K_M)

指标 数值
GPU 利用率 96%
显存占用 19387MiB / 32768MiB(约 60%)
推理功耗 235-240W
推理温度 78-81°C
空闲功耗 23-43W
空闲温度 34-54°C

温度说明

状态 温度 功耗 说明
空闲(无对话) 34-54°C 23-43W 模型常驻显存,GPU 空闲
推理中 78-81°C 235-240W 满血运行,安全范围

V100 官方安全上限:100°C,实测 80°C 完全正常,不用担心。

与其他方案对比

方案 GPU 利用率 说明
Ollama + CUDA(本方案) 96% 满血性能
Ollama + Vulkan 45% 性能损失一半
手动 llama.cpp + CUDA 96% 同等性能,但配置复杂

六、进阶配置

6.1 切换 CUDA 后端(如果发现用的是 Vulkan)

飞牛 Ollama 应用默认可能用 Vulkan 后端(性能差一半),需要手动切换到 CUDA:

# 查看当前后端
# 如果看到 OLLAMA_VULKAN=1,说明用的是 Vulkan
ps -ef | grep ollama
cat /proc/$(pgrep -f 'ollama serve')/environ | tr '\0' '\n' | grep OLLAMA

修改配置(需要 SSH 操作)

sudo sed -i 's/export OLLAMA_VULKAN=1/export OLLAMA_VULKAN=0/'
/var/apps/ai_installer/cmd/service-setup

重启 AI 应用(飞牛 Web 应用中心 → 停止 → 启动)

6.2 调整上下文长度

默认上下文 32768 tokens,可以根据需要调整:

# 编辑 ollama 启动参数
# 在 service-setup 的 SERVICE_COMMAND 中添加 -c 参数
# 例如:--ctx-size 65536

6.3 GPU 监控脚本

创建一个快捷监控脚本:

cat > /tmp/gpu_monitor.sh << 'EOF'
#!/bin/bash
echo "===== GPU 状态 ====="
nvidia-smi --query-gpu=temperature.gpu,power.draw,utilization.gpu,memory.used,memory.total \
    --format=csv
echo ""
echo "===== GPU 进程 ====="
nvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csv
EOF
chmod +x /tmp/gpu_monitor.sh

使用:

# 一次性查看
bash /tmp/gpu_monitor.sh

持续监控(每秒刷新)

watch -n 1 nvidia-smi


七、常见问题

Q1: nvidia-smi 报错 "command not found"

原因: NVIDIA 驱动未安装或安装失败。

解决:

  1. 确认飞牛应用中心的 NVIDIA 580 驱动已安装
  2. 重启飞牛系统
  3. 重新运行 nvidia-smi

Q2: GPU 显存为 0MiB,没有进程

原因: 模型未加载(懒加载机制)。

解决:

  1. 发送一条对话触发模型加载
  2. 再运行 nvidia-smi 查看显存占用

Q3: GPU 利用率只有 45%,不是满血

原因: Ollama 使用了 Vulkan 后端。

解决: 参考「6.1 切换 CUDA 后端」。

Q4: 温度 80°C 会不会烧坏?

不会。 V100 官方安全上限 100°C,80°C 是满载正常温度。空闲时会降到 40-50°C。

Q5: 电源不够怎么办?

V100 峰值功耗 300W,加上其他硬件约 150W,总共需要 450W+。如果电源不足:

  1. 更换 650W+ 电源
  2. 或者限制 V100 功耗:nvidia-smi -pl 250(限制到 250W,性能略降)

Q6: Ollama 重启后模型要重新下载吗?

不需要。 模型文件保存在 /vol2/@apphome/ai_installer/models/,重启不会丢失。

Q7: 如何查看 Ollama 日志?

# 查看 ollama 进程日志
journalctl -u ai_manager -f

或者直接看 ollama 输出

tail -f /vol2/@appdata/ai_installer/logs/ai_installer.log


八、总结

项目 结果
驱动安装 ✅ 应用商店一键装
Ollama 安装 ✅ 应用商店一键装
GPU 识别 ✅ 32768MiB 完整识别
CUDA 后端 ✅ 96% 满血性能
模型加载 ✅ 19387MiB 显存占用
推理温度 ✅ 80°C(安全范围)
推理功耗 ✅ 235W(300W 上限内)

一句话总结: 飞牛 fnOS + NVIDIA 580 驱动 + Ollama + V100,三步搞定大模型推理,CUDA 满血 96%,温度 80°C,稳得一批。

未做性能测试和tokens/s测试。


九、相关链接


本文基于实测经验撰写,如有问题欢迎留言讨论。


收藏
送赞 1
分享
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则