飞牛 fnOS 搭载 Tesla V100 + Ollama 运行 Qwen3.6-27B 全攻略
| 项目 |
详情 |
| 日期 |
2026-08-07 |
| 飞牛系统版本 |
fnOS 1.2.0302(Debian 12 bookworm,内核 6.18.18.c938-trim) |
| GPU |
NVIDIA Tesla V100-SXM2-32GB(PCIe 版) |
| 模型 |
Qwen3.6-27B(Q4_K_M 量化,GGUF 格式) |
一、效果预览
$ nvidia-smi
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.142 Driver Version: 580.142 CUDA Version: 13.0 |
| 0 Tesla V100-SXM2-32GB Off | 00000000:01:00.0 Off | 0 |
| N/A 34C P0 23W / 300W | 0MiB / 32768MiB | 0% Default |
+-----------------------------------------------------------------------------------------+
推理时满载状态:
| GPU 利用率 |
显存 |
功耗 |
温度 |
| 96% |
19387MiB / 32768MiB |
235W |
80°C |
结论: V100 满血 96% GPU 利用率,Qwen3.6-27B Q4_K_M 量化版完整加载到显存,推理速度飞快。
二、为什么选这个方案
| 对比项 |
飞牛内置方案 |
手动 Docker 方案 |
| 驱动安装 |
应用商店一键装 |
需要手动下载 .run 包 |
| Ollama |
应用商店一键装 |
需要 Docker + GPU 运行时 |
| 配置复杂度 |
⭐ 极简 |
⭐⭐⭐ 需要配 CTK |
| GPU 性能 |
CUDA 满血 |
CUDA 满血 |
| 维护难度 |
应用商店自动更新 |
手动管理容器 |
推荐飞牛内置方案,省心省力,效果一样。
三、硬件配置参考
| 组件 |
推荐 |
| GPU |
Tesla V100-SXM2-32GB |
| CPU |
Intel i5-13600T |
| 内存 |
64GB DDR5 |
| 存储 |
SSD/NVMe |
| 电源 |
700W |
四、完整安装步骤
步骤 1:确认 GPU 被系统识别
SSH 登录飞牛,执行:
lspci | grep -i nvidia
应该看到类似:
01:00.0 3D controller: NVIDIA Corporation GV100GL [Tesla V100 SXM2 32GB]
注意: 如果没看到,检查 PCIe 是否插好、电源是否接好。
步骤 2:安装 NVIDIA 580 驱动(以及NVIDIA Container Toolkit)
- 打开飞牛 Web 管理界面
- 进入 应用中心
- 搜索 "NVIDIA"
- 找到 "NVIDIA 580 驱动" 和NVIDIA Container Toolkit,都点击安装
- 等待安装完成(约 2-3 分钟)
安装完成后验证:
nvidia-smi
应该看到:
NVIDIA-SMI 580.142 Driver Version: 580.142 CUDA Version: 13.0
GPU: Tesla V100-SXM2-32GB 显存: 32768MiB
关键指标:
- Driver Version: 580.142(与内核模块版本一致)
- CUDA Version: 13.0
- 显存完整识别 32GB
步骤 3:验证驱动全链路
# 检查设备节点
ls -la /dev/nvidia*
应该看到:
/dev/nvidia0
/dev/nvidiactl
/dev/nvidia-uvm
/dev/nvidia-uvm-tools
检查 GPU 详细信息
cat /proc/driver/nvidia/gpus/*/information
应该看到:
Model: Tesla V100-SXM2-32GB
GPU Excluded: No
步骤 4:安装 Ollama + Open-WebUI
- 在飞牛应用中心搜索 "Ollama"
- 找到 "AI 应用"(包含 Ollama + Open-WebUI),点击安装
- 等待安装完成
安装完成后,应用会自动启动。
步骤 5:拉取 Qwen3.6-27B 模型
在 Ollama 应用的 Web 界面(通常是 http://飞牛IP:11436),或者通过命令行:
ollama pull qwen3.6:27b
模型信息:
- 参数量:27.8B
- 量化:Q4_K_M
- 格式:GGUF
- 文件大小:约 17GB
- 上下文长度:262144 tokens
步骤 6:验证 GPU 是否被使用
# 查看 GPU 状态
nvidia-smi
查看谁在用 GPU
nvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csv
推理时应该看到:
GPU-Util: 96%
显存占用: ~19387MiB
功耗: ~235W
温度: ~80°C
进程: llama-server 占用 19384MiB
五、简单测试
推理性能(Qwen3.6-27B Q4_K_M)
| 指标 |
数值 |
| GPU 利用率 |
96% |
| 显存占用 |
19387MiB / 32768MiB(约 60%) |
| 推理功耗 |
235-240W |
| 推理温度 |
78-81°C |
| 空闲功耗 |
23-43W |
| 空闲温度 |
34-54°C |
温度说明
| 状态 |
温度 |
功耗 |
说明 |
| 空闲(无对话) |
34-54°C |
23-43W |
模型常驻显存,GPU 空闲 |
| 推理中 |
78-81°C |
235-240W |
满血运行,安全范围 |
V100 官方安全上限:100°C,实测 80°C 完全正常,不用担心。
与其他方案对比
| 方案 |
GPU 利用率 |
说明 |
| Ollama + CUDA(本方案) |
96% |
满血性能 |
| Ollama + Vulkan |
45% |
性能损失一半 |
| 手动 llama.cpp + CUDA |
96% |
同等性能,但配置复杂 |
六、进阶配置
6.1 切换 CUDA 后端(如果发现用的是 Vulkan)
飞牛 Ollama 应用默认可能用 Vulkan 后端(性能差一半),需要手动切换到 CUDA:
# 查看当前后端
# 如果看到 OLLAMA_VULKAN=1,说明用的是 Vulkan
ps -ef | grep ollama
cat /proc/$(pgrep -f 'ollama serve')/environ | tr '\0' '\n' | grep OLLAMA
修改配置(需要 SSH 操作)
sudo sed -i 's/export OLLAMA_VULKAN=1/export OLLAMA_VULKAN=0/'
/var/apps/ai_installer/cmd/service-setup
重启 AI 应用(飞牛 Web 应用中心 → 停止 → 启动)
6.2 调整上下文长度
默认上下文 32768 tokens,可以根据需要调整:
# 编辑 ollama 启动参数
# 在 service-setup 的 SERVICE_COMMAND 中添加 -c 参数
# 例如:--ctx-size 65536
6.3 GPU 监控脚本
创建一个快捷监控脚本:
cat > /tmp/gpu_monitor.sh << 'EOF'
#!/bin/bash
echo "===== GPU 状态 ====="
nvidia-smi --query-gpu=temperature.gpu,power.draw,utilization.gpu,memory.used,memory.total \
--format=csv
echo ""
echo "===== GPU 进程 ====="
nvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csv
EOF
chmod +x /tmp/gpu_monitor.sh
使用:
# 一次性查看
bash /tmp/gpu_monitor.sh
持续监控(每秒刷新)
watch -n 1 nvidia-smi
七、常见问题
Q1: nvidia-smi 报错 "command not found"
原因: NVIDIA 驱动未安装或安装失败。
解决:
- 确认飞牛应用中心的 NVIDIA 580 驱动已安装
- 重启飞牛系统
- 重新运行
nvidia-smi
Q2: GPU 显存为 0MiB,没有进程
原因: 模型未加载(懒加载机制)。
解决:
- 发送一条对话触发模型加载
- 再运行
nvidia-smi 查看显存占用
Q3: GPU 利用率只有 45%,不是满血
原因: Ollama 使用了 Vulkan 后端。
解决: 参考「6.1 切换 CUDA 后端」。
Q4: 温度 80°C 会不会烧坏?
不会。 V100 官方安全上限 100°C,80°C 是满载正常温度。空闲时会降到 40-50°C。
Q5: 电源不够怎么办?
V100 峰值功耗 300W,加上其他硬件约 150W,总共需要 450W+。如果电源不足:
- 更换 650W+ 电源
- 或者限制 V100 功耗:
nvidia-smi -pl 250(限制到 250W,性能略降)
Q6: Ollama 重启后模型要重新下载吗?
不需要。 模型文件保存在 /vol2/@apphome/ai_installer/models/,重启不会丢失。
Q7: 如何查看 Ollama 日志?
# 查看 ollama 进程日志
journalctl -u ai_manager -f
或者直接看 ollama 输出
tail -f /vol2/@appdata/ai_installer/logs/ai_installer.log
八、总结
| 项目 |
结果 |
| 驱动安装 |
✅ 应用商店一键装 |
| Ollama 安装 |
✅ 应用商店一键装 |
| GPU 识别 |
✅ 32768MiB 完整识别 |
| CUDA 后端 |
✅ 96% 满血性能 |
| 模型加载 |
✅ 19387MiB 显存占用 |
| 推理温度 |
✅ 80°C(安全范围) |
| 推理功耗 |
✅ 235W(300W 上限内) |
一句话总结: 飞牛 fnOS + NVIDIA 580 驱动 + Ollama + V100,三步搞定大模型推理,CUDA 满血 96%,温度 80°C,稳得一批。
未做性能测试和tokens/s测试。
九、相关链接
本文基于实测经验撰写,如有问题欢迎留言讨论。