收起左侧

资源管理GPU显示bug

8
回复
206
查看
[ 复制链接 ]

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-5 22:11:11 显示全部楼层 阅读模式

微信图片_20260605215054_3897_14.png

root@L:/lib/modules# nvidia-smi -L
GPU 0: NVIDIA T600 (UUID: GPU-e7e67536-0eca-904e-072d-30506d83a9a3)
GPU 1: NVIDIA GeForce RTX 3060 (UUID: GPU-749bff73-2b17-ae2a-431b-552be27b7ac1)
root@L:/lib/modules# lspci | grep -i nvidia
05:00.0 VGA compatible controller: NVIDIA Corporation TU117GL [T600] (rev a1)
05:00.1 Audio device: NVIDIA Corporation Device 10fa (rev a1)
0a:00.0 VGA compatible controller: NVIDIA Corporation GA106 [GeForce RTX 3060] (rev a1)
0a:00.1 Audio device: NVIDIA Corporation GA106 High Definition Audio Controller (rev a1)
root@L:/lib/modules# uname -a
Linux LSD-Home-Store 6.18.18-trim #570 SMP PREEMPT_DYNAMIC Fri May 8 07:07:34 UTC 2026 x86_64 GNU/Linux
root@L:/lib/modules# cat /proc/version
Linux version 6.18.18-trim (devops@fnnas.com) (x86_64-linux-gnu-gcc (Debian 12.2.0-14) 12.2.0, GNU ld (GNU Binutils for Debian) 2.40) #570 SMP PREEMPT_DYNAMIC Fri May 8 07:07:34 UTC 2026 

** **lspci -nn | grep -i nvidia

05:00.0 VGA compatible controller [0300]: NVIDIA Corporation TU117GL [T600] [10de:1fb1] (rev a1)

05:00.1 Audio device [0403]: NVIDIA Corporation Device [10de:10fa] (rev a1)

0a:00.0 VGA compatible controller [0300]: NVIDIA Corporation GA106 [GeForce RTX 3060] [10de:2503] (rev a1)

0a:00.1 Audio device [0403]: NVIDIA Corporation GA106 High Definition Audio Controller [10de:228e] (rev a1)

升级6.18.18以前是正常的,升级以后不知道什么时候就不正常了,目前发现仅仅是显示不正常,但是GPU功能不受影响。

收藏
送赞
分享

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
2026-6-8 14:56:02 显示全部楼层

感谢反馈!这个现象先记录一下,麻烦再确认一下当前飞牛 OS 的具体版本号。我转给相关同学看看。

标题: 内核升级至 6.18.18-trim 后,Web 桌面资源管理器 GPU 状态栏两张卡显示相同数据 系统信息: - FlyNAS 版本:[1.1.3107] - 内核版本:Linux 6.18.18-trim #570 SMP PREEMPT_DYNAMIC Fri May 8 07:07:3  详情 回复
2026-6-24 23:04
分析结果总结 经过深入排查,以下是完整的诊断结论: 数据层一切正常: - NVML 库 (libnvidia-ml.so.580.142) 正确枚举两张 GPU,返回不同的显存、温度数据 - /proc/driver/nvidia/gpus/ 下两张卡分别有正  详情 回复
2026-6-24 22:44

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-16 20:56:06 楼主 显示全部楼层

最新版本的1.1.3107。现在显卡已经换成2块3060-12gb了。但是资源管理里的GPU项显示的状态是一模一样的。
image.png

用nvidia-smi得到的正确的
image.png

换之前我还以为是驱动序号的问题,结果,还是这样的。资源管理里面是检测不到了,版本升级之前本来是正常的。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-16 20:57:33 楼主 显示全部楼层

似乎应该是资源管理器某个GPU序号之类的问题。我没有找到相关的故障点。

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-18 18:06:19 楼主 显示全部楼层

我今天在飞牛nas上安装了Claude code2.1.178,openclaw还是听不懂我在说什么,我用Claude code试试看能不能找到故障点

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-24 22:43:42 楼主 显示全部楼层

最终的结论。

分析结果总结

** **经过深入排查,以下是完整的诊断结论:

** **数据层一切正常:

** **- NVML 库 (libnvidia-ml.so.580.142) 正确枚举两张 GPU,返回不同的显存、温度数据

** **- /proc/driver/nvidia/gpus/ 下两张卡分别有正确的 PCI BusID、UUID、Model

** **- dmesg 无 NVIDIA 报错

** **发现了一个可能的诱因:

** **DRM 设备层有一个"多余"的 card0:

** ****──────────**─────────────────**─────────────────────────────────────**

** ** DRM 设备 ** **物理 GPU ** ** **驱动 ** ****

** ****──────────**─────────────────**─────────────────────────────────────**

** ** card0 **** 0a:00.0 (GPU 1) ** simple-framebuffer (内核基本帧缓冲) **

** ****──────────**─────────────────**─────────────────────────────────────**

** ** card1 **** 05:00.0 (GPU 0) ** nvidia (专有驱动) ** ****

** ****──────────**─────────────────**─────────────────────────────────────**

** ** card2 **** 0a:00.0 (GPU 1) ** nvidia (专有驱动) ** ****

** ****──────────**─────────────────**─────────────────────────────────────**

** **GPU 1 被两个不同的 DRM 驱动接管了两次:一次是内核 simple-framebuffer(用于基本显示输出),另一次是 NVIDIA 专有驱动。

** **问题定位: FlyNAS 的 libigputop.so 库在枚举 GPU 时,可能通过 /sys/class/drm/card* 扫描设备而非纯 NVML API。card0

** **的存在导致它:

** **- 错误地把 card0 (simple-framebuffer) 当成一张独立 GPU

** **- 或者因为混淆了索引而把同一张卡的数据重复显示

** **这解释了为什么内核升级后开始出问题 — 6.18.18-trim 可能改变了 simple-framebuffer 的绑定行为(之前 T600

** **时代可能没有这个冲突)。

** **可以尝试的修复方向:

** 1. 禁用 simple-framebuffer**(最可能的修复):在 GRUB 引导参数中添加 video=simplefb:off,看看 card0 是否消失

** 2. 向飞牛 NAS 反馈此 bug**,附上内核版本 6.18.18-trim、驱动 580.142、以及 card0 的重复 DRM 枚举信息

** 3. 临时方案**:终端里直接用 nvidia-smi 或 watch -n 5 nvidia-smi 查看真实 GPU 状态

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-24 22:44:48 楼主 显示全部楼层
飞牛运营同学 发表于 2026-6-8 14:56
感谢反馈!这个现象先记录一下,麻烦再确认一下当前飞牛 OS 的具体版本号。我转给相关同学看看。
...

分析结果总结

  经过深入排查,以下是完整的诊断结论:

  数据层一切正常:
  - NVML 库 (libnvidia-ml.so.580.142) 正确枚举两张 GPU,返回不同的显存、温度数据
  - /proc/driver/nvidia/gpus/ 下两张卡分别有正确的 PCI BusID、UUID、Model
  - dmesg 无 NVIDIA 报错

  发现了一个可能的诱因:

  DRM 设备层有一个"多余"的 card0:

  **──────────**─────────────────**─────────────────────────────────────**
  ** DRM 设备 **    物理 GPU     **                驱动                 **
  **──────────**─────────────────**─────────────────────────────────────**
  ** card0    ** 0a:00.0 (GPU 1) ** simple-framebuffer (内核基本帧缓冲) **
  **──────────**─────────────────**─────────────────────────────────────**
  ** card1    ** 05:00.0 (GPU 0) ** nvidia (专有驱动)                   **
  **──────────**─────────────────**─────────────────────────────────────**
  ** card2    ** 0a:00.0 (GPU 1) ** nvidia (专有驱动)                   **
  **──────────**─────────────────**─────────────────────────────────────**

  GPU 1 被两个不同的 DRM 驱动接管了两次:一次是内核 simple-framebuffer(用于基本显示输出),另一次是 NVIDIA 专有驱动。

  问题定位: FlyNAS 的 libigputop.so 库在枚举 GPU 时,可能通过 /sys/class/drm/card* 扫描设备而非纯 NVML API。card0
  的存在导致它:
  - 错误地把 card0 (simple-framebuffer) 当成一张独立 GPU
  - 或者因为混淆了索引而把同一张卡的数据重复显示

  这解释了为什么内核升级后开始出问题 — 6.18.18-trim 可能改变了 simple-framebuffer 的绑定行为(之前 T600
  时代可能没有这个冲突)。

  可以尝试的修复方向:

  1. 禁用 simple-framebuffer(最可能的修复):在 GRUB 引导参数中添加 video=simplefbff,看看 card0 是否消失
  2. 向飞牛 NAS 反馈此 bug,附上内核版本 6.18.18-trim、驱动 580.142、以及 card0 的重复 DRM 枚举信息
  3. 临时方案:终端里直接用 nvidia-smi 或 watch -n 5 nvidia-smi 查看真实 GPU 状态

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-24 23:04:29 楼主 显示全部楼层
飞牛运营同学 发表于 2026-6-8 14:56
感谢反馈!这个现象先记录一下,麻烦再确认一下当前飞牛 OS 的具体版本号。我转给相关同学看看。
...

标题: 内核升级至 6.18.18-trim 后,Web 桌面资源管理器 GPU 状态栏两张卡显示相同数据

  系统信息:
  - FlyNAS 版本:[1.1.3107]
  - 内核版本:Linux 6.18.18-trim #570 SMP PREEMPT_DYNAMIC Fri May 8 07:07:34 UTC 2026 x86_64
  - NVIDIA 驱动版本:580.142
  - GPU 硬件:双 NVIDIA GeForce RTX 3060 12GB(PCIe 位置 05:00.0 和 0A:00.0)

  问题描述:

  FlyNAS Web 桌面的"资源管理"页面中,GPU 监控模块有两个状态栏 GPU_1 和 GPU_2。内核升级至 6.18.18-trim
  后,两个状态栏显示的是同一张 GPU 的显存占用数据,而非各自对应的真实数据。

  症状:
  - GPU_1 状态栏:NVIDIA GeForce RTX 3060,已使用 9.58 GB,空闲 2.42 GB,温度 41°C
  - GPU_2 状态栏:NVIDIA GeForce RTX 3060,已使用 9.58 GB,空闲 2.42 GB,温度 41°C
  - 两个状态栏数据完全一致

  实际情况(nvidia-smi):
  - GPU 0(05:00.0):显存占用 ~11.5 GB / 12 GB(运行 Ollama 模型)
  - GPU 1(0A:00.0):显存占用 ~9.2 GB / 12 GB(运行 Ollama 模型),Disp.A = On

  影响范围:
  - GPU 计算功能正常,nvidia-smi、Ollama 推理均无异常
  - 仅 Web UI 资源管理器的 GPU 监控显示错误

  排查信息:

  1. /proc/driver/nvidia/gpus/ 下两张卡分别枚举为 0000:05:00.0 和 0000:0a:00.0,驱动层区分正确
  2. NVML (libnvidia-ml.so.580.142) 能正确返回两张卡的独立数据
  3. DRM 设备枚举异常(疑似根因):

  **──────────**─────────────────**──────────────────────────────────────**
  ** DRM 设备 **    物理 GPU     **               绑定驱动               **
  **──────────**─────────────────**──────────────────────────────────────**
  ** card0    ** 0a:00.0 (GPU 1) ** simple-framebuffer(内核基础帧缓冲) **
  **──────────**─────────────────**──────────────────────────────────────**
  ** card1    ** 05:00.0 (GPU 0) ** nvidia(专有驱动)                   **
  **──────────**─────────────────**──────────────────────────────────────**
  ** card2    ** 0a:00.0 (GPU 1) ** nvidia(专有驱动)                   **
  **──────────**─────────────────**──────────────────────────────────────**

  GPU 1 被 simple-framebuffer 和 nvidia 两个驱动同时接管,产生了一个多余的 card0。libigputop.so 在枚举 GPU 时若依赖
  /sys/class/drm/card* 扫描,card0 的存在可能导致索引混乱,从而两张状态栏读到同一张卡的数据。

  4. resmon_service 链接了 libhwinfo.so.0.1(通过 NVML)和 libigputop.so,其中 libigputop.so 使用 nvidia-smi
  --query-gpu=gpu_uuid 查询 GPU 信息。该二进制中的符号 OnGpuInfoRequest 是 GPU 数据请求的入口。

  时间线:
  - 内核升级前(T600 + RTX 3060 混用):状态栏正常显示两张不同卡的数据
  - 升级到 6.18.18-trim 后(仍是 T600 + RTX 3060):问题开始出现,两个状态栏都变成了 RTX 3060 的数据
  - ~2026.6.13 将 T600 换成第二张 RTX 3060:问题延续,双卡数据仍然相同

  建议修复方向:
  - 检查 libigputop.so / resmon_service 的 GPU 枚举逻辑是否正确处理 simple-framebuffer 产生的额外 DRM 设备
  - 考虑在枚举时过滤掉非 nvidia 驱动的 DRM card(通过 /sys/class/drm/cardN/device/driver 判断)

1

主题

13

回帖

0

牛值

江湖小虾

2026-6-25 14:13:12 楼主 显示全部楼层

标题:6.18.18-trim 内核下 GPU 监控双卡显示相同数据

根因:libigputop.so 扫描 /sys/class/drm/card* 枚举 GPU 时,
未过滤 simple-framebuffer 创建的 card0,导致索引错乱。

证据:

  • nvidia-smi / NVML / CUDA 底层全部正常,双卡独立工作
  • 仅 Web 桌面资源管理器显示异常
  • 6.12.18-trim(无 SYSFB_SIMPLEFB)正常,6.18.18-trim 异常

修复建议:
在 libigputop.so 中枚举 GPU 时,
跳过 driver != "nvidia" 的 DRM 设备,
或直接改用 NVML 的 nvmlDeviceGetCount / nvmlDeviceGetHandleByIndex 枚举。

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则