收起左侧

希望 AI 套件 / Ollama 的 LLM 推理能调用 Intel 独立显卡(Arc Pro B50)

1
回复
32
查看
[ 复制链接 ]

2

主题

1

回帖

0

牛值

江湖小虾

【建议】希望 AI 套件 / Ollama 的 LLM 推理能调用 Intel 独立显卡(Arc Pro B50),而不仅仅是 AMD 核显
设备环境

  • 机型:飞牛 NAS(fnOS)
  • CPU:AMD Ryzen AI 9 HX PRO 370(含 Radeon 890M 核显)
  • 独立显卡:Intel Arc Pro B50 16GB(Battlemage,系统已识别,驱动 xe 正常)
  • 已安装:系统自带 Ollama(AI 套件)、Open-WebUI
    现状
  1. Intel 独显目前仅承担视频转码(QSV)等任务,LLM 推理一处都未使用,16GB 显存基本闲置。
  2. 系统自带的 Ollama 仅能调用 AMD 890M 核显(ROCm 后端),且核显共享显存默认仅 2GB,跑 14B 模型时上下文窗口(KV cache)极易 OOM,无法支撑较长上下文的本地推理。
  3. 系统已自带 OpenVINO 运行时与 Intel GPU 计算栈(libze_intel_gpu 等),说明独显的通用计算能力是具备的,只是未向 LLM 推理开放。
    诉求
  • 希望飞牛在后续版本中,将 AI 套件 / Ollama / Open-WebUI 的 LLM 推理后端扩展支持 Intel 独立显卡(类似视频转码已能调用独显那样),让用户可以用 Arc Pro B50 的 16GB
    显存跑本地大模型,摆脱核显 2GB 显存的限制。
  • 若技术上 Ollama 的 ROCm 后端难以支持 Intel GPU,能否考虑在 AI 套件中提供基于 OpenVINO GenAI(系统已具备)的 LLM 推理选项,复用已有的 Intel GPU 栈。
    价值 当前视频转码已能利用独显,证明 Intel GPU 通路是通的。把同一张卡的算力开放给 LLM,能显著提升本地模型的上下文长度与推理速度,避免 16GB 独显在 AI 场景下的算力浪费,也能让带独显的机型在本地 AI 上有明显差异化优势。
收藏
送赞
分享

6

主题

1万

回帖

0

牛值

管理员

社区上线纪念勋章社区共建团荣誉勋章飞牛百度网盘玩家fnOS1.0上线纪念勋章

感谢反馈。
本地 AI 推理涉及硬件驱动、计算框架以及模型推理后端等多个环节,不同 GPU 平台的支持方式也存在差异,并非仅完成显卡驱动适配即可实现。
你的需求我们已经收到。后续会结合 AI 套件发展规划、硬件适配情况以及实际使用场景持续关注。

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则