CUDA 开始支持 RISC‑V,但 NVIDIA 先设下了服务器级门槛
NVIDIA 在 Hot Chips 2026 解释了 CUDA 移植到 RISC‑V 的平台要求。它需要的不只是能启动 Linux 的 RISC‑V CPU,而是一套符合 RVA23、服务器 SoC 和平台规范,并具备 ACPI、PCIe 一致性、设备点对点通信及可靠性能力的服务器系统。
作者:林岚|OC 开发者生态编辑
NVIDIA 在 Hot Chips 2026 解释了 CUDA 移植到 RISC‑V 的平台要求。它需要的不只是能启动 Linux 的 RISC‑V CPU,而是一套符合 RVA23、服务器 SoC 和平台规范,并具备 ACPI、PCIe 一致性、设备点对点通信及可靠性能力的服务器系统。
一句话结论:CUDA 支持 RISC‑V 是生态突破,但第一批受益者大概率是与 NVIDIA 深度合作的服务器芯片,而不是开发板用户把显卡插上去就能运行 CUDA。
CUDA 目前主要由 x86-64 和 Arm64 主机驱动 GPU。加入 RISC‑V,意味着云厂商和芯片公司未来可以使用自定义 RISC‑V CPU 组织 GPU 节点,也给 NVLink Fusion 的定制处理器留出空间。但 NVIDIA 不愿意为了兼容现有大量低端硬件,把软件栈压到最低共同标准。
最基础的要求是 RVA23 与服务器规范。向量扩展允许 CUDA 主机代码利用谓词执行减少分支;RAS、安全处理器、固件和启动规范则是服务器长期运行的前提。ACPI 负责发现硬件并参与电源、性能和散热管理,RISC‑V 到 2025 年才补齐相关标准,硬件落地仍需时间。

更硬的条件来自数据移动。CPU 写入的数据可能还留在缓存里,GPU 的 DMA 却直接读取内存;如果 PCIe 路径不保证一致性,软件就要手工刷新缓存。GPU 间若不能点对点传输,数据还得绕过 CPU 内存。理论上都能用慢路径补救,但 NVIDIA 选择先要求硬件提供服务器级保证,以控制移植复杂度和性能下限。
NVLink Fusion 的门槛还包括 DOCA、NCCL 等软件框架以及与 NVIDIA 的深度协作。这说明公司开放的是“加入 NVIDIA AI 工厂”的接口,不是放弃对平台的控制。SiFive 计划展示对应系统,其参数也更像高核心数服务器芯片。
对 RISC‑V 来说,这仍然是关键进展。一个指令集只有进入主流 GPU、操作系统、固件和服务器管理体系,才能从控制器和开发板向数据中心扩张。不过真正开放程度要看 CUDA 是否最终允许不满足全部推荐配置的系统运行,以及驱动、工具链和兼容测试是否公开可获得。
关键事实
- NVIDIA 正在把 CUDA 主机支持从 x86-64、Arm64 扩展到 RISC‑V。
- 初期要求包括 RVA23、服务器规范、ACPI、PCIe 一致性和 P2P 通信。
- NVLink Fusion 还要求 DOCA、NCCL 兼容与厂商合作。
- SiFive 将展示服务器级 RISC‑V CUDA 系统,多数现有消费硬件不符合条件。
OC 判断
先别急着把这理解成“RISC‑V 显卡时代”。NVIDIA 认可了 RISC‑V 作为服务器主机架构的可能性,同时把自己的性能和管理假设写成入场券。开放指令集解决了 CPU 的授权问题,没有自动解决整个 AI 平台的控制权。
为什么重要
- 对芯片厂商:定制 RISC‑V CPU 有机会进入 CUDA 和 NVLink 系统。
- 对开发者:软件可移植性最终取决于驱动、固件和平台规范,而非 ISA 名字。
- 对行业:RISC‑V 正从嵌入式扩展到需要完整服务器生态的高价值场景。
评论
围绕这篇文章补充信息、提出问题或分享观察。