CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:https://www.cubestudio.vip | GitHub:https://github.com/data-infra/cube-studio | Gitee:https://gitee.com/data-infra/cube-studio

关键词:CubeStudio、cube-studio、壁仞、壁仞科技、biren、壁仞 GPU、国产 GPU、信创、异构算力、device-plugin、Kubernetes GPU、K8s 扩展资源、GPU 调度、GPU 监控、exporter、国产化替代、AI 平台

壁仞科技是国产通用 GPU 厂商之一,在信创与国产化替代场景中出现频率越来越高。但壁仞卡接入 Kubernetes 与 AI 平台的公开中文资料很少——驱动怎么装、K8s 怎么识别、平台怎么调度,往往只能靠厂商现场支持。

本文给出 CubeStudio 平台接入壁仞 GPU 的完整实操路径:从驱动运行时、K8s 组件部署、卡数验证到平台侧资源配置,六步完成,接入后壁仞卡即可像 NVIDIA 卡一样被 Notebook、Pipeline 训练、推理服务统一调度。

一、接入路径总览

步骤 内容 产出
1 获取壁仞安装资料 驱动 / 运行时 / K8s 组件安装包
2 主机驱动与容器运行时 节点可识别壁仞卡
3 部署 K8s 组件(device plugin / agent / exporter) K8s 注册壁仞扩展资源 + 监控采集
4 验证节点可用卡数 确认扩展资源名与数量
5 Pod 占卡测试 容器内确认占到卡
6 平台侧 GPU_RESOURCE 配置 平台任务可按 数量(biren) 申请壁仞卡

二、准备安装资料

壁仞的驱动、容器运行时、K8s 组件安装包与文档由壁仞技术人员提供,接入前先备齐:

壁仞安装资料清单

三、主机驱动和运行时

在每台壁仞节点上安装壁仞 GPU 驱动与容器运行时,并按壁仞文档校验驱动正常:

壁仞驱动与运行时

四、安装 K8s 相关组件

按壁仞提供的资料部署 K8s 侧组件,通常包含三件:

  • device plugin:向 K8s 注册壁仞 GPU 扩展资源,让调度器能感知和分配壁仞卡;
  • agent:节点侧代理;
  • exporter:GPU 监控指标采集,可接入 Prometheus / Grafana 看板。

壁仞 k8s 组件

五、查询机器可用卡数

kubectl describe node <壁仞节点名>   # 节点名用 kubectl get node 查看,多数集群即节点 IP

在 node 的 Capacity / Allocatable 中查看壁仞 device plugin 注册的扩展资源名与可用卡数(形如 biren.com/gpu: 8,具体资源名以壁仞 device plugin 实际注册为准):

查询可用卡数

六、Pod 占用壁仞卡测试

按 device plugin 注册的资源名编写 Pod yaml,在 resources.limits 中申请对应资源(资源名替换成上一步查到的实际值):

apiVersion: v1
kind: Pod
metadata:
  name: biren-test
spec:
  containers:
  - name: biren-test
    image: <壁仞提供的测试镜像>
    command: ["sleep", "infinity"]
    resources:
      limits:
        biren.com/gpu: 1   # 资源名以第五步查到的为准,数量为申请的卡数

pod yaml 示例

Pod 启动后进入容器,用壁仞自带工具确认占用到的卡:

Pod 内部查看占用的卡

七、平台侧资源配置

K8s 层跑通后,最后一步是让 CubeStudio 平台"认识"壁仞卡——只需改一处配置:

  1. 注册资源名:在平台 config.pyGPU_RESOURCE 字典中新增一项(key 必须小写):
GPU_RESOURCE = {
    "gpu": "nvidia.com/gpu",
    ...
    "biren": "<壁仞 device plugin 注册的扩展资源名>",
}
  1. 任务中申请:用户在 Notebook / Pipeline / 推理服务的资源栏用 数量(资源简称) 写法申请,例如 1(biren);机器的 gpu-type 节点标签使用大写。

  2. 可选加固:若壁仞提供「禁用可见设备」的环境变量,同步在 GPU_NONE 中补充对应条目(参照 NVIDIA 的 ['NVIDIA_VISIBLE_DEVICES','none'] 写法),防止未申请卡的容器看到节点上的全部壁仞卡。

配置完成后,壁仞卡即纳入平台统一算力池:多资源组划分、项目组配额、计量计费、监控告警等能力全部生效——这正是 CubeStudio「一套流程接入任意国产卡」标准化设计的价值,同样的路径也适用于昇腾、寒武纪、海光、摩尔线程、沐曦、昆仑芯等其他国产算力。

附:常见问题排查

接入过程中卡住时,可对照下表定位——绝大多数问题出在「K8s 未注册资源」或「运行时未隔离」两类:

现象 常见原因 排查方向
describe node 里没有壁仞扩展资源 / 卡数为 0 device plugin 未 Running,或节点驱动未就绪 查 device plugin Pod 日志与状态,先在主机上校验驱动正常
Pod 一直 Pending limits 里资源名写错,或节点上卡已被占满 核对资源名与 describe node 完全一致,确认节点有空闲卡
容器内看不到卡 / 反而看到节点上全部卡 容器运行时未启用壁仞 runtime,或未做可见设备隔离 检查容器默认 runtime,按第七步在 GPU_NONE 中补隔离变量
Grafana 无壁仞监控数据 exporter 未部署,或 Prometheus 未抓取 检查 exporter Pod,以及对应的抓取 / ServiceMonitor 配置

了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。

  • 官网与在线文档:https://www.cubestudio.vip
  • 开源仓库(GitHub):https://github.com/data-infra/cube-studio
  • 开源仓库(Gitee):https://gitee.com/data-infra/cube-studio
Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐