结论
| 维度 |
结论 |
| 算力对比 |
昇腾 910 FP16 算力 (320 TFLOPS) 略超 A100 (312 TFLOPS);M890/DCU-3G/壁砺 166 ≈ A100 的 80% |
| 显存容量 |
M890 (144GB) > A100 (80GB) > DCU-3G/壁砺 166 (64GB) > 昇腾 910 (32GB) |
| 带宽性能 |
DCU-3G (1.6TB/s) ≈ A100 (1.9TB/s),显著高于其他国产卡 |
| CUDA 兼容 |
海光 DCU-3G 是唯一接近 CUDA 兼容的国产卡,迁移成本最低 |
| 生态成熟度 |
昇腾生态最成熟(CANN+MindSpore),但需代码迁移 |
快速选型建议
| 场景 |
首选 |
备选 |
替代效果 |
| 千亿大模型训练 |
真武 M890 |
DCU-3G、昇腾 910 |
可替代 A100,H100 仍有差距 |
| 百亿级模型训练 |
昇腾 910、DCU-3G |
壁砺 166 |
完全替代 A100,成本降 40%+ |
| 大模型高并发推理 |
M890、DCU-3G |
壁砺 166 |
推理性能超 A100 (INT8),成本减半 |
| 中小模型训推 |
M530、PH100 |
昇腾 310 |
全面替代 T4/A10,性价比极高 |
| 存量 CUDA 迁移 |
海光 DCU-3G |
- |
迁移成本最低 |
| 边缘低功耗推理 |
昇腾 310 |
PH100 |
8W 超低功耗,端侧首选 |
旗舰级训练卡对比
1.1 核心参数对比(单卡)
| 芯片 |
工艺 |
FP16 算力 |
INT8 算力 |
显存/带宽 |
功耗 |
发布状态 |
| NVIDIA H100 |
4nm |
989 TFLOPS |
1978 TOPS |
80GB HBM3e / 3350GB/s |
700W |
❌ 禁运,存量稀缺 |
| NVIDIA A100 80GB |
7nm |
312 TFLOPS |
624 TOPS |
80GB HBM2e / 1935GB/s |
400W |
❌ 禁运,二手 18-22 万 |
| 昇腾 910(国测 I 级) |
7nm |
320 TFLOPS |
640 TOPS |
32GB HBM2 / 1280GB/s |
310W |
✅ 国产主力,规模出货 |
| 真武 M890 |
5nm |
~300 TFLOPS |
~600 TOPS |
144GB HBM / 1200GB/s |
350W |
✅ 国产顶级,大模型优选 |
| 海光 DCU-3G(BW1000) |
7nm+ |
240 TFLOPS |
480 TOPS |
64GB HBM3 / 1.6TB/s |
300W |
✅ CUDA 兼容,迁移成本最低 |
| 壁砺 166(BR166) |
7nm |
256 TFLOPS |
512 TOPS |
64GB HBM2 / 1024GB/s |
300W |
✅ 通用 GPU,训推均衡 |
1.2 生态与迁移成本(关键差异)
| 芯片 |
软件栈 |
CUDA 兼容 |
大模型适配度 |
集群能力 |
| A100/H100 |
CUDA+PyTorch/TensorFlow |
✅ 原生 |
⭐⭐⭐⭐⭐ 全覆盖 |
⭐⭐⭐⭐⭐ 万卡级 |
| 昇腾 910 |
CANN+MindSpore |
❌ 不兼容(需重写/迁移) |
⭐⭐⭐⭐ 主流模型适配 |
⭐⭐⭐⭐ 384 卡超节点 |
| DCU-3G |
ROCm + 优化库 |
✅ 高度兼容(直接改编译参数) |
⭐⭐⭐⭐ 主流模型可跑 |
⭐⭐⭐ 千卡级 |
| M890 |
平头哥 SDK |
❌ 不兼容 |
⭐⭐⭐⭐ 大模型优化好 |
⭐⭐⭐ 千卡级 |
| 壁砺 166 |
BRT |
❌ 不兼容 |
⭐⭐⭐ 主流适配 |
⭐⭐⭐ 千卡级 |
💡 核心差异:海光 DCU-3G 是唯一接近 CUDA 兼容的国产卡,适合快速迁移;昇腾生态最成熟但需迁移;M890/壁砺适合新开发。
国测 I 级 9 款卡详解
2.1 核心参数对比表
| 厂商 |
型号(送测名) |
商用代号 |
工艺 |
显存&带宽 |
FP16/BF16 算力 |
INT8 算力 |
功耗 |
主要定位 |
| 华为海思 |
昇腾 310 |
Ascend 310 |
12nm |
8GB DDR4, 60GB/s |
8 TFLOPS |
16 TOPS |
8W |
边缘推理/低功耗 |
| 华为海思 |
昇腾 910 |
Ascend 910 |
7nm |
32GB HBM2, 1280GB/s |
320 TFLOPS |
640 TOPS |
310W |
云端训练/大模型 |
| 平头哥(阿里) |
真武 M530 |
— |
5nm |
64GB HBM, 800GB/s |
~128 TFLOPS |
~256 TOPS |
250W |
推理 + 中小模型训练 |
| 平头哥(阿里) |
真武 M890 |
— |
5nm |
144GB HBM, 1200GB/s |
~300 TFLOPS |
~600 TOPS |
350W |
大模型训推一体 |
| 壁仞科技 |
壁砺 166 |
BR166 |
7nm |
64GB HBM2, 1024GB/s |
256 TFLOPS |
512 TOPS |
300W |
云端训练/推理 |
| 海光信息 |
DCU-3G |
深算三号 BW1000 |
7nm+ (Chiplet) |
64GB HBM3, 1.6TB/s |
240 TFLOPS |
480 TOPS |
300W |
大模型训练/推理 |
| 天数智芯 |
KCC-V100X |
天垓 100 |
7nm |
64GB HBM2, 1024GB/s |
256 TFLOPS |
512 TOPS |
300W |
云端训练/推理 |
| 沐曦 |
MXC600 |
MX600 |
7nm |
64GB HBM2, 1024GB/s |
256 TFLOPS |
512 TOPS |
300W |
云端训练/推理 |
| 摩尔线程 |
PH100 |
MTT S5000 |
7nm |
32GB GDDR6, 768GB/s |
96 TFLOPS |
192 TOPS |
220W |
推理/中小模型训练 |
2.2 各卡替代定位总结
| 芯片 |
替代定位 |
对标英伟达 |
推荐场景 |
| 昇腾 310 |
边缘推理替代 |
T4 |
端侧/低功耗推理 |
| 昇腾 910 |
主力训练替代 |
A100 |
百亿级训练/推理 |
| 真武 M530 |
中小模型性价比 |
A10(T4) |
1B-50B 训推 |
| 真武 M890 |
大模型顶级替代 |
A100/H100 |
70B-千亿训推 |
| 壁砺 166 |
通用均衡替代 |
A100 |
训推一体/行业模型 |
| DCU-3G |
CUDA 迁移首选 |
A100 |
存量 CUDA 项目迁移 |
| 天垓 100 |
稳定型替代 |
A100 |
推理/中小训练 |
| MXC600 |
能效型替代 |
A100 |
高吞吐推理 |
| PH100 |
低功耗推理替代 |
T4 |
服务器推理/中小训练 |
场景化选型指南
3.1 大模型训练(10B-千亿级)
| 芯片 |
适合模型规模 |
最佳精度 |
推荐指数 |
关键优势 |
| 昇腾 910 |
10B-千亿 |
BF16/FP16 |
⭐⭐⭐⭐⭐ |
算力强、集群生态成熟、千卡线性加速好 |
| 真武 M890 |
10B-千亿 |
BF16/FP8 |
⭐⭐⭐⭐⭐ |
144GB 超大显存、FP8/FP4 全栈、5nm 先进工艺 |
| 海光 DCU-3G |
10B-千亿 |
BF16/FP8 |
⭐⭐⭐⭐⭐ |
1.6TB/s 带宽、CUDA 兼容、迁移成本最低 |
| 壁砺 166 |
10B-千亿 |
BF16/FP16 |
⭐⭐⭐⭐☆ |
算力均衡、国产通用 GPU、训推双强 |
| 天垓 100 |
10B-百亿 |
BF16/FP16 |
⭐⭐⭐⭐☆ |
7nm、HBM2、通用计算稳定 |
| 沐曦 MXC600 |
10B-百亿 |
BF16/FP16 |
⭐⭐⭐⭐☆ |
架构先进、推理/训练均衡、能效好 |
| 真武 M530 |
1B-50B |
BF16/FP16 |
⭐⭐⭐⭐ |
5nm、性价比高、中小模型训练优选 |
| PH100 |
1B-20B |
FP16 |
⭐⭐⭐ |
功耗低、推理强、中小模型训练够用 |
| 昇腾 310 |
❌ 不推荐训练 |
— |
— |
仅边缘推理,算力/显存不足 |
3.2 大模型推理(高并发/低延迟)
| 芯片 |
适合模型规模 |
最佳精度 |
推荐指数 |
关键优势 |
| 真武 M890 |
70B-千亿 |
FP8/INT4 |
⭐⭐⭐⭐⭐ |
超大显存 + 超低精度,高并发之王 |
| 海光 DCU-3G |
70B-千亿 |
FP8/INT4 |
⭐⭐⭐⭐⭐ |
带宽最高、延迟低、CUDA 生态友好 |
| 壁砺 166 |
34B-70B |
INT8/INT4 |
⭐⭐⭐⭐☆ |
算力足、推理吞吐高、国产稳定 |
| 天垓 100 |
34B-70B |
INT8/INT4 |
⭐⭐⭐⭐☆ |
通用计算强、推理稳定 |
| 沐曦 MXC600 |
34B-70B |
INT8/INT4 |
⭐⭐⭐⭐☆ |
低延迟、高吞吐、能效优 |
| 昇腾 910 |
34B-70B |
INT8 |
⭐⭐⭐⭐ |
生态好、推理稳定,适合华为云栈 |
| 真武 M530 |
7B-34B |
INT8/INT4 |
⭐⭐⭐⭐ |
5nm、性价比高、中小模型推理 |
| PH100 |
7B-34B |
INT8/INT4 |
⭐⭐⭐⭐ |
220W 低功耗、推理能效高 |
| 昇腾 310 |
1B-7B |
INT8 |
⭐⭐⭐⭐⭐ |
8W 超低功耗、边缘/端侧推理首选 |
3.3 边缘/端侧推理(低功耗/嵌入式)
| 芯片 |
功耗 |
INT8 算力 |
适用场景 |
推荐指数 |
| 昇腾 310 |
8W |
16 TOPS |
摄像头/网关/工控机 |
⭐⭐⭐⭐⭐ |
| PH100 |
220W |
192 TOPS |
边缘服务器推理 |
⭐⭐⭐ |
💡 首选:昇腾 310(8W、INT8 16 TOPS、适配摄像头/网关/工控机)
💡 备选:PH100(220W、但可做边缘服务器推理)
精度支持对比
4.1 精度支持矩阵
| 芯片 |
FP32 |
BF16 |
FP16 |
FP8 |
INT8 |
INT4 |
FP4 |
| 昇腾 310 |
❌ |
❌ |
✅ |
❌ |
✅ |
❌ |
❌ |
| 昇腾 910 |
✅ |
✅ |
✅ |
❌ |
✅ |
❌ |
❌ |
| 真武 M530 |
✅ |
✅ |
✅ |
❌ |
✅ |
✅ |
❌ |
| 真武 M890 |
✅ |
✅ |
✅ |
✅ |
✅ |
✅ |
✅ |
| 壁砺 166 |
✅ |
✅ |
✅ |
❌ |
✅ |
✅ |
❌ |
| 海光 DCU-3G |
✅ |
✅ |
✅ |
✅ |
✅ |
✅ |
❌ |
| 天垓 100 |
✅ |
✅ |
✅ |
❌ |
✅ |
✅ |
❌ |
| 沐曦 MXC600 |
✅ |
✅ |
✅ |
❌ |
✅ |
✅ |
❌ |
| PH100 |
✅ |
❌ |
✅ |
❌ |
✅ |
✅ |
❌ |
4.2 精度维度小结
| 精度类型 |
推荐芯片 |
适用场景 |
| 仅推理/轻量 |
昇腾 310(FP16/INT8) |
边缘端侧、低功耗 |
| 训练主力(全精度) |
昇腾 910、M890、DCU-3G、壁砺 166、天垓 100、MXC600 |
大模型训练 |
| 超低精度推理 |
M890、DCU-3G(FP8/INT4/FP4) |
千亿级大模型高并发推理 |
| 5nm 先进工艺 |
平头哥 M530/M890 |
全精度覆盖,能效优 |
生态与迁移成本
5.1 软件栈对比
| 芯片 |
软件栈 |
框架支持 |
模型库 |
开发工具 |
| A100/H100 |
CUDA |
PyTorch/TF/JAX |
HuggingFace 全支持 |
Nsight/CUDA-GDB |
| 昇腾 910 |
CANN+MindSpore |
PyTorch(适配)/MindSpore |
主流模型适配 |
MindStudio |
| DCU-3G |
ROCm+ 优化库 |
PyTorch(兼容)/TF |
主流模型可跑 |
HIP 工具链 |
| M890 |
平头哥 SDK |
PyTorch(适配) |
大模型优化好 |
平头哥工具链 |
| 壁砺 166 |
BRT |
PyTorch(适配) |
主流适配 |
壁仞工具链 |
5.2 迁移工作量估算
| 迁移类型 |
工作量(人天) |
风险等级 |
推荐芯片 |
| CUDA 原生 → DCU-3G |
3-5 天 |
🟢 低 |
DCU-3G |
| CUDA 原生 → 昇腾 910 |
10-20 天 |
🟡 中 |
昇腾 910 |
| CUDA 原生 → M890 |
15-25 天 |
🟡 中 |
M890 |
| CUDA 原生 → 壁砺 166 |
10-15 天 |
🟡 中 |
壁砺 166 |
| 新项目 → 任意国产 |
5-10 天 |
🟢 低 |
按需选型 |
推荐方案
6.1 按场景推荐
✅ 新增大模型训练(≥70B)
- 优先:真武 M890 > 海光 DCU-3G > 昇腾 910
- 理由:M890 显存最大 (144GB),DCU-3G 带宽最高 (1.6TB/s)
✅ 存量 CUDA 项目迁移
- 首选:海光 DCU-3G
- 理由:迁移成本最低,仅需修改编译参数
✅ 政企/信创项目
- 优先:昇腾 910、海光 DCU-3G
- 理由:生态成熟 + 兼容性好 + 信创目录
✅ 成本敏感推理
- 优先:真武 M530、PH100、昇腾 310
- 理由:性价比最高,功耗低
✅ 边缘/端侧部署
- 首选:昇腾 310
- 理由:8W 超低功耗,适配摄像头/网关/工控机
6.2 按预算推荐
| 预算范围 |
推荐方案 |
配置建议 |
| 100 万以内 |
昇腾 310 × 10-15 卡 |
边缘推理集群 |
| 100-300 万 |
昇腾 910 × 8-16 卡 / DCU-3G × 8-16 卡 |
中小模型训练 |
| 300-500 万 |
M890 × 8-16 卡 / DCU-3G × 16-32 卡 |
大模型训练/推理 |
| 500 万以上 |
M890 × 16-32 卡 + DCU-3G × 16-32 卡 |
千亿级大模型训练 |
6.3 快速选型一句话建议
千亿大模型训练 → M890、DCU-3G、昇腾 910
70B-千亿高并发推理 → M890、DCU-3G(FP8/INT4)
34B-70B 训推一体 → 壁砺 166、天垓 100、MXC600
中小模型 (1B-34B) → M530、PH100
边缘低功耗 → 昇腾 310
存量 CUDA 迁移 → DCU-3G
附录
A. 无法替代场景
| 场景 |
原因 |
建议 |
| 万亿参数超大规模训练(如 GPT-4 级别) |
国产卡算力/互联带宽不足 |
仍依赖 H100 集群 |
| 极端科学计算(如量子、气象) |
FP32 精度差距大 |
等待国产卡 FP32 优化 |
B. 关键术语解释
| 术语 |
解释 |
| FP16/BF16 |
半精度浮点,大模型训练主流精度 |
| FP8/INT8 |
8 位精度,推理加速常用 |
| INT4/FP4 |
4 位超低精度,高并发推理 |
| HBM2/HBM3 |
高带宽内存,显存类型 |
| CUDA 兼容 |
可直接运行 CUDA 代码或仅需少量修改 |
| 国测 I 级 |
国家测评认证的最高等级 AI 芯片 |
所有评论(0)