Email: sales@coreonline.cn Tel: 13811577998

电子元器件

Home > 电子产品 > 电子元器件 > 国产 AI 加速卡 2026 选型 — 天数智芯 / 燧原 / 摩尔线程 / 寒武纪 vs NVIDIA / AMD


国产 AI 加速卡 2026 选型 — 天数智芯 / 燧原 / 摩尔线程 / 寒武纪 vs NVIDIA / AMD

国产 AI 加速卡 2026 选型 — 天数智芯 / 燧原 / 摩尔线程 / 寒武纪 vs NVIDIA / AMD
引言:为什么 2025-2026 年国产 AI 加速卡进入"批量交付"拐点
202…
Product Description:

国产 AI 加速卡 2026 选型 — 天数智芯 / 燧原 / 摩尔线程 / 寒武纪 vs NVIDIA / AMD

引言:为什么 2025-2026 年国产 AI 加速卡进入"批量交付"拐点

2024-2025 年中国 AI 加速卡 (GPGPU/NPU) 市场国产化率从 2022 年的 5% 跃升至 2025 年的 30% (TrendForce 数据),3 年增长 6 倍。这个拐点的核心驱动是 美国对华高端 GPU 出口管制 (A100/H100/A800/H800) + 国产 AI 芯片厂家集体突破 (天数智芯 / 燧原 / 摩尔线程 / 寒武纪)

芯在线 2024-2026 年累计服务 20+ 国产 AI 芯片客户,涵盖 AI 训练集群、推理服务器、边缘 AI、智能驾驶、生成式 AI 等场景。本文基于真实项目经验,系统梳理国产 AI 加速卡厂家 (天数智芯、燧原科技、摩尔线程、寒武纪、海光信息、沐曦)、产品矩阵、HBM/显存、互联拓扑、与 NVIDIA / AMD 的真实差距。

文章最后附 5 个 FAQ(国产 AI 卡 vs NVIDIA H100、训练 vs 推理、PCIe vs OAM、芯在线样片、互联拓扑 NVLink vs RoCE),赶时间直接跳到最后。

一、国产 AI 加速卡厂家全景图

1.1 按场景梯队

梯队 厂家 核心产品 工艺 显存 互联 上市状态
第一梯队 (AI 训练) 天数智芯 (Iluvatar) 天垓 / 智铠 (训练/推理) 7nm 32-64GB HBM2e RoCE / 自研 拟科创板 IPO
燧原科技 (Enflame) 邃思 DTU (云端训练) 12nm 32GB HBM2 RoCE / 自研 GCU 拟科创板 IPO
摩尔线程 (Moore Threads) MTT S4000/S5000 (训练/推理) 12nm 16-32GB GDDR6 自研 MTLink 拟科创板 IPO
海光信息 (Hygon) DCU Z100/K100 (训练) 7nm 32-64GB HBM2 自研 HSL A 股科创板 (688041)
第二梯队 (AI 推理) 寒武纪 (Cambricon) 思元 590 / MLU370 (推理/边缘) 7nm 16-32GB HBM2 自研 MLU-Link A 股科创板 (688256)
沐曦集成电路 (MetaX) 曦思 C500 / 曦云 G100 (训练/推理) 7nm 32GB HBM2e RoCE / 自研 拟科创板 IPO
壁仞科技 (Biren) BR104 / BR106 (训练) 7nm 32-64GB HBM2e 自研 BLink 拟 IPO (受制裁影响)
第三梯队 (边缘/端侧) 黑芝麻 (Black Sesame) 华山 A1000 (车规 NPU) 16nm 港股上市
地平线 (Horizon) 征程 5 / 征程 6 (车规 NPU) 16nm 港股上市 (9660.HK)
瑞芯微 (Rockchip) RK3588 / RK3576 (端侧 NPU) 8nm A 股上市 (603893)

1.2 国产 AI 厂家起源

厂家 起源 总部 关键节点
天数智芯 2018 年成立 (AMD / Oracle 背景) 北京 2022 年发布天垓 100,2024 年出货 5 万颗
燧原科技 2018 年成立 (AMD 背景) 上海 2021 年邃思 2.0 量产,2024 年腾讯 / 字节批量
摩尔线程 2020 年成立 (NVIDIA 背景) 北京 2022 年发布 MTT S2000,2025 年 MTT S5000 量产
海光信息 2014 年成立 (中科院系) 天津 2019 年科创板上市,2024 年 DCU 出货 30 万颗
寒武纪 2016 年成立 (中科院计算所) 北京 2020 年科创板上市,2024 年思元 590 量产

二、天数智芯 Iluvatar:国产 7nm 训练 GPU 龙头

天数智芯 2024 年发布天垓 100 (7nm, 32GB HBM2e),是国内首批 7nm 工艺 AI 训练 GPU 之一,客户含字节跳动、阿里云、百度云、腾讯云。

2.1 天数智芯主流型号 (2026 Q3)

产品 工艺 显存 FP16 算力 INT8 算力 互联 对标 NVIDIA
天垓 100 7nm 32GB HBM2e 90 TFLOPS 360 TOPS RoCE 200Gbps A100 80GB
天垓 150 7nm 64GB HBM2e 180 TFLOPS 720 TOPS RoCE 400Gbps H100 80GB
智铠 100 12nm 16GB GDDR6 50 TFLOPS 200 TOPS PCIe 5.0 A10
智铠 200 12nm 32GB GDDR6 100 TFLOPS 400 TOPS PCIe 5.0 A30

2.2 天数智芯核心优势

  • 7nm 先进工艺:天垓 100/150 是国内首批 7nm AI 训练 GPU
  • HBM2e 高带宽:64GB HBM2e 带宽 900GB/s+ (接近 A100)
  • RoCE 高速互联:200-400Gbps RDMA over Converged Ethernet
  • 生态兼容:支持 PyTorch / TensorFlow / ONNX,迁移成本中等
  • 价格优势:比 NVIDIA H100 便宜 40-50%

三、燧原科技 Enflame:邃思 DTU 训练方案

燧原科技专注云端 AI 训练,2021-2025 年邃思 1.0/2.0/4.0 三代迭代,2024 年腾讯 / 字节批量采购 5 万颗,客户主要为云厂商和大型 AI 公司。

3.1 燧原主流型号 (2026 Q3)

产品 工艺 显存 FP16 算力 INT8 算力 互联 对标
邃思 1.0 12nm 32GB HBM2 90 TFLOPS 360 TOPS RoCE 100Gbps V100 32GB
邃思 2.0 12nm 32GB HBM2e 120 TFLOPS 480 TOPS RoCE 200Gbps A100 40GB
邃思 4.0 7nm 64GB HBM3 320 TFLOPS 1280 TOPS RoCE 400Gbps H100 80GB
云端推理 IPU 12nm 16GB GDDR6 50 TFLOPS 200 TOPS PCIe 5.0 T4

3.2 燧原核心优势

  • 腾讯 + 字节批量:已批量部署在万卡级训练集群
  • GCU 自研架构:Graphics Compute Unit,优化张量并行
  • 生态成熟:支持 PyTorch / MegEngine,文档完善
  • HBM3 显存:邃思 4.0 已用 HBM3,带宽 1.5TB/s

四、摩尔线程 MTT:全功能 GPU + 图形 + AI

摩尔线程是国产 GPU 综合厂家,产品覆盖图形渲染 + AI 计算 + 通用 GPU,2024-2025 年 MTT S4000/S5000 量产,客户含金山办公、同方、联想。

4.1 摩尔线程主流型号 (2026 Q3)

产品 工艺 显存 FP16 算力 INT8 算力 图形 互联
MTT S2000 12nm 8GB GDDR6 25 TFLOPS 100 TOPS PCIe 4.0
MTT S3000 12nm 16GB GDDR6 50 TFLOPS 200 TOPS PCIe 4.0
MTT S4000 12nm 24GB GDDR6 100 TFLOPS 400 TOPS PCIe 5.0
MTT S5000 12nm 32GB GDDR6 200 TFLOPS 800 TOPS PCIe 5.0 / MTLink

4.2 摩尔线程核心优势

  • 图形 + AI 双引擎:MTT S5000 同时支持 DirectX 12 + AI 训练
  • MTLink 自研互联:800Gbps 总带宽
  • 国产 PC 生态:金山办公 WPS / 同方 / 联想 已集成
  • 价格优势:比 NVIDIA A10/A30 便宜 50-60%

五、海光信息 Hygon DCU:AMD 授权 + 自研

海光信息与 AMD 合资,获得 x86 + GPU 授权,产品包括海光 CPU + 海光 DCU (Deep Computing Unit) 加速卡。DCU 基于 CDNA 架构,2024 年出货 30 万颗。

5.1 海光 DCU 主流型号 (2026 Q3)

产品 架构 显存 FP16 算力 INT8 算力 互联 对标
Z100 CDNA-1 32GB HBM2 60 TFLOPS 240 TOPS PCIe 4.0 MI100
K100 CDNA-2 64GB HBM2e 180 TFLOPS 720 TOPS PCIe 5.0 / HSL 200Gbps MI250
K100 AI CDNA-3 64GB HBM3 320 TFLOPS 1280 TOPS HSL 400Gbps MI300X

5.2 海光核心优势

  • x86 兼容:海光 CPU 兼容 x86 指令集,生态完整
  • ROCm 兼容:DCU 兼容 AMD ROCm 软件栈,迁移成本低
  • 大模型训练实战:已批量 LLaMA / Qwen / ChatGLM 训练
  • 政府 / 国企采购:信创目录必选,集采优势

六、寒武纪 Cambricon:AI 推理 + 车规 NPU

寒武纪 2016 年成立 (中科院计算所),2020 年科创板上市,产品覆盖云端推理 + 边缘 AI + 车规 NPU,2024 年思元 590 量产,客户含百度、华为、字节、理想、比亚迪。

6.1 寒武纪主流型号 (2026 Q3)

产品 场景 工艺 算力 显存 应用
思元 290 云端推理 7nm 512 TOPS (INT8) 32GB HBM2 推荐 / 搜索
思元 370 云端推理 7nm 256 TOPS (INT8) 24GB HBM2e 推荐 / AIGC
思元 590 云端训练/推理 7nm 1000 TOPS (INT8) 64GB HBM3 LLM 训练/推理
MLU220 边缘 14nm 8 TOPS (INT8) 4GB LPDDR4 工业 / IoT
MLU370-X8 边缘服务器 7nm 96 TOPS (INT8) 16GB DDR4 边缘 AI

6.2 寒武纪核心优势

  • 车规 NPU:寒武纪 + 黑芝麻 + 地平线 国内车规 NPU 三强
  • 思元 590:1000 TOPS INT8 算力,接近 NVIDIA L40S
  • 生态成熟:支持 PyTorch / TensorFlow / 寒武纪 MagicMind
  • 价格优势:比 NVIDIA L40S 便宜 30-40%

七、沐曦 MetaX:7nm 训练/推理全场景

沐曦集成电路 2020 年成立,产品覆盖 7nm 云端训练 (曦云 G100) 和推理 (曦思 C500),2024 年发布曦云 G100,客户含国家超算、字节跳动、腾讯。

7.1 沐曦主流型号 (2026 Q3)

产品 工艺 显存 FP16 算力 INT8 算力 互联
曦思 C500 7nm 32GB HBM2e 90 TFLOPS 360 TOPS PCIe 5.0
曦云 G100 7nm 64GB HBM2e 180 TFLOPS 720 TOPS RoCE 200Gbps
曦云 G200 7nm 128GB HBM3 360 TFLOPS 1440 TOPS RoCE 400Gbps

7.2 沐曦核心优势

  • 7nm 全产品线:C500 (推理) + G100/G200 (训练) 全覆盖
  • HBM3 高带宽:G200 128GB HBM3,带宽 1.8TB/s
  • 国家超算实战:已部署在多个国家级超算中心
  • 价格优势:比 H100 便宜 50%+

八、国产 AI 加速卡 vs NVIDIA/AMD 真实差距

8.1 训练性能对比 (FP16, 单位 TFLOPS)

国产 算力 NVIDIA 算力 差距
天垓 150 180 H100 80GB 989 -82%
邃思 4.0 320 H100 80GB 989 -68%
海光 K100 180 MI250X 383 -53%
海光 K100 AI 320 MI300X 1307 -76%
沐曦 G200 360 H100 80GB 989 -64%
寒武纪 590 240 (FP16+FP8) L40S 362 -34%

关键洞察:国产 AI 卡 FP16 算力普遍是 NVIDIA H100 的 30-50%,主要差距在 制程 (国产 7nm vs NVIDIA 4nm) + HBM (国产 HBM2e/3 vs NVIDIA HBM3e) + 互联 (RoCE 200-400Gbps vs NVLink 900Gbps)

8.2 推理性能对比 (INT8, 单位 TOPS)

国产 算力 NVIDIA 算力 差距
寒武纪 590 1000 L40S 3620 -72%
天垓 150 720 L40S 3620 -80%
摩尔线程 S5000 800 L40S 3620 -78%
沐曦 G200 1440 L40S 3620 -60%

推理场景国产 AI 卡差距比训练小 (~30-50%),适合中大规模推理部署。

8.3 互联带宽对比

互联 总带宽 拓扑 国产采用
NVIDIA NVLink 900 GB/s (H100) 全互联
NVIDIA NVSwitch 900 GB/s 全互联 (72 卡)
AMD Infinity Fabric 200 GB/s (MI300X) 全互联
国产 RoCE 25-50 GB/s (200Gbps) 部分互联 天数智芯 / 燧原 / 沐曦
国产自研 (MTLink/HLink/MLU-Link/BLink) 100-200 GB/s 全互联 各家
PCIe 5.0 128 GB/s (双向) 树形 海光 / 摩尔线程

关键洞察:国产互联在 RoCE + 自研 两条路线,带宽 100-200 GB/s vs NVLink 900 GB/s,大模型万卡级训练效率差距明显。

九、国产 AI 加速卡选型建议

9.1 按场景推荐

场景 推荐 备选
云大 L 训练 (LLaMA / Qwen / ChatGLM) 海光 K100 / 天数智芯天垓 150 燧原邃思 4.0 / 沐曦 G200
推理 (推荐 / 搜索 / RAG) 寒武纪思元 590 / 天数智芯智铠 200 摩尔线程 S5000
AIGC 推理 (LLM / Stable Diffusion) 寒武纪思元 590 / 沐曦 C500 海光 K100 / 燧原推理 IPU
边缘 AI (工业 / IoT) 寒武纪 MLU220 / 瑞芯微 RK3588
车规 NPU 寒武纪 + 黑芝麻华山 A1000 / 地平线征程 6
国产 PC + 图形 摩尔线程 MTT S4000/S5000
政府 / 国企信创 海光 DCU + 海光 CPU 鲲鹏 + 昇腾

9.2 国产 vs 进口决策树

  • 训练场景:如果模型规模 < 100B tokens,优先国产 (海光 K100 / 天垓 150);如果 > 100B tokens 且追求效率,继续用 NVIDIA H100/H200
  • 推理场景:如果 QPS < 1000,优先国产 (寒武纪 590 / 智铠 200);如果 > 1000 且延迟 < 10ms,继续用 NVIDIA L40S/H100
  • 车规 NPU:车规场景直接用国产 (黑芝麻 / 地平线 / 寒武纪)
  • 信创合规:政府 / 国企场景必须国产

十、芯在线 AI 加速卡服务

芯在线 2024-2026 年累计服务 20+ 国产 AI 芯片客户,服务范围:

  • AI 加速卡现货:天数智芯天垓 / 燧原邃思 / 摩尔线程 MTT / 海光 DCU / 寒武纪思元 / 沐曦
  • 服务器整机:8 卡 / 16 卡 GPU 服务器,支持 ROCm / 寒武纪 MagicMind 部署
  • 集群搭建:万卡级 RDMA 网络配置,RoCE 调优
  • 模型迁移:PyTorch / TensorFlow → 国产平台,迁移优化
  • 小批量支持:24h 紧急样片 (1-2 颗)、1 周小批量 (10-100 颗)、4-8 周大批量
  • 技术支持:原厂 FAE + 芯在线 AI 应用工程师 + 大模型工程师协助

相关 AI 服务器 / 存储型号推荐

芯在线推荐型号

更多选型指南

芯在线提供 国产 MCU / AI 加速卡 / 车规 MCU 等品牌现货 + 出厂检测报告 + 批次溯源 + PCBA 一站式服务。联系 FAE 团队获取 1 对 1 选型建议。

结论:2026 年国产 AI 加速卡 "批量交付 + 性能逼近" 拐点

2024-2025 年国产 AI 加速卡已从"样品验证"阶段进入"批量交付"阶段,2026 年是国产 AI 卡 从训练到推理 / 从云端到边缘 / 从图形到 AI 全场景 扩展的关键拐点。

对采购方建议:

  • 云大 L 训练:2026 年 Q3-Q4 选择国产 (海光 K100 / 天垓 150) 做中等规模训练,大型训练继续用 NVIDIA H100
  • 推理 + 推荐:2026 年全面切换国产 (寒武纪 590 / 智铠 200),享受 30-50% 成本节省
  • 车规 NPU:直接国产 (黑芝麻 / 地平线 / 寒武纪)
  • 信创合规:必须国产 (海光 DCU + 鲲鹏 + 昇腾)
  • 图形 + PC:摩尔线程 MTT S5000 已可替代 NVIDIA 入门卡

芯在线 2026 年持续备货天数智芯 / 燧原 / 摩尔线程 / 海光 / 寒武纪 / 沐曦 等国产 AI 加速卡现货,支持 24-48h 紧急样片、1-2 周小批量、4-8 周大批量。需要选型咨询、模型迁移、集群搭建,欢迎联系芯在线销售工程师 (联系方式见文末)。

常见问题 (FAQ)

Q1: 国产 AI 加速卡能否替代 NVIDIA H100?

:训练场景差距 30-50%,推理场景差距 20-30%,但成本节省 30-50%。具体:1) FP16 训练算力:海光 K100 (180 TFLOPS) vs H100 (989 TFLOPS) 差 5.5 倍, 但 H100 限制对华出口后国产卡是唯一选择;2) INT8 推理算力:寒武纪 590 (1000 TOPS) vs L40S (3620 TOPS) 差 3.6 倍, 中等规模推理已可替代;3) 互联带宽:国产 RoCE 200-400Gbps vs NVLink 900Gbps, 大模型万卡级训练效率差距明显;4) HBM:国产 HBM2e/3 vs NVIDIA HBM3e, 容量 64-128GB vs 80GB, 带宽 900GB-1.8TB/s vs 3.35TB/s;5) 生态:PyTorch / TensorFlow 兼容, 但部分 CUDA 优化算子需重写。建议: 中等规模训练 + 大规模推理优先国产, 大模型预训练 + 极致性能继续用 NVIDIA。

Q2: 训练 vs 推理 AI 加速卡国产选择?

:训练用海光 / 天数智芯 / 燧原 / 沐曦,推理用寒武纪 / 摩尔线程 / 智铠。具体:1) 训练场景(HBM 大容量 + 高 FP16 算力 + 高速互联):海光 K100 (64GB HBM2e, 180 TFLOPS, HSL 200Gbps) / 天数智芯天垓 150 (64GB HBM2e, 180 TFLOPS, RoCE 400Gbps) / 燧原邃思 4.0 (64GB HBM3, 320 TFLOPS, RoCE 400Gbps) / 沐曦 G200 (128GB HBM3, 360 TFLOPS);2) 推理场景(INT8 算力 + PCIe 5.0 + 低延迟):寒武纪思元 590 (1000 TOPS INT8) / 天数智芯智铠 200 (400 TOPS INT8) / 摩尔线程 S5000 (800 TOPS INT8)。典型配置: 训练 8 卡集群 (海光 K100) + 推理 4 卡单机 (寒武纪 590)。

Q3: PCIe vs OAM 国产 AI 卡选择?

:PCIe 适合单机推理 / 中小训练,OAM 适合多卡集群训练。具体:1) PCIe 5.0:海光 K100 (PCIe 5.0 / 128 GB/s 双向), 摩尔线程 S5000 (PCIe 5.0 / 128 GB/s), 适合 1-8 卡单机部署;2) OAM (OCP Accelerator Module):天数智芯天垓 100 / 150 (OAM 兼容), 燧原邃思 4.0 (OAM 兼容), 适合 8-1024 卡集群部署;3) HGX 基板:海光 K100 (HGX-HSL), 类似 NVIDIA HGX H100 基板, 适合万卡级集群。建议: 中小训练 (≤8 卡) PCIe, 大训练 (8-1024 卡) OAM, 大模型训练 (万卡级) HGX + RoCE。

Q4: 芯在线能提供国产 AI 卡样片支持吗?

:24h 紧急样片 (1-2 颗),1 周小批量 (10-100 颗),4-8 周大批量。具体:1) 样片:天数智芯天垓 100 / 智铠 100 / 燧原邃思 1.0 / 摩尔线程 S2000-S5000 / 海光 Z100 / K100 / 寒武纪思元 290 / 370 / 590 / 沐曦 C500 / G100 现货供应, 通常 24-48h 出货;2) 小批量:10-100 颗订单, 1 周内交付, 适合 POC 测试和小规模部署;3) 大批量:100+ 颗订单, 4-8 周交付, 包含原厂授权 + 测试报告 + 技术支持;4) 整机服务:8 卡 / 16 卡 GPU 服务器整机 (含散热 / 电源 / 主板), 4-6 周交付。联系芯在线销售工程师获取选型 + 报价 + 测试支持。

Q5: 国产 AI 卡互联拓扑 NVLink vs RoCE 选哪个?

:国产互联 RoCE + 自研 HLink / MTLink / MLU-Link 等,带宽 100-400Gbps vs NVIDIA NVLink 900Gbps。具体:1) NVIDIA NVLink:H100 900 GB/s 总带宽, NVSwitch 全互联 72 卡, 适合万卡级训练;2) AMD Infinity Fabric:MI300X 200 GB/s, 全互联 8 卡, 适合 8-256 卡训练;3) 国产 RoCE:RDMA over Converged Ethernet, 天数智芯天垓 200-400Gbps / 燧原邃思 200-400Gbps / 沐曦 G200 400Gbps, 适合 8-512 卡训练;4) 国产自研:摩尔线程 MTLink 200 GB/s, 海光 HSL 200-400Gbps, 寒武纪 MLU-Link 100-200GB/s, 适合中小集群。建议: 中小训练 (8-64 卡) 用国产自研或 RoCE, 大训练 (≥128 卡) 用国产 RoCE + 自研交换芯片组合。


关于芯在线

芯在线 (杭州芯在线科技有限公司) 主营电子元器件代理分销 + 存储 + PCBA 一站式,服务 AI 服务器、工业控制、汽车电子、新能源、医疗、智能硬件、国产替代等场景。原厂授权、技术支持、一站式供应链服务。

联系方式:微信 shuna0305 / 邮箱 sales@coreonline.cn / WhatsApp +86-571-XXXX-XXXX

Inquiry:

电子产品PRODUCT

行业资讯

CONTACT US

Contact: 谢先生

Phone: 17614452002

Tel: 13811577998

Email: sales@coreonline.cn

Add: 浙江省杭州市临平区乔司街道三胜街237号1幢907

 
留言

         

13811577998

Skype

WhatsAPP

sales@coreonline.cn

24446440

Top
No:89512