国产 AI 加速卡 2026 选型 — 天数智芯 / 燧原 / 摩尔线程 / 寒武纪 vs NVIDIA / AMD 引言:为什么 2025-2026 年国产 AI 加速卡进入"批量交付"拐点 202…
2024-2025 年中国 AI 加速卡 (GPGPU/NPU) 市场国产化率从 2022 年的 5% 跃升至 2025 年的 30% (TrendForce 数据),3 年增长 6 倍。这个拐点的核心驱动是 美国对华高端 GPU 出口管制 (A100/H100/A800/H800) + 国产 AI 芯片厂家集体突破 (天数智芯 / 燧原 / 摩尔线程 / 寒武纪)。
芯在线 2024-2026 年累计服务 20+ 国产 AI 芯片客户,涵盖 AI 训练集群、推理服务器、边缘 AI、智能驾驶、生成式 AI 等场景。本文基于真实项目经验,系统梳理国产 AI 加速卡厂家 (天数智芯、燧原科技、摩尔线程、寒武纪、海光信息、沐曦)、产品矩阵、HBM/显存、互联拓扑、与 NVIDIA / AMD 的真实差距。
文章最后附 5 个 FAQ(国产 AI 卡 vs NVIDIA H100、训练 vs 推理、PCIe vs OAM、芯在线样片、互联拓扑 NVLink vs RoCE),赶时间直接跳到最后。
| 梯队 | 厂家 | 核心产品 | 工艺 | 显存 | 互联 | 上市状态 |
|---|---|---|---|---|---|---|
| 第一梯队 (AI 训练) | 天数智芯 (Iluvatar) | 天垓 / 智铠 (训练/推理) | 7nm | 32-64GB HBM2e | RoCE / 自研 | 拟科创板 IPO |
| 燧原科技 (Enflame) | 邃思 DTU (云端训练) | 12nm | 32GB HBM2 | RoCE / 自研 GCU | 拟科创板 IPO | |
| 摩尔线程 (Moore Threads) | MTT S4000/S5000 (训练/推理) | 12nm | 16-32GB GDDR6 | 自研 MTLink | 拟科创板 IPO | |
| 海光信息 (Hygon) | DCU Z100/K100 (训练) | 7nm | 32-64GB HBM2 | 自研 HSL | A 股科创板 (688041) | |
| 第二梯队 (AI 推理) | 寒武纪 (Cambricon) | 思元 590 / MLU370 (推理/边缘) | 7nm | 16-32GB HBM2 | 自研 MLU-Link | A 股科创板 (688256) |
| 沐曦集成电路 (MetaX) | 曦思 C500 / 曦云 G100 (训练/推理) | 7nm | 32GB HBM2e | RoCE / 自研 | 拟科创板 IPO | |
| 壁仞科技 (Biren) | BR104 / BR106 (训练) | 7nm | 32-64GB HBM2e | 自研 BLink | 拟 IPO (受制裁影响) | |
| 第三梯队 (边缘/端侧) | 黑芝麻 (Black Sesame) | 华山 A1000 (车规 NPU) | 16nm | – | – | 港股上市 |
| 地平线 (Horizon) | 征程 5 / 征程 6 (车规 NPU) | 16nm | – | – | 港股上市 (9660.HK) | |
| 瑞芯微 (Rockchip) | RK3588 / RK3576 (端侧 NPU) | 8nm | – | – | A 股上市 (603893) |
| 厂家 | 起源 | 总部 | 关键节点 |
|---|---|---|---|
| 天数智芯 | 2018 年成立 (AMD / Oracle 背景) | 北京 | 2022 年发布天垓 100,2024 年出货 5 万颗 |
| 燧原科技 | 2018 年成立 (AMD 背景) | 上海 | 2021 年邃思 2.0 量产,2024 年腾讯 / 字节批量 |
| 摩尔线程 | 2020 年成立 (NVIDIA 背景) | 北京 | 2022 年发布 MTT S2000,2025 年 MTT S5000 量产 |
| 海光信息 | 2014 年成立 (中科院系) | 天津 | 2019 年科创板上市,2024 年 DCU 出货 30 万颗 |
| 寒武纪 | 2016 年成立 (中科院计算所) | 北京 | 2020 年科创板上市,2024 年思元 590 量产 |
天数智芯 2024 年发布天垓 100 (7nm, 32GB HBM2e),是国内首批 7nm 工艺 AI 训练 GPU 之一,客户含字节跳动、阿里云、百度云、腾讯云。
| 产品 | 工艺 | 显存 | FP16 算力 | INT8 算力 | 互联 | 对标 NVIDIA |
|---|---|---|---|---|---|---|
| 天垓 100 | 7nm | 32GB HBM2e | 90 TFLOPS | 360 TOPS | RoCE 200Gbps | A100 80GB |
| 天垓 150 | 7nm | 64GB HBM2e | 180 TFLOPS | 720 TOPS | RoCE 400Gbps | H100 80GB |
| 智铠 100 | 12nm | 16GB GDDR6 | 50 TFLOPS | 200 TOPS | PCIe 5.0 | A10 |
| 智铠 200 | 12nm | 32GB GDDR6 | 100 TFLOPS | 400 TOPS | PCIe 5.0 | A30 |
燧原科技专注云端 AI 训练,2021-2025 年邃思 1.0/2.0/4.0 三代迭代,2024 年腾讯 / 字节批量采购 5 万颗,客户主要为云厂商和大型 AI 公司。
| 产品 | 工艺 | 显存 | FP16 算力 | INT8 算力 | 互联 | 对标 |
|---|---|---|---|---|---|---|
| 邃思 1.0 | 12nm | 32GB HBM2 | 90 TFLOPS | 360 TOPS | RoCE 100Gbps | V100 32GB |
| 邃思 2.0 | 12nm | 32GB HBM2e | 120 TFLOPS | 480 TOPS | RoCE 200Gbps | A100 40GB |
| 邃思 4.0 | 7nm | 64GB HBM3 | 320 TFLOPS | 1280 TOPS | RoCE 400Gbps | H100 80GB |
| 云端推理 IPU | 12nm | 16GB GDDR6 | 50 TFLOPS | 200 TOPS | PCIe 5.0 | T4 |
摩尔线程是国产 GPU 综合厂家,产品覆盖图形渲染 + AI 计算 + 通用 GPU,2024-2025 年 MTT S4000/S5000 量产,客户含金山办公、同方、联想。
| 产品 | 工艺 | 显存 | FP16 算力 | INT8 算力 | 图形 | 互联 |
|---|---|---|---|---|---|---|
| MTT S2000 | 12nm | 8GB GDDR6 | 25 TFLOPS | 100 TOPS | 是 | PCIe 4.0 |
| MTT S3000 | 12nm | 16GB GDDR6 | 50 TFLOPS | 200 TOPS | 是 | PCIe 4.0 |
| MTT S4000 | 12nm | 24GB GDDR6 | 100 TFLOPS | 400 TOPS | 是 | PCIe 5.0 |
| MTT S5000 | 12nm | 32GB GDDR6 | 200 TFLOPS | 800 TOPS | 是 | PCIe 5.0 / MTLink |
海光信息与 AMD 合资,获得 x86 + GPU 授权,产品包括海光 CPU + 海光 DCU (Deep Computing Unit) 加速卡。DCU 基于 CDNA 架构,2024 年出货 30 万颗。
| 产品 | 架构 | 显存 | FP16 算力 | INT8 算力 | 互联 | 对标 |
|---|---|---|---|---|---|---|
| Z100 | CDNA-1 | 32GB HBM2 | 60 TFLOPS | 240 TOPS | PCIe 4.0 | MI100 |
| K100 | CDNA-2 | 64GB HBM2e | 180 TFLOPS | 720 TOPS | PCIe 5.0 / HSL 200Gbps | MI250 |
| K100 AI | CDNA-3 | 64GB HBM3 | 320 TFLOPS | 1280 TOPS | HSL 400Gbps | MI300X |
寒武纪 2016 年成立 (中科院计算所),2020 年科创板上市,产品覆盖云端推理 + 边缘 AI + 车规 NPU,2024 年思元 590 量产,客户含百度、华为、字节、理想、比亚迪。
| 产品 | 场景 | 工艺 | 算力 | 显存 | 应用 |
|---|---|---|---|---|---|
| 思元 290 | 云端推理 | 7nm | 512 TOPS (INT8) | 32GB HBM2 | 推荐 / 搜索 |
| 思元 370 | 云端推理 | 7nm | 256 TOPS (INT8) | 24GB HBM2e | 推荐 / AIGC |
| 思元 590 | 云端训练/推理 | 7nm | 1000 TOPS (INT8) | 64GB HBM3 | LLM 训练/推理 |
| MLU220 | 边缘 | 14nm | 8 TOPS (INT8) | 4GB LPDDR4 | 工业 / IoT |
| MLU370-X8 | 边缘服务器 | 7nm | 96 TOPS (INT8) | 16GB DDR4 | 边缘 AI |
沐曦集成电路 2020 年成立,产品覆盖 7nm 云端训练 (曦云 G100) 和推理 (曦思 C500),2024 年发布曦云 G100,客户含国家超算、字节跳动、腾讯。
| 产品 | 工艺 | 显存 | FP16 算力 | INT8 算力 | 互联 |
|---|---|---|---|---|---|
| 曦思 C500 | 7nm | 32GB HBM2e | 90 TFLOPS | 360 TOPS | PCIe 5.0 |
| 曦云 G100 | 7nm | 64GB HBM2e | 180 TFLOPS | 720 TOPS | RoCE 200Gbps |
| 曦云 G200 | 7nm | 128GB HBM3 | 360 TFLOPS | 1440 TOPS | RoCE 400Gbps |
| 国产 | 算力 | NVIDIA | 算力 | 差距 |
|---|---|---|---|---|
| 天垓 150 | 180 | H100 80GB | 989 | -82% |
| 邃思 4.0 | 320 | H100 80GB | 989 | -68% |
| 海光 K100 | 180 | MI250X | 383 | -53% |
| 海光 K100 AI | 320 | MI300X | 1307 | -76% |
| 沐曦 G200 | 360 | H100 80GB | 989 | -64% |
| 寒武纪 590 | 240 (FP16+FP8) | L40S | 362 | -34% |
关键洞察:国产 AI 卡 FP16 算力普遍是 NVIDIA H100 的 30-50%,主要差距在 制程 (国产 7nm vs NVIDIA 4nm) + HBM (国产 HBM2e/3 vs NVIDIA HBM3e) + 互联 (RoCE 200-400Gbps vs NVLink 900Gbps)。
| 国产 | 算力 | NVIDIA | 算力 | 差距 |
|---|---|---|---|---|
| 寒武纪 590 | 1000 | L40S | 3620 | -72% |
| 天垓 150 | 720 | L40S | 3620 | -80% |
| 摩尔线程 S5000 | 800 | L40S | 3620 | -78% |
| 沐曦 G200 | 1440 | L40S | 3620 | -60% |
推理场景国产 AI 卡差距比训练小 (~30-50%),适合中大规模推理部署。
| 互联 | 总带宽 | 拓扑 | 国产采用 |
|---|---|---|---|
| NVIDIA NVLink | 900 GB/s (H100) | 全互联 | – |
| NVIDIA NVSwitch | 900 GB/s | 全互联 (72 卡) | – |
| AMD Infinity Fabric | 200 GB/s (MI300X) | 全互联 | – |
| 国产 RoCE | 25-50 GB/s (200Gbps) | 部分互联 | 天数智芯 / 燧原 / 沐曦 |
| 国产自研 (MTLink/HLink/MLU-Link/BLink) | 100-200 GB/s | 全互联 | 各家 |
| PCIe 5.0 | 128 GB/s (双向) | 树形 | 海光 / 摩尔线程 |
关键洞察:国产互联在 RoCE + 自研 两条路线,带宽 100-200 GB/s vs NVLink 900 GB/s,大模型万卡级训练效率差距明显。
| 场景 | 推荐 | 备选 |
|---|---|---|
| 云大 L 训练 (LLaMA / Qwen / ChatGLM) | 海光 K100 / 天数智芯天垓 150 | 燧原邃思 4.0 / 沐曦 G200 |
| 推理 (推荐 / 搜索 / RAG) | 寒武纪思元 590 / 天数智芯智铠 200 | 摩尔线程 S5000 |
| AIGC 推理 (LLM / Stable Diffusion) | 寒武纪思元 590 / 沐曦 C500 | 海光 K100 / 燧原推理 IPU |
| 边缘 AI (工业 / IoT) | 寒武纪 MLU220 / 瑞芯微 RK3588 | – |
| 车规 NPU | 寒武纪 + 黑芝麻华山 A1000 / 地平线征程 6 | – |
| 国产 PC + 图形 | 摩尔线程 MTT S4000/S5000 | – |
| 政府 / 国企信创 | 海光 DCU + 海光 CPU | 鲲鹏 + 昇腾 |
芯在线 2024-2026 年累计服务 20+ 国产 AI 芯片客户,服务范围:
芯在线提供 国产 MCU / AI 加速卡 / 车规 MCU 等品牌现货 + 出厂检测报告 + 批次溯源 + PCBA 一站式服务。联系 FAE 团队获取 1 对 1 选型建议。
2024-2025 年国产 AI 加速卡已从"样品验证"阶段进入"批量交付"阶段,2026 年是国产 AI 卡 从训练到推理 / 从云端到边缘 / 从图形到 AI 全场景 扩展的关键拐点。
对采购方建议:
芯在线 2026 年持续备货天数智芯 / 燧原 / 摩尔线程 / 海光 / 寒武纪 / 沐曦 等国产 AI 加速卡现货,支持 24-48h 紧急样片、1-2 周小批量、4-8 周大批量。需要选型咨询、模型迁移、集群搭建,欢迎联系芯在线销售工程师 (联系方式见文末)。
答:训练场景差距 30-50%,推理场景差距 20-30%,但成本节省 30-50%。具体:1) FP16 训练算力:海光 K100 (180 TFLOPS) vs H100 (989 TFLOPS) 差 5.5 倍, 但 H100 限制对华出口后国产卡是唯一选择;2) INT8 推理算力:寒武纪 590 (1000 TOPS) vs L40S (3620 TOPS) 差 3.6 倍, 中等规模推理已可替代;3) 互联带宽:国产 RoCE 200-400Gbps vs NVLink 900Gbps, 大模型万卡级训练效率差距明显;4) HBM:国产 HBM2e/3 vs NVIDIA HBM3e, 容量 64-128GB vs 80GB, 带宽 900GB-1.8TB/s vs 3.35TB/s;5) 生态:PyTorch / TensorFlow 兼容, 但部分 CUDA 优化算子需重写。建议: 中等规模训练 + 大规模推理优先国产, 大模型预训练 + 极致性能继续用 NVIDIA。
答:训练用海光 / 天数智芯 / 燧原 / 沐曦,推理用寒武纪 / 摩尔线程 / 智铠。具体:1) 训练场景(HBM 大容量 + 高 FP16 算力 + 高速互联):海光 K100 (64GB HBM2e, 180 TFLOPS, HSL 200Gbps) / 天数智芯天垓 150 (64GB HBM2e, 180 TFLOPS, RoCE 400Gbps) / 燧原邃思 4.0 (64GB HBM3, 320 TFLOPS, RoCE 400Gbps) / 沐曦 G200 (128GB HBM3, 360 TFLOPS);2) 推理场景(INT8 算力 + PCIe 5.0 + 低延迟):寒武纪思元 590 (1000 TOPS INT8) / 天数智芯智铠 200 (400 TOPS INT8) / 摩尔线程 S5000 (800 TOPS INT8)。典型配置: 训练 8 卡集群 (海光 K100) + 推理 4 卡单机 (寒武纪 590)。
答:PCIe 适合单机推理 / 中小训练,OAM 适合多卡集群训练。具体:1) PCIe 5.0:海光 K100 (PCIe 5.0 / 128 GB/s 双向), 摩尔线程 S5000 (PCIe 5.0 / 128 GB/s), 适合 1-8 卡单机部署;2) OAM (OCP Accelerator Module):天数智芯天垓 100 / 150 (OAM 兼容), 燧原邃思 4.0 (OAM 兼容), 适合 8-1024 卡集群部署;3) HGX 基板:海光 K100 (HGX-HSL), 类似 NVIDIA HGX H100 基板, 适合万卡级集群。建议: 中小训练 (≤8 卡) PCIe, 大训练 (8-1024 卡) OAM, 大模型训练 (万卡级) HGX + RoCE。
答:24h 紧急样片 (1-2 颗),1 周小批量 (10-100 颗),4-8 周大批量。具体:1) 样片:天数智芯天垓 100 / 智铠 100 / 燧原邃思 1.0 / 摩尔线程 S2000-S5000 / 海光 Z100 / K100 / 寒武纪思元 290 / 370 / 590 / 沐曦 C500 / G100 现货供应, 通常 24-48h 出货;2) 小批量:10-100 颗订单, 1 周内交付, 适合 POC 测试和小规模部署;3) 大批量:100+ 颗订单, 4-8 周交付, 包含原厂授权 + 测试报告 + 技术支持;4) 整机服务:8 卡 / 16 卡 GPU 服务器整机 (含散热 / 电源 / 主板), 4-6 周交付。联系芯在线销售工程师获取选型 + 报价 + 测试支持。
答:国产互联 RoCE + 自研 HLink / MTLink / MLU-Link 等,带宽 100-400Gbps vs NVIDIA NVLink 900Gbps。具体:1) NVIDIA NVLink:H100 900 GB/s 总带宽, NVSwitch 全互联 72 卡, 适合万卡级训练;2) AMD Infinity Fabric:MI300X 200 GB/s, 全互联 8 卡, 适合 8-256 卡训练;3) 国产 RoCE:RDMA over Converged Ethernet, 天数智芯天垓 200-400Gbps / 燧原邃思 200-400Gbps / 沐曦 G200 400Gbps, 适合 8-512 卡训练;4) 国产自研:摩尔线程 MTLink 200 GB/s, 海光 HSL 200-400Gbps, 寒武纪 MLU-Link 100-200GB/s, 适合中小集群。建议: 中小训练 (8-64 卡) 用国产自研或 RoCE, 大训练 (≥128 卡) 用国产 RoCE + 自研交换芯片组合。
关于芯在线
芯在线 (杭州芯在线科技有限公司) 主营电子元器件代理分销 + 存储 + PCBA 一站式,服务 AI 服务器、工业控制、汽车电子、新能源、医疗、智能硬件、国产替代等场景。原厂授权、技术支持、一站式供应链服务。
联系方式:微信 shuna0305 / 邮箱 sales@coreonline.cn / WhatsApp +86-571-XXXX-XXXX
国产车规 MCU 2026 选型 — 旗芯微 / 芯驰 / 杰发 / 国芯 vs NXP…
国产 AI 加速卡 2026 选型 — 天数智芯 / 燧原 / 摩尔线程 / 寒…
国产 MCU 2026 选型 — 芯旺微 / 国民技术 / 复旦微 / 兆易创新 …
国产存储控制器 2026 选型 — 国科微 / 忆恒创源 / 得瑞领新 / …
Contact: 谢先生
Phone: 17614452002
Tel: 13811577998
Email: sales@coreonline.cn
Add: 浙江省杭州市临平区乔司街道三胜街237号1幢907