MiniMax M3 本地部署测算
MiniMax M3(MiniMax)在不同算力卡上的本地部署配置、预估性能与适用场景。
数据更新时间:2026-09-16B300 288GB
288GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 696 tok/s单流理论估算
- 硬件出厂价
- ¥1,440,000–¥1,728,000云端时租(实时)×4张:¥254.4–¥254.4/时(2026-09-17)
- 硬件市场价
- ¥48,000,000–¥56,000,000
- 适用场景
- 机构级超大规模训练与高并发推理集群
GB200 192GB(单卡等效)
192GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 8张
- 预估解码速度
- 1,391 tok/s单流理论估算
- 硬件出厂价
- ¥1,601,280–¥2,401,920
- 硬件市场价
- ¥4,800,000–¥9,600,000
- 适用场景
- 超大规模万亿参数模型训练与推理集群(与Grace CPU协同组网)
B200 180GB
180GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 8张
- 预估解码速度
- 1,391 tok/s单流理论估算
- 硬件出厂价
- 资料不足云端时租(实时)×8张:¥474.4–¥474.4/时(2026-09-17)
- 硬件市场价
- ¥3,000,000–¥3,500,000
- 适用场景
- 机构级大规模在线推理与训练
H200 141GB
141GB · 4,800GB/s带宽 · 顶级出口管制卡(对华渠道多变)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 8张
- 预估解码速度
- 835 tok/s单流理论估算
- 硬件出厂价
- ¥1,612,800–¥2,592,000云端时租(实时)×8张:¥107.2–¥268.0/时(2026-09-17)
- 硬件市场价
- ¥1,500,000–¥1,560,000
- 适用场景
- 企业级生产环境高并发推理
H100 SXM5 80GB
80GB · 3,350GB/s带宽 · 顶级出口管制卡(对华无官方渠道)- 建议精度
- INT8量化
- 所需卡数
- 8张
- 预估解码速度
- 1,165 tok/s单流理论估算
- 硬件出厂价
- ¥2,016,000–¥2,304,000云端时租(实时)×8张:¥116.8–¥325.6/时(2026-09-17)
- 硬件市场价
- ¥2,700,000–¥2,800,000
- 适用场景
- 企业级生产环境高并发推理/训练
H800 SXM 80GB
80GB · 3,350GB/s带宽 · 顶级出口管制卡(已停供)- 建议精度
- INT8量化
- 所需卡数
- 8张
- 预估解码速度
- 1,165 tok/s单流理论估算
- 硬件出厂价
- ¥1,960,000–¥2,080,000
- 硬件市场价
- ¥2,700,000–¥2,800,000
- 适用场景
- 企业级生产部署(原对华合规型号,现已停供)
H20 96GB
96GB · 4,000GB/s带宽 · 出口合规特供卡(算力大幅阉割)- 建议精度
- INT8量化
- 所需卡数
- 8张
- 预估解码速度
- 1,391 tok/s单流理论估算
- 硬件出厂价
- 资料不足
- 硬件市场价
- ¥640,000–¥880,000
- 适用场景
- 出口合规环境下的次优选择,中大规模推理部署(FP16算力仅约H100的15%,但内存带宽较高,解码密集场景相对占优)
A800 PCIe 80GB
80GB · 1,935GB/s带宽 · 合规特供卡(出口合规状态多次调整)- 建议精度
- INT8量化
- 所需卡数
- 8张
- 预估解码速度
- 673 tok/s单流理论估算
- 硬件出厂价
- ¥800,000–¥832,000
- 硬件市场价
- ¥560,000–¥680,000
- 适用场景
- 出口合规环境下的中等规模推理/训练部署
昇腾910B 64GB
64GB · 400GB/s带宽 · 国产替代(不受美国出口管制)- 建议精度
- INT4量化(AWQ/GPTQ)
- 所需卡数
- 8张
- 预估解码速度
- 278 tok/s单流理论估算
- 硬件出厂价
- 资料不足
- 硬件市场价
- ¥880,000–¥960,000
- 适用场景
- 国产替代,不受美国出口管制,中大规模推理/训练部署,内存带宽明显低于同显存量级NVIDIA卡
L40S 48GB
48GB · 864GB/s带宽 · 合规推理卡- 建议精度
- INT4量化(AWQ/GPTQ)
- 所需卡数
- 8张
- 预估解码速度
- 601 tok/s单流理论估算
- 硬件出厂价
- ¥360,000–¥520,000云端时租(实时)×8张:¥36.0–¥43.2/时(2026-09-17)
- 硬件市场价
- ¥360,000–¥520,000
- 适用场景
- 中小团队自建推理服务,中低并发
L20 48GB
48GB · 864GB/s带宽 · 合规推理卡- 建议精度
- INT4量化(AWQ/GPTQ)
- 所需卡数
- 8张
- 预估解码速度
- 601 tok/s单流理论估算
- 硬件出厂价
- ¥192,000–¥256,000
- 硬件市场价
- ¥200,000–¥280,000
- 适用场景
- 中小团队自建推理服务,中低并发
RTX 5090D 24GB
24GB · 1,344GB/s带宽 · 消费级/小规模自建- 建议精度
- INT4量化(AWQ/GPTQ)
- 所需卡数
- 16张(超单机,需多节点)
- 预估解码速度
- 1,870 tok/s单流理论估算
- 硬件出厂价
- ¥328,000–¥335,984云端时租(实时)×16张:¥40.0–¥57.6/时(2026-09-17)
- 硬件市场价
- ¥480,000–¥640,000
- 适用场景
- 个人开发/小规模验证/POC,不建议生产级高并发
RTX 4090D 24GB
24GB · 1,008GB/s带宽 · 消费级/小规模自建- 建议精度
- INT4量化(AWQ/GPTQ)
- 所需卡数
- 16张(超单机,需多节点)
- 预估解码速度
- 1,402 tok/s单流理论估算
- 硬件出厂价
- ¥207,984–¥303,984云端时租(实时)×16张:¥27.2–¥51.2/时(2026-09-17)
- 硬件市场价
- ¥416,000–¥480,000
- 适用场景
- 个人开发/小规模验证/POC,不建议生产级高并发
预估解码速度=(显存带宽×卡数)÷(激活参数×精度字节数),是内存带宽瓶颈下单条请求吞吐量的理论上限(roofline模型),按卡数线性放大,未计入多卡并行通信开销、批处理并发与框架效率损耗,实际压测结果通常明显低于此值,且卡数越多折损通常越大;这个线性放大假设对配备NVLink/NVSwitch的数据中心卡(H系列/B系列)相对合理,对消费级卡(RTX 5090D/4090D等常见PCIe互联、无NVLink)明显过于乐观——多张消费卡跑张量并行的实际速度会因通信瓶颈大打折扣,因此同一模型下消费卡看起来"卡数一样、速度不输数据中心卡"是理论上限的假象,不能据此认为消费级方案性能相当,仅用于不同硬件之间的数量级横向比较,不是承诺性能指标。「建议精度」按可在单机常见的8张卡以内容纳的最高精度自动选择,超过8张即标注"需多节点";实际大规模生产部署也常用更多卡换取更高并发,而非单纯追求最高精度。硬件出厂价/市场价按所需卡数折算总额,人工整理定期复核;"云端时租(实时)"取自vast.ai公开市场API每日自动刷新,是国际云端市场时租价×卡数,不代表中国大陆整卡采购价,仅供横向趋势参考。完整硬件明细来源见 本地部署测算总览 底部硬件对照表。