MindSpeed LLM支持哪些模型Qwen3/DeepSeek/GLM等100大模型清单全解【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLMMindSpeed LLM 是面向华为昇腾Ascend芯片生态的大语言模型分布式训练套件目前已内置支持百余个业界常用 LLM 大模型的预训练与微调覆盖 Qwen3、DeepSeek、GLM 三大主力系列的稠密模型、MoE 稀疏模型和状态空间模型。本文带你快速读懂这份模型清单找到你最需要的模型及对应训练脚本。一图看懂MindSpeed LLM 支持哪些模型MindSpeed LLM 按模型架构把支持的大模型分为四大类并提供 Megatron 与 FSDP2 双训练后端Dense Model稠密模型Qwen3 系列等传统 Transformer 结构MoE Model混合专家模型DeepSeek、Qwen3-MoE、GLM 系列等SSM Model状态空间模型Mamba2 等Linear Model线性注意力模型Qwen3-Next 等官方完整清单见 supported_models.md每个模型都标注了序列长度、训练后端、推荐集群规模与认证状态【Pass】官方测试通过 / 【Test】内部测试中。稠密模型清单Qwen/LLaMA/GLM 全覆盖稠密模型适合单机或中小集群快速上手是新手入门的首选模型系列支持规格推荐集群规模训练后端Qwen30.6B ~ 32B1x8 ~ 2x8Mcore / FSDP2Qwen2.50.5B ~ 72B1x8 ~ 16x8McoreLLaMA3.18B ~ 405B1x8 ~ 36x8McoreLLaMA3.2 / 3.31B / 3B / 70B1x8 ~ 4x8McoreGLM4 / ChatGLM36B / 9B1x8 ~ 2x8McoreDeepSeek-R1-Distill1.5B ~ 70B1x8 ~ 4x8McoreInternLM2.51.8B ~ 20B1x8 ~ 2x8McoreMistral / Gemma27B / 9B / 27B1x8 ~ 2x8Mcore 集群规模格式为「节点数 × 卡数」例如1x8表示 1 台 8 卡机器单机 8 卡即可跑通 Qwen3-8B 训练。Qwen2.5 系列在 MindSpeed LLM 上的微调性能对比可以看到其相对业界方案的训练效率优势MoE 稀疏模型清单DeepSeek/GLM 旗舰级MoE 模型参数大、激活少是超大参数训练的主战场。MindSpeed LLM 支持的旗舰级稀疏模型模型规格推荐集群规模训练后端DeepSeek-V3671B64x8McoreDeepSeek-V3.2671B32x16McoreDeepSeek-V4-Flash284B8x16McoreGLM5 / GLM5.2MoE-744B32x16Mcore / FSDP2Qwen3-235B-A22BMoE16x16Mcore / FSDP2Qwen3-Next-80B-A3BMoE4x16Mcore / FSDP2LongCat-FlashMoE-560B8x16McoreMiniMax-M2.7MoE-229B8x16FSDP2Step-3.5-FlashMoE-196B12x16FSDP2Mixtral8x7B / 8x22B8x8Mcore这些模型对应的训练脚本都放在 examples/mcore/ 和 examples/fsdp2/ 目录下例如 pretrain_deepseek3_671b_4k_ptd.sh、pretrain_glm5_744b_4k_A3_ptd.sh。状态空间模型Mamba 系列SSM 模型处理长序列时计算与内存效率更高MindSpeed LLM 支持 Mamba22.7B/8B、Mamba2Hybrid 与 Mamba3 Demo预训练入口为 pretrain_mamba.py。训练后端怎么选Mcore 还是 FSDP2清单中的「训练后端」字段有三个取值直接决定你跑模型的方式Legacy历史实现维护中的老版本Mcore基于 Megatron 的主流实现支持 TP/PP/VP/EP/CP/DP 等多种并行策略大模型首选FSDP2PyTorch 官方分布式训练方案 FSDP Turbo 加速支持 FSDPEP、FSDPCP 组合新模型适配最快天级适配 Qwen3-Next 就是靠它FSDP2 的模型加载与并行包装由 model_factory.py 完成模型注册表见 model_registry.py。快速上手三步跑通你的模型选脚本按pretrain_模型名_参数_序列长度_训练方案_产品.sh的命名规则到 examples/ 找对应脚本微调脚本以tune_开头看规模脚本中NNODES/NPUS_PER_NODE指定了机器数与每机 NPU 数照此准备硬件转权重HF 权重需先转为训练格式转换流程如下图所示逐层处理、队列装配权重转换工具入口为 convert_ckpt_v2.py配套文档见 tools 目录。更多细节可参考快速入门Megatron 后端和快速入门FSDP2 后端。常见问题你的模型不在清单里怎么办多模态模型图文理解、文生视频等由 MindSpeed MM 专项维护不在本仓库清单内Mamba2 系列未提供开源词表建议自行构建词表若清单中找不到目标模型可参考 模型适配文档 自行扩展FSDP2 后端基于 Transformers 原生模型开发适配成本远低于 Mcore 后端提示无法直接访问 Hugging Face 时可前往 ModelScope 下载模型权重并核对文件正确性与安全性。总结你的需求推荐选择单机 8 卡新手入门Qwen3-8B、GLM4-9B1x8 集群中参数量生产训练Qwen2.5-72B、LLaMA3.1-405B超大 MoE 旗舰训练DeepSeek-V3-671B、GLM5-744B追求快速模型适配FSDP2 后端 examples/fsdp2/MindSpeed LLM 的模型清单仍在持续扩展GLM5.2、DeepSeek-V4-Flash、MiniMax-M2.7 已陆续上线完整列表请随时查看 模型支持文档。【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
