DeepSeek-R1 下载与部署完整指南:三步在本地跑通模型
DeepSeek-R1 下载与部署完整指南三步在本地跑通模型【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1本文以开源仓库 deepseek-ai/DeepSeek-R1 为例讲清楚 DeepSeek-R1 下载与 DeepSeek-R1 部署的全流程先按硬件选对型号再用一条命令把权重拉到本地最后跑通第一个推理请求。 先选对型号671B 还是蒸馏小模型DeepSeek-R1 值得上手的原因很简单推理能力强、权重全开源MIT 协议而且官方把推理能力蒸馏成了一批小模型消费级显卡也能跑。选型只看一张表类型型号参数量上下文核心模型MoEDeepSeek-R1 / R1-Zero总 671B激活 37B128K蒸馏模型denseDistill-Qwen-1.5B / 7B / 14B / 32B、Llama-8B / 70B1.5B ~ 70B128K结论先给你单张 24G 显存的消费卡选 1.5B 或 7B7B 量化后基本是效果/显存的最优解一张 80G 或两张卡选 32B多卡服务器32B 或 70B官方蒸馏模型里 32B 的基准成绩已很能打671B 核心模型单机会放不下权重约 1.4TB只有集群级别才考虑详细配置可对照 config.json核心模型是 256 路由专家 1 共享专家的 MoE每 token 激活 8 个专家FP8 量化存储。 DeepSeek-R1 下载到本地三个场景三套命令场景 A蒸馏小模型一条命令搞定用 HuggingFace 的hf命令行huggingface_hub自带直接拉取hf download deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --local-dir ./r1-7b7B 的 FP16 权重约 15GB留够磁盘空间即可。想要 Qwen 或 Llama 底座的其它规格把仓库名里的后缀换掉就行比如DeepSeek-R1-Distill-Qwen-32B。场景 B671B 核心模型分片 断点续传核心模型被切成了 163 个 safetensors 分片总大小约 1.4TB。huggingface 下载工具天然支持断点续传中断后重跑同一条命令即可不用重新下hf download deepseek-ai/DeepSeek-R1 --local-dir ./r1建议放在带宽稳定、磁盘够大的机器上跑或者挂后台长时间下载。场景 C网络受限走国内镜像如果直连 HuggingFace 不稳定可以走镜像仓库 clone记得先装 git-lfsgit lfs install git clone https://gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1 ./r1clone 完成后目录结构和本地下载一致可以直接用。 下完先别跑分片和磁盘空间两头核对跑之前花一分钟核对能省掉后面大量排查时间数分片ls model-*.safetensors | wc -l核心模型应输出 163看总大小du -sh .核心模型应在 1.4TB 上下蒸馏模型按参数量估如 32B FP16 约 65GB对照索引model.safetensors.index.json 的weight_map记录了每个权重属于哪个分片metadata.total_size约 1.37TB可以拿来和实际下载量比对三者对得上再进入部署环节。 DeepSeek-R1 本地部署一条 vllm 命令起服务vLLM 部署 DeepSeek-R1 蒸馏模型是最省事的路线官方 README 给出的命令直接可用vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \ --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager如果模型已经下载到本地把仓库 ID 换成你的本地目录路径即可不再走网络。两点补充想用 transformers 直接加载也可以蒸馏模型用法和 Qwen/Llama 一致AutoModelForCausalLM.from_pretrained(本地路径, trust_remote_codeTrue)即可但 671B 核心模型官方说明 transformers 暂不直接支持需按 DeepSeek-V3 仓库的方式部署推理参数别乱改官方 generation_config.json 的推荐值是 temperature 0.6、top_p 0.95最大生成长度 32768保持这个起点再微调⚠️ DeepSeek-R1 部署前该知道的坑别加 system prompt所有指令都放进用户提示里加系统提示会影响效果数学题提示中加一句请逐步推理并把最终答案放在 \boxed{} 中方便你解析结果温度别太低保持在 0.5~0.7趋近 0 时容易出现无限重复、语句不连贯显存不够就上量化AWQ、GPTQ 或 FP8 权重都能把显存需求砍半以上这是 7B/32B 落到消费级硬件的主要手段模型跳过思考如果输出是空的think/think直接给答案在提示里强制它用think\n开头能拉回完整推理过程收尾流程就是这四步选型号 → 拉权重 → 核对分片 → vllm 起服务全部跑通只需要一条下载命令和一条启动命令。跑通之后建议接着做两件事一是按你的任务类型微调 temperature 和 top_p二是把服务指向本地权重挂到内网供团队共用。671B 核心模型的部署则建议直接参考 DeepSeek-V3 的部署方案硬件条件到位后流程和上面的蒸馏模型一致。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考