我用 Windows 当主力机从下载 Ollama 到把 DeepSeek 跑起来再接上 Web UI、最后搭出个人知识库全程没碰云服务、没用大厂 API全靠本地算力。这套东西看起来有四个环节实际上一旦理清“模型服务、界面层、检索层”之间的关系半天就能搞定。下面把每一步的细节、参数、坑都交代清楚照着走就行。1. 整体链路拆解先搞懂这四个环节到底在干什么1.1 这个方案解决什么需求很多人一看到“Ollama DeepSeek UI 知识库”就发懵觉得门槛高。其实拆开看四个词分别解决四件事Ollama 负责把开源大模型“装进”你的电脑提供一个本地推理服务对外暴露一个 API 接口默认跑在http://localhost:11434。你可以用命令行直接交互也可以让其他程序来调用它。DeepSeek 是你要运行的模型本体具体来说是 DeepSeek 开源出来的对话模型权重。在 Ollama 生态里你能拉到的通常是 DeepSeek-R1 系列的不同尺寸版本从 1.5B 到 70B 都有配置不够就用小尺寸想体验更强推理就用大尺寸。UI 是给模型套上一层“浏览器页面”或“桌面窗口”让你像用 ChatGPT 一样在对话框里打字而不是对着黑底白字的终端。知识库解决的是“让模型知道你私有的资料”。模型只会回答它能记住的公开知识你丢进去一份公司制度、行业报告或者个人笔记它本来不知道但通过 RAG检索增强生成技术可以让它在回答前先检索你的文档再把相关内容拼进上下文从而给出基于你私有资料的答案。这四个环节串起来后你得到的是一个完全离线、数据不出本机、可自由提问、可喂私有文档的本地 AI 系统。适合谁开发者想做二次开发、写文稿的人想让大模型帮自己总结资料、小团队想搭建内部 AI 问答工具、以及纯粹担心隐私不想把数据交给云端的人。1.2 为什么在 Windows 上这么做很多人觉得本地跑大模型是 Linux 的专利其实 Windows 上跑这套已经非常成熟了。Ollama 官方提供 Windows 安装包底层用到了 WSL2 或者原生 Windows 二进制对普通用户来说根本不用碰 Linux。DeepSeek-R1 的 7B/8B 量化版本在 8GB 内存 独立显卡的机器上就能有可用的速度没有显卡的纯 CPU 机器也能跑只是慢一点。我推荐的路径是Ollama 装好 → 拉取 DeepSeek 模型 → 测试命令行对话 → 安装 UI这里我会推荐两条路一条轻量客户端一条 Web 服务→ 用支持知识库的 UI 上传文档测试 → 再回头补知识库的进阶玩法。你先按这个顺序走别急着一步到位因为每一步都能独立验证出问题容易定位。2. Windows 环境下 Ollama 的安装与关键配置2.1 下载安装官网直下太慢怎么办到 Ollama 官网下载 Windows 安装包这个文件大约 300MB 左右。装上之后是图形界面加托盘程序安装过程不需要特殊配置默认安装到C:\Users\你的用户名\AppData\Local\Programs\Ollama。装完后命令行里运行ollama --version能输出版本号就是成功了。如果你发现官网下载很慢可以试试 GitHub Releases 页面里找对应版本的安装包。另外 Windows 上如果装了winget直接执行winget install Ollama.Ollama也能装。装完之后托盘区会出现一个羊驼图标说明 Ollama 服务已经在后台跑起来了默认监听127.0.0.1:11434。这里有个容易踩的坑安装路径默认在 C 盘模型文件默认也放在 C 盘用户目录下路径形如C:\Users\你的用户名\.ollama\models。大模型动辄几个 GBC 盘空间紧张的人建议提前改路径。2.2 修改模型存放路径与环境变量关闭 Ollama 托盘程序然后新建环境变量变量名OLLAMA_MODELS变量值D:\ollama\models改成你自己的盘符补充说明一下Windows 设置环境变量的路径是右键“此电脑” → 属性 → 高级系统设置 → 环境变量。改完后要重启终端窗口。重新打开 Ollama之后再ollama pull的模型就都存到 D 盘了。另外几个常用的环境变量也一并说清楚OLLAMA_HOST改成0.0.0.0:11434可以让局域网内其他设备访问你的模型服务默认只允许本机访问。OLLAMA_NUM_PARALLEL控制并行请求数显存够大的话可以设成 2 或更多。OLLAMA_KEEP_ALIVE模型在内存中的驻留时间默认 5 分钟。如果你的机器内存有限可以设小一点比如OLLAMA_KEEP_ALIVE2m。改完环境变量重启 Ollama 后可以用ollama list看模型列表用ollama ps看当前加载了哪些模型。2.3 验证安装和基本命令启动完成后命令行里挨个敲ollama list ollama pull deepseek-r1:8b ollama run deepseek-r1:8b第一个命令查看已有模型第二个命令从模型库拉取 DeepSeek-R1 的 8B 版本第三个命令直接进入交互式对话。如果第三步能在终端里跟它聊天说明底子已经通了。3. 本地部署 DeepSeek 模型尺寸选择、下载与跑通3.1 该选多大尺寸的 DeepSeek 模型这是新手最容易纠结的问题。DeepSeek-R1 在 Ollama 官方库里有多个尺寸标签我按配置给你一个选型参考建议配置可选模型标签显存/内存需求参考8GB 内存无独显deepseek-r1:1.5b约 2GB 内存16GB 内存无独显deepseek-r1:7b或8b约 5~6GB 内存8GB 显存deepseek-r1:8b约 6GB 显存CPU 内存不低于 16GB16GB 显存deepseek-r1:14b约 10GB 显存24GB 显存及以上deepseek-r1:32b或70b32B 约 20GB70B 建议 32GB日常使用我推荐优先考虑deepseek-r1:8b。它在推理能力和资源占用之间比较平衡中文理解好做知识库问答、文档总结都很稳。如果你的电脑连 8B 都吃力就退到1.5b虽然能力弱一些但至少能跑通整个流程等你熟悉之后再换大模型。3.2 模型下载慢的解法从镜像站下载 GGUF 再导入直接执行ollama pull deepseek-r1:8b是走官方模型库下载。这个库在国外很多网络环境下速度很不稳定经常出现下载到一半卡住的情况。我个人比较推荐的做法是从国内镜像站下载 GGUF 格式的模型文件再导入 Ollama。具体思路是先把 DeepSeek-R1 8B 的量化版本文件通常是 4-bit 量化文件名带q4_k_m下载到本地然后通过 Ollama 的 Modelfile 机制把 GGUF 文件转成 Ollama 能管理的格式。我以 ModelScope魔搭社区下载为例那里的 DeepSeek 模型文件比较全。下载到一个固定目录比如D:\models\deepseek-r1-8b-q4_k_m.gguf然后在该目录下新建一个文本文件命名为Modelfile内容就写一行FROM ./deepseek-r1-8b-q4_k_m.gguf保存后打开终端进入这个目录执行ollama create deepseek-r1 -f ./Modelfile这一步会把本地 GGUF 文件注册成 Ollama 模型之后就能直接ollama run deepseek-r1。镜像站下载速度一般是几百 KB 到几 MB 每秒比官方源稳定很多。注意不要混着用你从哪个文件导入就要保证那个文件是你想要的那个模型版本名称自己起别和官方标签混淆。3.3 跑通首次对话并调整运行参数模型导入或拉取完成后执行ollama run deepseek-r1首次启动会把模型加载进内存加载过程根据模型大小可能需要几十秒到几分钟。终端里输入“你好”试试如果能看到回复说明本地模型已经在你的 Windows 上正常部署了。如果觉得回复慢可以看一下是不是被 CPU 跑还是被 GPU 加速。执行ollama ps输出里能看到“PROCESSOR”列如果写着100% GPU说明 GPU 加速生效如果写着100% CPU说明没有走显卡。没有 N 卡的话Windows 下 Ollama 默认走 CPU这是正常的。有 N 卡但没生效需要装对应版本的 NVIDIA 驱动以及设置CUDA_VISIBLE_DEVICES或者确保安装的 Ollama 版本支持 GPU新版本默认支持。对话过程中直接用ollama run的弊端是没有记忆插件的概念退出再进上下文就没了。这个不影响后续接 UI因为 UI 会把对话记录存在自己的存储里。4. UI 可视化四种方案怎么选、怎么配4.1 UI 方案对比命令行能用但大多数人还是需要界面。我实际用过的方案里挑四个有代表性的方案类型安装难度知识库支持适用场景ChatboxWindows 桌面客户端极低支持日常聊天、轻量测试Cherry StudioWindows 桌面客户端极低支持中文界面、多模型管理Open WebUIWeb 服务Docker 或 pip中等支持对方引用局域网共享、功能扩展AnythingLLMWindows 桌面客户端低强个人知识库一体化首选如果你想最快看到 UI选 Chatbox 或 Cherry Studio。如果你想一步到位连知识库直接看 AnythingLLM。Open WebUI 功能最强、最像 ChatGPT 网页版但对 Windows 小白来说Docker 装起来会多一些步骤。4.2 最快方案Chatbox 桌面客户端去 Chatbox 官网下载 Windows 版安装后打开。点左下角设置模型服务商选择“Ollama”API 地址填http://localhost:11434模型下拉框选deepseek-r1。保存后回到对话页就能打字聊天了。这个方案的优点是零配置依赖不要求装 Docker。缺点是 Chatbox 的知识库能力比较基础适合先验证模型不适合做复杂的私有知识问答。4.3 进阶方案Open WebUI Docker DesktopOpen WebUI 是我在 Windows 上最终留下使用的方案。你需要在 Windows 上装 Docker Desktop安装时选 WSL2 后端然后打开终端执行docker run -d -p 3000:8080 --add-hosthost.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main装完浏览器打开http://localhost:3000注册管理员账号进入设置。在“模型”里接 Ollama注意容器内部要访问宿主机API 地址不能写localhost要写http://host.docker.internal:11434。我之前第一次配的时候没注意这个容器里一直连不上 Ollama后来改成host.docker.internal就通了。Open WebUI 支持直接管理 Ollama 模型、调参数、多会话。它也能挂在局域网里让同事用浏览器访问。如果你对 Docker 不熟遇到镜像拉不下来可以找能用的注册表加速源这也是国内 Docker 用户绕不开的问题。4.4 一体化选择AnythingLLMAnythingLLM 的定位是“本地知识库 大模型客户端”它内置向量数据库不用你自己装任何中间件。我建议如果你最终目的是知识库就跳过 Chatbox直接用 AnythingLLM。安装后它有图形化的配置向导。在设置里LLM 提供商选 Ollama模型选deepseek-r1API 地址同样填http://localhost:11434。向量数据库选内置的 LanceDB嵌入模型建议选内置的默认嵌入模型也可以选 Ollama 里的nomic-embed-text。注意如果你没有单独ollama pull nomic-embed-text要先把 274MB 的嵌入模型拉下来。5. 搭建个人知识库RAG 到底怎么落地5.1 RAG 原理不用重新训练也能“学会”新知识知识库不是把文档塞给模型让它记住而是采用 RAG。模型本身不会变你问一个问题时系统先把你的问题转换成向量然后在文档库里找到语义最相近的几段文字再把这几段文字和你的问题一起交给模型模型基于这些文字生成回答。这样做的最大好处是模型只负责生成文档内容存在向量数据库里随时增删改不需要重新训练模型也不怕模型“记错”。整个过程是实时的换一份文档马上就能用到新知识。5.2 用 AnythingLLM 做知识库具体步骤打开 AnythingLLM 后会先创建 Workspace每个工作区对应一个独立的知识库。进入工作区左侧是聊天界面右侧是文档管理区。点击“上传”支持 PDF、TXT、Markdown、Word 等多种格式。上传后系统会先把文档切分成小块也就是 chunk默认配置大概是每块几百个字符。然后系统为每一块生成向量存到内置向量库里。当你的文档数量多或者是 PDF 扫描件时切分和向量化会慢一些耐心等进度条走完。这里有个实操建议不要一口气丢几百个文件进去。先丢两三个跟你要问的问题相关的文档问几个问题看效果没问题再批量上传。否则一旦效果不好很难判断是文档切分的问题还是模型理解能力的问题。测试时问一句“根据我上传的资料总结一下核心内容”。如果回答里引用了文档里的原文或者回答内容明显和你上传的文档一致说明知识库链路是通的。AnythingLLM 还支持在答案下方显示来源引用点开可以看到它是基于哪些 chunk 生成的方便你排查。5.3 进阶玩法Dify、RagFlow 和 FastGPT 怎么选AnythingLLM 够用但如果你想做更复杂的场景比如把知识库做成一个对外 API、加入多轮对话的工作流编排那就得看向更重的开源平台。Dify 在 Windows 上可以用 Docker Compose 一键启动它的“知识库”模块和“工作流”模块结合得很紧密可以做成“用户提问 → 检索知识库 → 调用 DeepSeek → 输出答案”的完整流水线。RagFlow 则更侧重文档解析尤其对 PDF 表格、版面复杂的文档效果好。FastGPT 是国内社区用得多的另一个选项文档体验相对友好。这三个平台都支持接入 Ollama 提供的本地模型架构上都可以视为“知识库 模型编排器”。但必须提醒的是它们的安装复杂度比 AnythingLLM 高不止一个量级涉及 Docker 容器、外部 PostgreSQL/Redis、对象存储等组件。你在 Windows 上想尝鲜先从 AnythingLLM 开始等真正需要工作流了再迁移。5.4 搭配 Obsidian 的偷懒玩法如果你平时用 Obsidian 记笔记那其实可以不用单独搭知识库系统直接在 Obsidian 里接入本地模型。目前社区有几款插件可以做到比如 Smart Connections 和 Copilot。思路是把 Obsidian 的 vault 目录当作文档来源插件读取你本地所有 Markdown 笔记向量化索引后你可以在 Obsidian 界面里直接问笔记里的内容。底层模型依然可以指向 Ollama 的deepseek-r1。这样你根本不需要手动“上传”文件笔记更新后重新索引一遍就行。我自己就是把 300 多篇笔记全部索引进去平时问“我之前写过关于 XX 的那篇笔记里提到的核心观点是什么”它直接定位到对应的段落效率比我手动翻笔记高太多。如果你已经重度使用 Obsidian强烈推荐试一下。6. 常见问题与排查实录6.1 模型下载太慢、中途失败遇到这种情况先别死磕ollama pull。断开重试通常解决不了根源。我的办法是直接走镜像站下载 GGUF 文件然后用 Modelfile 导入。如果已经下载一半可以用支持断点续传的下载工具重新拉取然后覆盖原文件再执行导入。6.2 UI 连不上 Ollama启动 UI 后提示“Failed to connect to Ollama”或类似错误优先检查三件事Ollama 托盘程序是否还在运行没有运行就先启动它。地址是否写对本机用127.0.0.1:11434或localhost:11434容器内用host.docker.internal:11434。端口有没有被占用执行netstat -ano | findstr 11434看 11434 是否在监听。如果有 PID 显示但 Ollama 没启动可能是别的程序占用了端口。如果 11434 端口被占用可以改OLLAMA_HOST指向其他端口例如OLLAMA_HOST127.0.0.1:11435。6.3 界面卡顿、输入响应慢如果你用的是 Open WebUI 并且页面明显卡顿先看模型加载了多少个。WebUI 里每切换一次模型如果OLLAMA_KEEP_ALIVE拉满多个模型会同时驻留内存内存不足就会页面卡。把OLLAMA_KEEP_ALIVE设为2m并且在任务管理器里观察内存占用。另外浏览器别同时开太多重型标签页Open WebUI 的页面本身是 React 应用内存吃得不小。6.4 内存不够用的优化措施机器只有 16GB 内存跑 8B 模型经常感觉要爆。此时可以关闭所有不用的后台程序特别是浏览器多开标签页。换更小的量化模型比如deepseek-r1:1.5b。如果用的是 Docker 方案检查 WSL2 的内存上限配置在C:\Users\你的用户名\.wslconfig里写上[wsl2] memory8GB防止 WSL2 把物理内存全吞掉。6.5 模型输出内容与预期不符经常有人遇到“模型回答得不够好”的问题尤其是知识库场景。总怀疑是不是部署错了。实际上深度求索的开源模型在通用能力上没问题但知识库问答效果差大概率出在检索环节。文档切分太大导致检索出来的 chunk 里有效信息被稀释或者你问的问题本身和文档里表述方式差异过大检索不到相关内容。解决办法是用精确的词重新问一次比如把“那个项目的负责人是谁”改成“项目负责人张三的联系方式是什么”。同时调整切分大小AnythingLLM 里的 chunk size 调小一些比如 300重叠部分调多一些会让检索结果更聚焦。7. 部署完成后的一些实用扩展模型跑通知识库也能回答了这套东西基本已经在自己电脑里“活”起来了。我再补充几个我实测过、能立刻提升使用体验的小技巧你可以按需挑。如果你想通过 API 调用本地 DeepSeek 模型方便写脚本批量处理文档或者接入其他应用Ollama 本身就是一个标准 OpenAI 风格接口。比如用 Python 访问只需要请求http://localhost:11434/v1/chat/completions模型名称填deepseek-r1即可。这样你写的自动化脚本就能直接享受本地模型能力不需要额外装任何框架。另外很多 Windows 用户还喜欢把 UI 做成开机自启Chatbox 和 AnythingLLM 都有开机启动选项Open WebUI 则要依赖 Docker Desktop 的自动启动。如果你和我一样机器开机时间比较长建议把 Docker 的自启动打开这样模型服务、UI、知识库是完整的开机自动恢复。还有一个容易被忽略的点模型文件路径备份。Ollama 拉下来的模型文件都在OLLAMA_MODELS指定的目录里目录体积很大。如果你换电脑或者重装系统把这个目录整个拷贝到新机器的相同路径再装好 Ollama执行ollama list发现模型还在就能少下载几十 GB 的内容。我重装系统时吃过教训后来就一直把模型目录放在独立盘里。这套方案整体上不挑机器、不强制 GPU、对 Windows 用户也算友好。只要按顺序走遇到问题用上面的排查表对照处理基本都能在两小时内跑通。至于 DeepSeek 更大尺寸的模型、更多 UI 玩法等你熟悉之后再慢慢折腾也不迟。
