✅ 本文已于 2026-09-05 更新:新增《Ollama 本地部署进阶 2026》姊妹篇互链,显存与模型选择建议按 2026 年 9 月最新版校准,并补充本地部署最新 FAQ。
✅ 本文已于 2026-08-22 更新:补充 Ollama 最新版本(v0.32.x)与显卡配置建议(NVIDIA RTX 50 系 / AMD ROCm v7)、DeepSeek-R1 8B 默认版信息,并新增 DeepSeek 生态相关阅读,信息更完整。
DeepSeek作为目前最强的开源大模型之一,很多人都想把它部署到自己的电脑上。本地部署最大的好处:完全免费、无需联网、数据不出门、可自定义调优。
这篇文章手把手教你从零开始完成DeepSeek本地部署,无论你是程序员还是普通用户都能看懂。
一、为什么要本地部署DeepSeek?
在线使用DeepSeek虽然方便,但有几个痛点:
- 网络不稳定:高峰期经常卡顿、断连
- 隐私问题:你的对话数据在云端,敏感信息有泄露风险
- 有使用限制:免费版有对话次数和长度限制
- 功能受限:不能微调、不能自定义参数
本地部署一次性解决以上所有问题。
二、硬件要求
不同规模的DeepSeek模型对硬件要求不同:
| 模型版本 | 最低内存 | 推荐内存 | 显存建议 | 适用场景 |
|---|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | 4GB | 8GB | 无独显 / 4GB 显存 | 日常对话、文字处理 |
| DeepSeek-R1-Distill-Qwen-7B | 8GB | 16GB | 8GB 显存(RTX 3060/4060) | 代码编写、逻辑推理 |
| DeepSeek-R1-Distill-Qwen-8B(默认) | 8GB | 16GB | 8GB 显存 | 日常首选,中文友好 |
| DeepSeek-R1-Distill-Qwen-14B | 16GB | 32GB | 12GB 显存(RTX 4070) | 复杂推理、长文本处理 |
| DeepSeek-R1-Distill-Qwen-32B | 24GB | 48GB | 24GB 显存(RTX 4090/5090) | 专业编程、科研分析 |
注意:以上是基于4-bit量化后的配置。如果电脑配置一般,推荐从1.5B或7B版本开始。
Ollama 最新版本与显卡建议(2026-08)
Ollama 在 2026 年 7 月已更新到 v0.32.x,GitHub Star 超 17.6 万,支持 NVIDIA RTX 50 系最新架构与 AMD ROCm v7。下载与模型命令不变,认准官网 ollama.com/download。
- 8GB 显存(RTX 3060 / 4060):跑 DeepSeek-R1-Distill-Qwen-7B 或 8B(Q4 量化),速度 15-25 token/s,是目前的“入门甜点”。
- 12GB 显存(RTX 4070):跑 14B 量化版,复杂推理更稳。
- 24GB 显存(RTX 4090 / 5090):跑 32B 量化版,接近商用 API 质量。
- 48GB+ 显存或多卡:可尝试 70B 量化版(约 43GB),接近满血体验。
- Mac 用户:M1-M4 统一内存性价比高,16GB 统一内存可流畅跑 8B-14B,M3/M4 Max 甚至可以量化跑 30B+。
量化推荐 Q4_K_M:体积比全精度小一半以上,效果损失 <3%,Ollama 默认下载的就是这个版本,新手最友好。没有独显也可以用 CPU 跑 1.5B-7B 小模型,速度慢一些但完全能对话。
二·五、2026 年 9 月更新:Ollama 姊妹篇与显存建议校准
如果你看完本文想进一步折腾,9 月初我新发了姊妹篇 Ollama 本地部署进阶 2026:Windows/Mac 安装教程 + 模型选择与显存指南,Windows/Mac 安装更细、常用命令更全、显存对照更完整,两篇搭配读,从入门到进阶一次打通。
显存与模型选择(2026-09 校准):8GB 显存 → 7B/8B(Q4 量化);12GB → 14B;24GB(RTX 4090/5090)→ 32B;48GB+ → 70B 量化版;Mac 16GB 统一内存 → 8B-14B,M3/M4 Max 可尝试 30B+。量化默认 Q4_K_M 即可,与上表结论一致。拿不准配置的,先看姊妹篇里的完整对照表再动手。
三、使用Ollama部署(最简单,推荐新手)
Ollama是目前最流行的本地大模型运行工具,支持macOS、Windows、Linux。
步骤1:安装Ollama
访问 ollama.com/download 下载对应系统的安装包,直接安装即可。
步骤2:下载并运行DeepSeek模型
打开终端(Terminal / CMD),输入以下命令:
# 下载并运行1.5B版本(最轻量,4GB内存即可) ollama run deepseek-r1:1.5b # 或者运行7B版本(推荐,效果好) ollama run deepseek-r1:8b # 或者运行7B版本(推荐,效果好) ollama run deepseek-r1:7b # 或者运行14B版本(需要16GB以上内存) ollama run deepseek-r1:14b
第一次运行会自动下载模型(根据版本不同约1-8GB),之后就可以直接对话了。
步骤3:使用Web界面(可选)
如果觉得终端不好用,可以安装Open WebUI:
# 使用Docker一键安装 docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
然后在浏览器打开 http://localhost:3000 就能看到漂亮的ChatGPT式界面。
四、其他部署方式
方式2:LM Studio(图形化,适合Windows用户)
下载 LM Studio → 搜索”DeepSeek” → 选择模型版本 → 下载 → 加载对话。全程图形界面,无需命令行。
方式3:llama.cpp(性能最优)
适合有编程基础的用户,支持GPU加速,推理速度最快:
# 克隆编译 git clone https://github.com/ggerganov/llama.cpp cd llama.cpp make -j # 下载量化模型 wget https://huggingface.co/unsloth/DeepSeek-R1-Distill-Qwen-7B-GGUF/resolve/main/DeepSeek-R1-Distill-Qwen-7B-Q4_K_M.gguf # 运行 ./main -m DeepSeek-R1-Distill-Qwen-7B-Q4_K_M.gguf -p "你好" -n 512
五、本地部署 vs 在线使用的对比
| 对比项 | 本地部署 | 在线使用 |
|---|---|---|
| 费用 | 完全免费 | 免费版有限制 |
| 隐私 | 数据不出门 | 数据上传云端 |
| 速度 | 取决于显卡 | 取决于网络 |
| 稳定性 | 随时可用 | 高峰期可能拥堵 |
| 可定制 | 可微调、量化 | 固定参数 |
| 推荐场景 | 程序员/隐私敏感用户 | 普通用户/懒得折腾 |
六、常见问题
Q:我电脑只有8GB内存能跑吗?
A:可以,推荐1.5B版本(低配)或7B量化版。用Ollama直接 `ollama run deepseek-r1:1.5b` 就行。
Q:是不是部署了就完全免费了?
A:是的,只要你不出门联网,所有推理都免费。电费忽略不计。
Q:能不能同时部署多个模型?
A:可以,Ollama支持同时管理多个模型,随时切换。
Q:生成速度慢怎么办?
A:有NVIDIA显卡的话装CUDA版本Ollama,推理速度提升5-10倍。
文章编号:2026-0627-EX-001 | 资源持续更新中
延伸阅读:AI 工具大全 2026:从本地部署到在线免费,30 款亲测实用推荐
DeepSeek 本地部署最新常见问题(2026-08 更新)
2026 年 8 月本地部署 DeepSeek 用什么版本?
Ollama 目前默认拉取 deepseek-r1:8b(Qwen3-8B 蒸馏版),中文友好、8GB 显存可流畅运行;低配选 1.5b,追求质量选 14b / 32b。
Ollama 最新版本是多少?
2026 年 7 月已更新至 v0.32.x,支持 NVIDIA RTX 50 系与 AMD ROCm v7;命令和模型库不变,去官网下载即可,下载中断支持断点续传。
本地部署需要什么显卡?
8GB 显存(RTX 3060/4060)即可入门跑 7B-8B;12GB 跑 14B;24GB(RTX 4090/5090)跑 32B;48GB+ 跑 70B。没有独显用 CPU 跑 1.5B 也完全能对话,详见上文显卡建议。
DeepSeek-V4 能本地部署吗?
DeepSeek-V4 以 MIT 协议开源并开放权重,社区已逐步适配 Ollama / llama.cpp;日常使用本地跑 R1 蒸馏版性价比最高,V4 完整版对硬件要求高,建议走 API 或 网页版。
本地部署和在线 API 怎么选?
隐私敏感、高频使用选本地部署;省事、要最新模型能力选在线。申请 DeepSeek API Key 即可低成本接入,网页版免费直接聊。
部署好之后能做什么?
本地对话、离线文档总结、代码辅助、接入 Open WebUI 做个人 ChatGPT 界面,还可以配合 学习资源 里的教程搭建工作流。
延伸阅读
DeepSeek 本地部署最新常见问题(2026-09 更新)
Ollama 姊妹篇 3284 主要讲什么?
《Ollama 本地部署进阶 2026》聚焦 Windows/Mac 安装全流程、按显存选模型的完整对照表(8G→7B、12G→14B、24G→32B、48G+→70B、Mac 统一内存),以及日常管理命令速查,适合想用 Ollama 把 DeepSeek 等开源模型跑顺的进阶用户。
8GB 显存现在推荐跑哪个模型?
仍推荐 DeepSeek-R1-Distill-Qwen 7B/8B(Q4_K_M 量化),15-25 token/s 属入门甜点;纯 CPU 老机器建议 1.5B。更细的对照见姊妹篇显存表。
DeepSeek-V4 能本地部署吗?
DeepSeek-V4 已开源开放权重,社区在逐步适配 Ollama/llama.cpp;但完整版硬件门槛较高,普通电脑建议本地跑 R1 蒸馏版(8B/14B)更实际,追求 V4 能力优先走官方 App/API。
Mac 电脑怎么选模型?
M 系列统一内存性价比高:16GB 跑 8B-14B,24GB 可尝试 30B 以内量化,M3/M4 Max(36GB+)可以跑 32B 量化版。详细建议看 Ollama 本地部署进阶 2026。
本地部署、DeepSeek App、ChatGPT 免费版怎么组合?
本地部署覆盖离线与隐私场景;日常在线用免费的 DeepSeek 官方 App(教程见 DeepSeek 官方 App 下载安装 2026);国际内容补一个 ChatGPT 免费版(教程见 ChatGPT 免费使用教程 2026)。三件套基本 0 成本覆盖绝大多数 AI 需求。
部署后 Open WebUI 连接不上怎么办?
先确认 Ollama 服务在跑(ollama serve),再检查 Open WebUI 里的 Ollama 地址:Windows/Mac 用 http://host.docker.internal:11434,Linux 用 http://127.0.0.1:11434,然后用浏览器访问容器映射的端口验证。
延伸阅读
📦 附:夸克网盘资源库 · 持续更新
我做资源库的标准很苛刻:分类清晰、链接有效、持续更新——这份夸克网盘资源导航表三点都占:直到这篇发布前都还在更新,失效链接会被及时清理,新资源持续入库,找资源不用再到处碰运气。
- 📚 资源库入口:夸克网盘资源导航表(在线表格,收藏即用)
- 💾 建议先收藏本文或保存表格,需要时随时回来取用;表格会持续更新,值得定期逛一逛。
- 📢 觉得有用,欢迎转载分享给需要的朋友(转载注明出处即可)。






