✅ 本文已于 2026-09-05 更新:新增《Ollama 本地部署进阶 2026》姊妹篇互链,显存与模型选择建议按 2026 年 9 月最新版校准,并补充本地部署最新 FAQ。

✅ 本文已于 2026-08-22 更新:补充 Ollama 最新版本(v0.32.x)与显卡配置建议(NVIDIA RTX 50 系 / AMD ROCm v7)、DeepSeek-R1 8B 默认版信息,并新增 DeepSeek 生态相关阅读,信息更完整。

DeepSeek作为目前最强的开源大模型之一,很多人都想把它部署到自己的电脑上。本地部署最大的好处:完全免费、无需联网、数据不出门、可自定义调优。

这篇文章手把手教你从零开始完成DeepSeek本地部署,无论你是程序员还是普通用户都能看懂。

一、为什么要本地部署DeepSeek?

在线使用DeepSeek虽然方便,但有几个痛点:

  • 网络不稳定:高峰期经常卡顿、断连
  • 隐私问题:你的对话数据在云端,敏感信息有泄露风险
  • 有使用限制:免费版有对话次数和长度限制
  • 功能受限:不能微调、不能自定义参数

本地部署一次性解决以上所有问题。

二、硬件要求

不同规模的DeepSeek模型对硬件要求不同:

模型版本 最低内存 推荐内存 显存建议 适用场景
DeepSeek-R1-Distill-Qwen-1.5B 4GB 8GB 无独显 / 4GB 显存 日常对话、文字处理
DeepSeek-R1-Distill-Qwen-7B 8GB 16GB 8GB 显存(RTX 3060/4060) 代码编写、逻辑推理
DeepSeek-R1-Distill-Qwen-8B(默认) 8GB 16GB 8GB 显存 日常首选,中文友好
DeepSeek-R1-Distill-Qwen-14B 16GB 32GB 12GB 显存(RTX 4070) 复杂推理、长文本处理
DeepSeek-R1-Distill-Qwen-32B 24GB 48GB 24GB 显存(RTX 4090/5090) 专业编程、科研分析

注意:以上是基于4-bit量化后的配置。如果电脑配置一般,推荐从1.5B或7B版本开始。

Ollama 最新版本与显卡建议(2026-08)

Ollama 在 2026 年 7 月已更新到 v0.32.x,GitHub Star 超 17.6 万,支持 NVIDIA RTX 50 系最新架构与 AMD ROCm v7。下载与模型命令不变,认准官网 ollama.com/download。

  • 8GB 显存(RTX 3060 / 4060):跑 DeepSeek-R1-Distill-Qwen-7B 或 8B(Q4 量化),速度 15-25 token/s,是目前的“入门甜点”。
  • 12GB 显存(RTX 4070):跑 14B 量化版,复杂推理更稳。
  • 24GB 显存(RTX 4090 / 5090):跑 32B 量化版,接近商用 API 质量。
  • 48GB+ 显存或多卡:可尝试 70B 量化版(约 43GB),接近满血体验。
  • Mac 用户:M1-M4 统一内存性价比高,16GB 统一内存可流畅跑 8B-14B,M3/M4 Max 甚至可以量化跑 30B+。

量化推荐 Q4_K_M:体积比全精度小一半以上,效果损失 <3%,Ollama 默认下载的就是这个版本,新手最友好。没有独显也可以用 CPU 跑 1.5B-7B 小模型,速度慢一些但完全能对话。

二·五、2026 年 9 月更新:Ollama 姊妹篇与显存建议校准

如果你看完本文想进一步折腾,9 月初我新发了姊妹篇 Ollama 本地部署进阶 2026:Windows/Mac 安装教程 + 模型选择与显存指南,Windows/Mac 安装更细、常用命令更全、显存对照更完整,两篇搭配读,从入门到进阶一次打通。

显存与模型选择(2026-09 校准):8GB 显存 → 7B/8B(Q4 量化);12GB → 14B;24GB(RTX 4090/5090)→ 32B;48GB+ → 70B 量化版;Mac 16GB 统一内存 → 8B-14B,M3/M4 Max 可尝试 30B+。量化默认 Q4_K_M 即可,与上表结论一致。拿不准配置的,先看姊妹篇里的完整对照表再动手。

三、使用Ollama部署(最简单,推荐新手)

Ollama是目前最流行的本地大模型运行工具,支持macOS、Windows、Linux。

步骤1:安装Ollama

访问 ollama.com/download 下载对应系统的安装包,直接安装即可。

步骤2:下载并运行DeepSeek模型

打开终端(Terminal / CMD),输入以下命令:

# 下载并运行1.5B版本(最轻量,4GB内存即可)
ollama run deepseek-r1:1.5b

# 或者运行7B版本(推荐,效果好)
ollama run deepseek-r1:8b

# 或者运行7B版本(推荐,效果好)
ollama run deepseek-r1:7b

# 或者运行14B版本(需要16GB以上内存)
ollama run deepseek-r1:14b

第一次运行会自动下载模型(根据版本不同约1-8GB),之后就可以直接对话了。

步骤3:使用Web界面(可选)

如果觉得终端不好用,可以安装Open WebUI:

# 使用Docker一键安装
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway 
  -v open-webui:/app/backend/data 
  --name open-webui --restart always 
  ghcr.io/open-webui/open-webui:main

然后在浏览器打开 http://localhost:3000 就能看到漂亮的ChatGPT式界面。

四、其他部署方式

方式2:LM Studio(图形化,适合Windows用户)

下载 LM Studio → 搜索”DeepSeek” → 选择模型版本 → 下载 → 加载对话。全程图形界面,无需命令行。

方式3:llama.cpp(性能最优)

适合有编程基础的用户,支持GPU加速,推理速度最快:

# 克隆编译
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j

# 下载量化模型
wget https://huggingface.co/unsloth/DeepSeek-R1-Distill-Qwen-7B-GGUF/resolve/main/DeepSeek-R1-Distill-Qwen-7B-Q4_K_M.gguf

# 运行
./main -m DeepSeek-R1-Distill-Qwen-7B-Q4_K_M.gguf -p "你好" -n 512

五、本地部署 vs 在线使用的对比

对比项 本地部署 在线使用
费用 完全免费 免费版有限制
隐私 数据不出门 数据上传云端
速度 取决于显卡 取决于网络
稳定性 随时可用 高峰期可能拥堵
可定制 可微调、量化 固定参数
推荐场景 程序员/隐私敏感用户 普通用户/懒得折腾

六、常见问题

Q:我电脑只有8GB内存能跑吗?
A:可以,推荐1.5B版本(低配)或7B量化版。用Ollama直接 `ollama run deepseek-r1:1.5b` 就行。

Q:是不是部署了就完全免费了?
A:是的,只要你不出门联网,所有推理都免费。电费忽略不计。

Q:能不能同时部署多个模型?
A:可以,Ollama支持同时管理多个模型,随时切换。

Q:生成速度慢怎么办?
A:有NVIDIA显卡的话装CUDA版本Ollama,推理速度提升5-10倍。


📥 资源下载

夸克网盘整理了全套DeepSeek学习资料(清华大学7弹合集+本地部署工具包+Dify工作流教程):

👉 点此下载DeepSeek全套资源(夸克网盘,免费)

📊 夸克资源实时汇总

我维护了一份飞书在线表格,每周更新夸克网盘的优质资源链接(教程、模板、电子书、工具软件等),不用到处搜,一张表搞定。

👉 点击打开夸克资源汇总表(飞书在线表格,每周更新)

文章编号:2026-0627-EX-001 | 资源持续更新中

延伸阅读:AI 工具大全 2026:从本地部署到在线免费,30 款亲测实用推荐

DeepSeek 本地部署最新常见问题(2026-08 更新)

2026 年 8 月本地部署 DeepSeek 用什么版本?

Ollama 目前默认拉取 deepseek-r1:8b(Qwen3-8B 蒸馏版),中文友好、8GB 显存可流畅运行;低配选 1.5b,追求质量选 14b / 32b。

Ollama 最新版本是多少?

2026 年 7 月已更新至 v0.32.x,支持 NVIDIA RTX 50 系与 AMD ROCm v7;命令和模型库不变,去官网下载即可,下载中断支持断点续传。

本地部署需要什么显卡?

8GB 显存(RTX 3060/4060)即可入门跑 7B-8B;12GB 跑 14B;24GB(RTX 4090/5090)跑 32B;48GB+ 跑 70B。没有独显用 CPU 跑 1.5B 也完全能对话,详见上文显卡建议。

DeepSeek-V4 能本地部署吗?

DeepSeek-V4 以 MIT 协议开源并开放权重,社区已逐步适配 Ollama / llama.cpp;日常使用本地跑 R1 蒸馏版性价比最高,V4 完整版对硬件要求高,建议走 API 或 网页版。

本地部署和在线 API 怎么选?

隐私敏感、高频使用选本地部署;省事、要最新模型能力选在线。申请 DeepSeek API Key 即可低成本接入,网页版免费直接聊。

部署好之后能做什么?

本地对话、离线文档总结、代码辅助、接入 Open WebUI 做个人 ChatGPT 界面,还可以配合 学习资源 里的教程搭建工作流。

延伸阅读

DeepSeek 本地部署最新常见问题(2026-09 更新)

Ollama 姊妹篇 3284 主要讲什么?

《Ollama 本地部署进阶 2026》聚焦 Windows/Mac 安装全流程、按显存选模型的完整对照表(8G→7B、12G→14B、24G→32B、48G+→70B、Mac 统一内存),以及日常管理命令速查,适合想用 Ollama 把 DeepSeek 等开源模型跑顺的进阶用户。

8GB 显存现在推荐跑哪个模型?

仍推荐 DeepSeek-R1-Distill-Qwen 7B/8B(Q4_K_M 量化),15-25 token/s 属入门甜点;纯 CPU 老机器建议 1.5B。更细的对照见姊妹篇显存表。

DeepSeek-V4 能本地部署吗?

DeepSeek-V4 已开源开放权重,社区在逐步适配 Ollama/llama.cpp;但完整版硬件门槛较高,普通电脑建议本地跑 R1 蒸馏版(8B/14B)更实际,追求 V4 能力优先走官方 App/API。

Mac 电脑怎么选模型?

M 系列统一内存性价比高:16GB 跑 8B-14B,24GB 可尝试 30B 以内量化,M3/M4 Max(36GB+)可以跑 32B 量化版。详细建议看 Ollama 本地部署进阶 2026。

本地部署、DeepSeek App、ChatGPT 免费版怎么组合?

本地部署覆盖离线与隐私场景;日常在线用免费的 DeepSeek 官方 App(教程见 DeepSeek 官方 App 下载安装 2026);国际内容补一个 ChatGPT 免费版(教程见 ChatGPT 免费使用教程 2026)。三件套基本 0 成本覆盖绝大多数 AI 需求。

部署后 Open WebUI 连接不上怎么办?

先确认 Ollama 服务在跑(ollama serve),再检查 Open WebUI 里的 Ollama 地址:Windows/Mac 用 http://host.docker.internal:11434,Linux 用 http://127.0.0.1:11434,然后用浏览器访问容器映射的端口验证。

延伸阅读

📦 附:夸克网盘资源库 · 持续更新

我做资源库的标准很苛刻:分类清晰、链接有效、持续更新——这份夸克网盘资源导航表三点都占:直到这篇发布前都还在更新,失效链接会被及时清理,新资源持续入库,找资源不用再到处碰运气。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。