直接给结论:Ollama 是目前本地部署大模型最省心的工具,官方免费、支持 Windows / macOS / Linux,官网 ollama.com/download 下载对应安装包双击安装即可;装完在终端敲一行 ollama run deepseek-r1:8b 就能跑起一个本地大模型,全程不用联网、数据不出本机。选模型看显存/内存:8GB 显存跑 7B(Q4 量化)是入门甜点,24GB 显存上 32B 量化版接近商用 API 质量,Mac 用统一内存 16GB 也能流畅跑 8B-14B。这篇把 Windows/Mac 安装步骤、模型选择矩阵、常用命令一次讲透,承接我之前写的《DeepSeek 本地部署全攻略》,帮你把本地部署这件事彻底跑通。
快速结论(3 条先记住)
- 安装极简:Windows 下 exe 双击安装、Mac 下 dmg 拖入 Applications,装完命令行输入
ollama --version有版本号即成功,前后不到 5 分钟。 - 模型按显存选:8GB 显存 → 7B/8B 量化版(15-25 token/s,入门甜点);24GB 显存 → 32B 量化版(接近商用 API 质量);48GB+ → 70B 量化版;Mac 按统一内存 16GB/32GB 分别对应 8B-14B / 30B+。
- 和 DeepSeek 本地部署是黄金搭档:Ollama 是「模型管理壳」,DeepSeek 是「模型」,两者搭配就是我在 DeepSeek 本地部署全攻略 里讲的那套方案——Ollama 负责装模型、跑服务,DeepSeek-R1 系列负责输出中文高质量回答。
一、Ollama 是什么?为什么本地部署先选它
Ollama 可以简单理解成「大模型界的应用商店」:它把不同厂商的开源模型(DeepSeek、Qwen、Llama、Gemma 等)统一成一个命令行入口,你要用哪个模型,一条 ollama run 模型名 就自动下载并跑起来,不用手动配 Python 环境、不用管 CUDA 细节、不用折腾权重文件。
到 2026 年中,Ollama 已更新到 v0.32.x,GitHub Star 超 17.6 万,原生支持 NVIDIA RTX 50 系最新架构和 AMD ROCm v7,Windows / macOS / Linux 三端覆盖。相比 LM Studio、llama.cpp、vLLM 这些同类工具,Ollama 的优势是:安装零门槛、模型库最全、生态最活跃(Web UI、Docker、Python/Node SDK 都有现成方案)。
如果你还不太清楚「本地部署」到底解决了什么问题,可以看我之前写的 DeepSeek 本地部署全攻略(2026 最新)——那边讲的是「为什么要本地部署 + 用 Ollama 跑 DeepSeek 的完整流程」,这篇作为它的「进阶篇」,把安装细节和模型选择展开讲。
二、Windows 安装 Ollama 完整教程(5 分钟跑通)
Windows 用户是最大群体,Ollama 在 Windows 上的体验也最成熟。下面是完整步骤:
- 下载安装包:浏览器打开官网 ollama.com/download,点 Windows 对应的
Download按钮,得到一个OllamaSetup.exe(约几百 MB,含运行引擎)。 - 双击安装:一路 Next 即可,默认安装到当前用户目录,无需管理员权限,也不需要额外装 Python 或显卡驱动(Ollama 自带依赖)。装完会在系统托盘出现一个小图标,表示后台服务已启动。
- 验证安装:按
Win + R输入cmd回车,在命令行输入ollama --version。能打印出版本号(如v0.32.4)就说明安装成功。 - 跑第一个模型:接着输入
ollama run deepseek-r1:8b。第一次运行会自动下载模型(约 4.9GB,取决于网络),下载完成后直接进入对话界面,输入问题回车就能得到回答。
几个 Windows 用户常见坑提前排掉:
- 安装后命令找不到:多数情况是没重开终端,新开一个 CMD/PowerShell 即可;仍不行就检查系统环境变量 PATH 是否包含
%LOCALAPPDATA%ProgramsOllama。 - 模型下载慢:Ollama 默认从官方源拉取模型,国内网络下可能偏慢,可以设置
OLLAMA_MODELS指定模型存放盘符(默认在 C 盘,C 盘空间紧张一定要改),下载中断后重新 run 会断点续传。 - 想要 Web 界面:装完 Ollama 后再装 Open WebUI 或第三方 UI(详见下文第五节的进阶玩法),浏览器访问
http://localhost:3000就是类 ChatGPT 界面。
三、Mac 安装 Ollama 完整教程(Apple 芯片更省心)
Mac 用户装 Ollama 比 Windows 还简单,而且 Apple 芯片(M1/M2/M3/M4)的统一内存架构在跑大模型时性价比很高——不需要独立显卡,内存即显存。
- 下载 dmg:同样去 ollama.com/download,点 macOS 版本下载
Ollama-darwin.zip。 - 安装:解压后把
Ollama.app拖进「应用程序」文件夹,首次打开如果系统提示「来自身份不明的开发者」,去「系统设置 → 隐私与安全性」点「仍要打开」即可。 - 验证:打开「终端」,输入
ollama --version;或者直接打开 Ollama.app 后在菜单栏找到图标确认服务在跑。 - 跑模型:终端输入
ollama run qwen3:8b(Qwen 系列对中文友好,适合 Mac 尝鲜)或ollama run deepseek-r1:8b,首次自动下载后即可对话。
Mac 用户选模型建议(统一内存 = 显存):
- 16GB 统一内存(M1/M2/M3 基础款):跑 8B 量化版最稳,14B 量化也能跑但偏慢,适合日常问答、写作辅助。
- 24GB 统一内存:8B-14B 都很流畅,可以上 14B 做复杂推理。
- 32GB 以上 / M3/M4 Max:可以量化跑 30B+ 大模型,接近商用 API 的生成质量。
想要中文能力强的本地模型,除了 DeepSeek 系列,Qwen(通义千问)开源版也值得试,具体型号对比可以配合我整理的 AI 工具大全 2026:30 款亲测实用推荐 一起看。
四、模型选择指南:显存/内存对应表(8G→7B、24G→32B)
这是本地部署最核心的问题——我的电脑能跑什么模型?答案是看显存(NVIDIA/AMD 独显)或统一内存(Mac)。下面这张表是我实测 + 社区共识整理出的「甜点配置」,直接对照着选就不会错:
| 显存 / 统一内存 | 推荐模型档位 | 典型体验 | 代表硬件 |
|---|---|---|---|
| 8GB | 7B-8B(Q4 量化) | 15-25 token/s,日常问答够用,入门甜点 | RTX 3060 / 4060、Mac 16G 统一内存 |
| 12GB | 14B(量化) | 复杂推理更稳,代码/长文表现明显更好 | RTX 4070、Mac 24G 统一内存 |
| 24GB | 32B(量化) | 接近商用 API 质量,写代码/分析能力强一档 | RTX 4090 / 5090、Mac 32G 统一内存 |
| 48GB+ / 多卡 | 70B(量化,约 43GB) | 接近满血体验,适合重度生产力 | RTX 6000 / 双卡、Mac M3/M4 Max |
| 无独显(纯 CPU) | 1.5B-7B | 慢一些但完全能对话,适合纯尝鲜 | 普通办公本/老电脑 |
三条选型心法:
- 量化选 Q4_K_M 就对了:Ollama 默认下载的就是这个量化档,体积比全精度小一半以上,效果损失 <3%,新手不用纠结其他量化位深。
- 先小后大:不确定跑不跑得动时,先跑 7B/8B 确认速度,再逐步升级到 14B、32B,避免一次下几十 GB 跑不动白折腾。
- 显存不足就降档:24GB 跑 32B 如果卡顿,退回 14B;Ollama 的
ollama ps命令可以实时查看当前模型占用多少显存。
这里要再次点名承接关系:我在 DeepSeek 本地部署全攻略 里用的就是这套选型逻辑——8GB 显存跑 deepseek-r1:8b、24GB 显存跑 32B 量化版,两边对照着看,本地部署的硬件路线图就完整了。
五、Ollama 常用命令速查(收藏这 6 条就够)
Ollama 的命令行非常简洁,日常使用记住下面 6 条足够:
ollama run <模型名>—— 下载并运行模型,不存在就自动拉取,是最高频命令。ollama pull <模型名>—— 只下载模型不运行,适合提前把模型备好。ollama list—— 查看本地已下载的所有模型及大小。ollama ps—— 查看当前正在运行的模型和显存占用。ollama rm <模型名>—— 删除模型释放磁盘空间。ollama serve—— 启动/确认后台 API 服务(默认 127.0.0.1:11434),供 Open WebUI、Python SDK 等调用。
进阶玩法三件套:
- Open WebUI(最推荐):Docker 一条命令部署,浏览器获得类 ChatGPT 界面,支持多模型切换、对话历史管理。
- Python 调用:Ollama 自带 OpenAI 兼容 API,
pip install ollama后几行代码就能在自己的程序里调用本地模型。 - 接入 API Key 生态:如果你同时用云端模型,本地 + 云端结合是更省钱的做法——申请云端 API Key 的完整教程可以看我的 DeepSeek API Key 获取教程 2026,本地跑日常、云端跑重活,两条腿走路。
六、常见问题 FAQ
Ollama 安装后怎么确认成功?
装完打开终端(Windows 用 CMD/PowerShell,Mac 用「终端」),输入 ollama --version,能打印出类似 v0.32.x 的版本号就说明安装成功。再输入 ollama run deepseek-r1:8b 跑通一次对话,就是完整可用了。
8GB 显存能跑什么模型?
8GB 显存(如 RTX 3060 / 4060)的「甜点」是 7B-8B 的 Q4 量化模型,比如 deepseek-r1:8b、qwen3:8b,实测速度 15-25 token/s,日常问答、写作、翻译完全够用。想跑更大的模型,只能靠更低的量化或 CPU 分担,体验会明显下降。
24GB 显存推荐哪个模型?
24GB 显存(RTX 4090 / 5090)直接上 32B 量化版,这是「接近商用 API 质量」的甜点档,写代码、长文分析、复杂推理都比 7B/14B 强一档。命令示例:ollama run deepseek-r1:32b。如果跑起来卡顿,退回 14B 量化即可。
Mac 电脑能跑 Ollama 吗?M 芯片选哪个模型?
完全能,而且 Apple 芯片的统一内存架构跑大模型性价比很高。16GB 统一内存推荐 8B 量化(如 deepseek-r1:8b),24GB 可以上 14B,32GB 以上(M3/M4 Max)可以量化跑 30B+。注意 Mac 的「统一内存」就是显存,别选超过内存一半的模型,否则会吃交换内存变慢。
Ollama 和 DeepSeek 本地部署是什么关系?
Ollama 是「模型管理工具」,DeepSeek-R1 是「模型」,两者配合就是本地部署的标准方案:用 Ollama 下载、运行、管理 DeepSeek 开源模型,一行命令搞定。我的 DeepSeek 本地部署全攻略 讲的是这套组合的完整上手流程,这篇是它的进阶补充(安装细节 + 模型选择)。
没有独立显卡能玩 Ollama 吗?
可以。纯 CPU 也能跑 1.5B-7B 的小模型(如 deepseek-r1:1.5b),速度慢一些但完全能对话,适合先体验「本地 AI」是什么感觉。想要流畅体验就上独显(8GB 起步)或 Mac 统一内存(16GB 起步)。
延伸阅读
- DeepSeek 本地部署全攻略:Ollama 最新版 + 显卡配置指南 2026 — 本地部署双子星之「上手篇」,先看这篇打基础
- DeepSeek API Key 获取教程 2026 — 本地跑日常、云端跑重活,云端 API 申请与峰谷定价全解析
- DeepSeek 官方 App 下载安装 2026 — 不想折腾本地,官方 App 免费中文 AI 的另一半
- DeepSeek vs ChatGPT 实测对比 2026 — 本地模型和云端双子星怎么分工
- AI 工具大全 2026:30 款亲测实用推荐 — 从本地部署到在线免费,一篇看完
最后更新:2026 年 9 月 2 日。Ollama 版本号、模型体积与下载地址以 ollama.com 官方页面实时为准,本站将持续跟踪更新。





