Ollama 本地部署指南
Ollama 本地部署指南
Ollama 是什么
Ollama 是一款开源的本地大语言模型(LLM)运行框架,旨在简化大型语言模型在本地环境的部署与使用。支持 Llama、Qwen、DeepSeek、GLM、Kimi 等多种主流开源 AI 模型,且能通过简单的命令行操作,将原本复杂的模型部署流程简化为单条命令。
为什么要用 Ollama 本地部署
- 数据隐私与安全:完全本地化运行,模型推理过程无需联网,所有对话都在你的电脑本地运行,数据不会上传到任何云端服务器。
- 离线可用:只要模型已经下载并安装在本地设备上,你就可以在没有网络连接的情况下使用语言模型。
- 成本可控:仅需一次性硬件投入,后续使用零成本,适合高频调用场景。
- 低延迟与高稳定性:通过本地 GPU/CPU 加速,推理延迟可控制在很低的水平,同时避免了云端服务宕机或限流问题。
- 硬件友好:轻量化架构设计与动态量化技术,即使没有独立显卡,也能在 CPU 上完成推理。
- 灵活定制:支持自定义模型微调、量化压缩和硬件适配。开发者可根据需求调整模型精度、优化内存占用,甚至集成自有数据集进行领域适配。
完整部署指南
硬件与系统要求
操作系统支持:
- macOS(Intel / M1 / M2 芯片)
- Linux(推荐 Ubuntu 20.04+)
- Windows 10/11(支持原生或 WSL2)
硬件配置建议:
在 Q4_K_M 量化下
量化就是对模型的压缩程度,数字越小压缩越狠
在损失一些精度的情况下,压缩能极大的缩减模型的存储大小,也就减少了显存占用
Q4_K_M 是在省显存和尽量不掉质量的之间比较平衡的选择
| CPU | 内存 | 显存 | 适用模型 |
|---|---|---|---|
| 4核 | 8GB | 8GB | 7B、8B |
| 8核 | 16GB | 16GB | 13B、14B |
| 8核 | 32GB | 32GB | 70B |
显存不够,就会将剩余部分装进内存,甚至交给CPU进行计算
安装 Ollama
方式一:Homebrew 安装(推荐)
1 | brew install ollama |
方式二:手动安装
1 | curl -fsSL https://ollama.com/install.sh | sh |
最后打开终端,输入ollama --version验证安装
1 | curl -fsSL https://ollama.com/install.sh | sh |
安装完成后,Ollama 会自动创建 systemd 服务并启动。可用以下命令验证服务状态:
1 | systemctl status ollama |
- 访问 Ollama 官网 下载 Windows 安装包(.msi 或 .exe)
- 双击运行安装程序,按向导完成安装,确保勾选“添加到 PATH”选项
- 安装完成后,Ollama 会自动在后台运行(可在系统托盘中查看)
- 打开 PowerShell 验证安装:
1 | ollama --version |
如果你习惯容器化部署,可以直接使用官方 Docker 镜像:
CPU 模式:
1 | docker run -d \ |
GPU 模式(需先安装 NVIDIA 容器工具包):
注:官方 Docker 文档要求 NVIDIA 场景安装 NVIDIA Container Toolkit,并配置 Docker runtime。
1 | docker run -d \ |
Jetson 部署
Ollama 官方 Docker 文档目前针对 NVIDIA JetPack 提供了专门支持,需要指定 JETSON_JETPACK 版本
1 | docker run -d \ |
配置 Ollama
配置模型存储位置
- 右键点击
此电脑→属性→高级系统设置→环境变量 - 在
系统变量中点击新建 - 变量名:
OLLAMA_MODELS - 变量值:你想要存储模型的路径(如
D:\Ollama\Models) - 点击 “确定” 保存,然后重启电脑
1 | # 创建存储目录 |
配置国内镜像源
- 同样在系统环境变量中添加
- 变量名:
OLLAMA_REGISTRY - 变量值:
https://mirror.ollama.ai - 重启电脑
1 | sudo mkdir -p /etc/ollama |
下载与运行模型
查看可用模型
访问 Ollama 模型库 查看所有支持的模型。
下载模型
1 | ollama pull <模型名称>:<标签> |
提示:模型文件通常较大(几 GB 到几十 GB),下载时间取决于网速。
运行模型
1 | ollama run <模型名称> |
运行后进入交互模式,会出现 >>> 提示符,你可以直接输入问题与模型对话。交互模式支持:
- 多轮对话管理
- 系统指令注入(如
/clear重置上下文) - 流式输出控制
- 退出对话:输入
/bye或按下Ctrl+D
查看GPU是否被使用
运行:
1 | ollama run llama3.1:8b |
然后另一个终端:
1 | nvidia-smi |
查看:
1 | GPU Memory Usage |
同时:
1 | ollama ps |
也可以看到模型当前的运行情况。
常用命令速查
| 命令 | 用途 |
|---|---|
ollama --version |
查看版本 |
ollama list |
列出所有已下载模型 |
ollama pull llama3.1:8b |
下载模型 |
ollama run llama3.1:8b |
运行模型(交互模式) |
ollama ps |
查看正在运行的模型 |
ollama stop llama3.1:8b |
停止运行中的模型 |
ollama rm llama3.1:8b |
删除模型(释放磁盘空间) |
ollama show llama3.1:8b |
查看模型详细信息 |
ollama serve |
启动 Ollama 服务(后台运行) |
ollama create my-model -f Modelfile |
创建自定义模型 |
ollama cp llama3.1:8b my-llama:8b |
复制模型 |
ollama --help |
查看帮助 |
使用 REST API 调用
Ollama 默认在 http://localhost:11434 提供 REST API 服务。
Ollama 官方 API 提供:
1 | /api/generate |
生成接口(/api/generate)
1 | curl http://localhost:11434/api/generate -d '{ |
聊天接口(/api/chat)
1 | curl http://localhost:11434/api/chat \ |
Python 调用示例
使用HTTP调用
1 | import requests |
使用SDK调用
1 | pip install ollama |
1 | import ollama |
进阶配置
修改默认端口和模型目录
- 打开系统环境变量
- 修改变量:
OLLAMA_HOST=0.0.0.0:8001 - 重启电脑
Linux 下可通过修改 systemd 服务文件配置环境变量:
1 | # 编辑服务文件 |
创建自定义模型(Modelfile)
通过 Modelfile 可以创建带有自定义系统提示、回复随机性参数等配置的模型:
1 | # 创建并写入 Modelfile |
配置 Web UI(Open WebUI)
Open WebUI 是为 Ollama 量身定制的 Web 界面。使用 Docker 一键部署:
1 | docker run -d \ |
使用 Nvidia GPU 支持运行 Open WebUI:
1 | docker run -d \ |
部署完成后,通过浏览器访问 http://localhost:3000 即可使用图形化界面与模型对话。
配置外部访问
默认情况下,Ollama 只允许本地访问。如果你想让其他设备也能访问你的 Ollama 服务:
- 打开系统环境变量
- 添加变量:
OLLAMA_HOST=0.0.0.0:11434 - 添加变量:
OLLAMA_ORIGINS=* - 重启电脑
1 | sudo systemctl edit ollama |
注意:
OLLAMA_ORIGINS=*允许所有来源访问,生产环境请设置为具体的域名或 IP 地址
附:官方资料入口
Ollama 官方网站
Ollama GitHub
Ollama 官方文档
Ollama API 文档
Ollama Modelfile 文档
Ollama Docker 文档
Ollama 模型库