Ollama 本地部署指南

Ollama 是什么

Ollama 是一款开源的本地大语言模型(LLM)运行框架,旨在简化大型语言模型在本地环境的部署与使用。支持 Llama、Qwen、DeepSeek、GLM、Kimi 等多种主流开源 AI 模型,且能通过简单的命令行操作,将原本复杂的模型部署流程简化为单条命令。

为什么要用 Ollama 本地部署

  • 数据隐私与安全:完全本地化运行,模型推理过程无需联网,所有对话都在你的电脑本地运行,数据不会上传到任何云端服务器。
  • 离线可用:只要模型已经下载并安装在本地设备上,你就可以在没有网络连接的情况下使用语言模型。
  • 成本可控:仅需一次性硬件投入,后续使用零成本,适合高频调用场景。
  • 低延迟与高稳定性:通过本地 GPU/CPU 加速,推理延迟可控制在很低的水平,同时避免了云端服务宕机或限流问题。
  • 硬件友好:轻量化架构设计与动态量化技术,即使没有独立显卡,也能在 CPU 上完成推理。
  • 灵活定制:支持自定义模型微调、量化压缩和硬件适配。开发者可根据需求调整模型精度、优化内存占用,甚至集成自有数据集进行领域适配。

完整部署指南

硬件与系统要求

操作系统支持:

  • macOS(Intel / M1 / M2 芯片)
  • Linux(推荐 Ubuntu 20.04+)
  • Windows 10/11(支持原生或 WSL2)

硬件配置建议:

在 Q4_K_M 量化下

量化就是对模型的压缩程度,数字越小压缩越狠

在损失一些精度的情况下,压缩能极大的缩减模型的存储大小,也就减少了显存占用

Q4_K_M 是在省显存和尽量不掉质量的之间比较平衡的选择

CPU 内存 显存 适用模型
4核 8GB 8GB 7B、8B
8核 16GB 16GB 13B、14B
8核 32GB 32GB 70B

显存不够,就会将剩余部分装进内存,甚至交给CPU进行计算

安装 Ollama

方式一:Homebrew 安装(推荐)

1
brew install ollama

方式二:手动安装

1
curl -fsSL https://ollama.com/install.sh | sh

最后打开终端,输入ollama --version验证安装

1
curl -fsSL https://ollama.com/install.sh | sh

安装完成后,Ollama 会自动创建 systemd 服务并启动。可用以下命令验证服务状态:

1
systemctl status ollama
  1. 访问 Ollama 官网 下载 Windows 安装包(.msi 或 .exe)
  2. 双击运行安装程序,按向导完成安装,确保勾选“添加到 PATH”选项
  3. 安装完成后,Ollama 会自动在后台运行(可在系统托盘中查看)
  4. 打开 PowerShell 验证安装:
1
ollama --version

如果你习惯容器化部署,可以直接使用官方 Docker 镜像:

CPU 模式:

1
2
3
4
5
docker run -d \
--name ollama \
-p 11434:11434 \
-v ollama:/root/.ollama \
ollama/ollama

GPU 模式(需先安装 NVIDIA 容器工具包):

注:官方 Docker 文档要求 NVIDIA 场景安装 NVIDIA Container Toolkit,并配置 Docker runtime。

1
2
3
4
5
6
docker run -d \
--name ollama \
--gpus=all \
-p 11434:11434 \
-v ollama:/root/.ollama \
ollama/ollama

Jetson 部署

Ollama 官方 Docker 文档目前针对 NVIDIA JetPack 提供了专门支持,需要指定 JETSON_JETPACK 版本

1
2
3
4
5
6
7
docker run -d \
--name ollama \
--gpus=all \
-e JETSON_JETPACK=5 \
-p 11434:11434 \
-v ollama:/root/.ollama \
ollama/ollama

配置 Ollama

配置模型存储位置

  1. 右键点击 此电脑属性高级系统设置环境变量
  2. 系统变量 中点击 新建
  3. 变量名:OLLAMA_MODELS
  4. 变量值:你想要存储模型的路径(如D:\Ollama\Models
  5. 点击 “确定” 保存,然后重启电脑
1
2
3
4
5
6
7
8
9
10
11
12
13
# 创建存储目录
sudo mkdir -p /data/ollama/models

# 编辑服务配置
sudo systemctl edit ollama

# 添加以下内容
[Service]
Environment="OLLAMA_MODELS=/data/ollama/models"

# 重启服务
sudo systemctl daemon-reload
sudo systemctl restart ollama

配置国内镜像源

  1. 同样在系统环境变量中添加
  2. 变量名:OLLAMA_REGISTRY
  3. 变量值:https://mirror.ollama.ai
  4. 重启电脑
1
2
3
sudo mkdir -p /etc/ollama
echo 'export OLLAMA_REGISTRY=https://mirror.ollama.ai' | sudo tee /etc/ollama/env
sudo systemctl restart ollama

下载与运行模型

查看可用模型

访问 Ollama 模型库 查看所有支持的模型。

下载模型

1
2
3
4
5
6
7
8
9
10
ollama pull <模型名称>:<标签>

# 下载 Llama 3.1 8B 模型
ollama pull llama3.1:8b

# 下载通义千问 7B 模型
ollama pull qwen2.5:7b

# 下载 DeepSeek-R1 7B 模型
ollama pull deepseek-r1:7b

提示:模型文件通常较大(几 GB 到几十 GB),下载时间取决于网速。

运行模型

1
2
3
ollama run <模型名称>

ollama run llama3.1:8b

运行后进入交互模式,会出现 >>> 提示符,你可以直接输入问题与模型对话。交互模式支持:

  • 多轮对话管理
  • 系统指令注入(如 /clear 重置上下文)
  • 流式输出控制
  • 退出对话:输入/bye或按下 Ctrl+D

查看GPU是否被使用

运行:

1
ollama run llama3.1:8b

然后另一个终端:

1
nvidia-smi

查看:

1
2
GPU Memory Usage
GPU Utilization

同时:

1
ollama ps

也可以看到模型当前的运行情况。

常用命令速查

命令 用途
ollama --version 查看版本
ollama list 列出所有已下载模型
ollama pull llama3.1:8b 下载模型
ollama run llama3.1:8b 运行模型(交互模式)
ollama ps 查看正在运行的模型
ollama stop llama3.1:8b 停止运行中的模型
ollama rm llama3.1:8b 删除模型(释放磁盘空间)
ollama show llama3.1:8b 查看模型详细信息
ollama serve 启动 Ollama 服务(后台运行)
ollama create my-model -f Modelfile 创建自定义模型
ollama cp llama3.1:8b my-llama:8b 复制模型
ollama --help 查看帮助

使用 REST API 调用

Ollama 默认在 http://localhost:11434 提供 REST API 服务。

Ollama 官方 API 提供:

1
2
3
4
5
6
7
8
9
10
11
12
/api/generate
/api/chat
/api/create
/api/show
/api/copy
/api/delete
/api/pull
/api/push
/api/embed
/api/embeddings
/api/ps
/api/version

生成接口(/api/generate)

1
2
3
4
5
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "为什么天空是蓝色的?",
"stream": false
}'

聊天接口(/api/chat)

1
2
3
4
5
6
7
8
9
10
11
curl http://localhost:11434/api/chat \
-d '{
"model": "llama3.1:8b",
"messages": [
{
"role": "user",
"content": "什么是RAG?"
}
],
"stream": false
}'

Python 调用示例

使用HTTP调用

1
2
3
4
5
6
7
8
import requests

response = requests.post('http://localhost:11434/api/generate', json={
'model': 'llama3.1:8b',
'prompt': '介绍一下自己',
'stream': False
})
print(response.json()['response'])

使用SDK调用

1
pip install ollama
1
2
3
4
5
6
7
8
9
10
11
12
import ollama

response = ollama.chat(
model='llama3.1:8b',
messages=[
{
'role': 'user',
'content': '什么是RAG?'
}
]
)
print(response['message']['content'])

进阶配置

修改默认端口和模型目录

  1. 打开系统环境变量
  2. 修改变量:OLLAMA_HOST=0.0.0.0:8001
  3. 重启电脑

Linux 下可通过修改 systemd 服务文件配置环境变量:

1
2
3
4
5
# 编辑服务文件
/etc/systemd/system/ollama.service

# 添加环境变量
Environment="OLLAMA_HOST=0.0.0.0:8001"

创建自定义模型(Modelfile)

通过 Modelfile 可以创建带有自定义系统提示、回复随机性参数等配置的模型:

1
2
3
4
5
6
7
8
9
10
11
12
# 创建并写入 Modelfile
cat > Modelfile << 'EOF'
FROM llama3.1:8b
PARAMETER temperature 0.7
SYSTEM "你是一个乐于助人的AI助手"
EOF

# 构建自定义模型
ollama create my-assistant -f ./Modelfile

# 运行创建的模型
ollama run my-assistant

配置 Web UI(Open WebUI)

Open WebUI 是为 Ollama 量身定制的 Web 界面。使用 Docker 一键部署:

1
2
3
4
5
6
7
docker run -d \
-p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main

使用 Nvidia GPU 支持运行 Open WebUI:

1
2
3
4
5
6
7
8
docker run -d \
-p 3000:8080 \
--gpus all \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:cuda

部署完成后,通过浏览器访问 http://localhost:3000 即可使用图形化界面与模型对话。

配置外部访问

默认情况下,Ollama 只允许本地访问。如果你想让其他设备也能访问你的 Ollama 服务:

  1. 打开系统环境变量
  2. 添加变量:OLLAMA_HOST=0.0.0.0:11434
  3. 添加变量:OLLAMA_ORIGINS=*
  4. 重启电脑
1
2
3
4
5
6
7
8
9
10
sudo systemctl edit ollama

# 添加以下内容
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=*"

# 重启服务
sudo systemctl daemon-reload
sudo systemctl restart ollama

注意OLLAMA_ORIGINS=*允许所有来源访问,生产环境请设置为具体的域名或 IP 地址

附:官方资料入口

Ollama 官方网站
Ollama GitHub
Ollama 官方文档
Ollama API 文档
Ollama Modelfile 文档
Ollama Docker 文档
Ollama 模型库