-
Notifications
You must be signed in to change notification settings - Fork 17
Local Models
LYOfficial edited this page May 19, 2026
·
1 revision
如果你关注数据隐私,或者想节省 API 费用,可以在本地部署 AI 模型,让 OneDocs 完全在本地运行。
| 优势 | 说明 |
|---|---|
| 🔒 隐私安全 | 数据完全不出本机,无需发送到任何服务器 |
| 💰 零成本 | 无需付费 API,本地推理免费 |
| ⚡ 低延迟 | 无网络延迟,响应速度取决于本机性能 |
| 🔄 离线使用 | 无需网络连接即可使用 |
| 劣势 | 说明 |
|---|---|
| 📉 质量较低 | 本地模型通常比云端模型小,分析质量可能不如 GPT-4o 等 |
| 💻 硬件要求 | 需要较好的 GPU 和足够的内存 |
| 🐌 速度较慢 | 取决于本机硬件,可能比云端 API 慢 |
Ollama 是最流行的本地模型运行框架,支持多种开源模型。
- 前往 ollama.com 下载安装包
- 安装完成后,在终端中验证:
ollama --version# 推荐模型(按大小排序)
ollama pull qwen2.5 # 7B 参数,约 4.7GB,推荐
ollama pull llama3.2 # 3B 参数,约 2GB
ollama pull gemma2 # 9B 参数,约 5.4GB
ollama pull mistral # 7B 参数,约 4.1GB💡 首次下载模型需要较长时间,取决于网络速度。模型下载后会缓存在本地,后续使用无需重新下载。
ollama serveOllama 默认监听 http://localhost:11434。
- 进入「设置」→「模型」
- 选择供应商为 Ollama
- Base URL 默认为
http://localhost:11434/v1(通常无需修改) - API Key 留空即可
- 选择已下载的模型
- 点击「保存」
LM Studio 提供图形界面的本地模型管理,适合不熟悉命令行的用户。
- 前往 lmstudio.ai 下载安装包
- 安装并启动 LM Studio
- 在 LM Studio 中搜索模型(如
qwen2.5、llama3.2) - 点击下载
- 下载完成后,在聊天界面加载模型
- 在 LM Studio 左侧点击「Local Server」图标
- 点击「Start Server」
- 默认监听
http://localhost:1234
- 进入「设置」→「模型」
- 选择供应商为 LM Studio
- Base URL 默认为
http://localhost:1234/v1(通常无需修改) - API Key 留空即可
- 选择
local-model - 点击「保存」
| 模型大小 | 最低内存 | 推荐内存 | GPU |
|---|---|---|---|
| 3B 参数 | 8 GB | 16 GB | 可选 |
| 7B 参数 | 16 GB | 32 GB | 推荐 8GB+ VRAM |
| 13B+ 参数 | 32 GB | 64 GB | 推荐 16GB+ VRAM |
💡 没有 GPU 也可以运行,但速度会明显较慢。建议至少有 8GB VRAM 的 GPU 来运行 7B 模型。
| 模型 | 参数量 | 特点 | 推荐度 |
|---|---|---|---|
| Qwen2.5 | 7B | 中文能力强,综合表现好 | ⭐⭐⭐⭐⭐ |
| Llama 3.2 | 3B | 轻量快速,适合低配机器 | ⭐⭐⭐⭐ |
| Gemma 2 | 9B | Google 出品,质量不错 | ⭐⭐⭐⭐ |
| Mistral | 7B | 速度快,英文能力强 | ⭐⭐⭐ |
本地模型通常比云端模型小,分析质量确实可能不如 GPT-4o 等。建议:
- 使用更大的模型(如 Qwen2.5-7B 而非 3B)
- 确保模型已完全加载
- 尝试不同的模型,选择效果最好的
- 检查是否使用了 GPU 加速
- 尝试使用更小的模型
- 关闭其他占用 GPU 的程序
- 确认 Ollama 服务已启动(
ollama serve) - 检查 Base URL 是否正确
- 确认模型已下载并加载