本地跑大模型:Ollama + Open WebUI 搭建私人助手

Words: 782Read Time: 2 minLast edited: 2026-8-4
一直想在本地跑个大模型。倒不是不信任 API,主要是两个原因:一是有私人笔记不想发出去,二是纯粹手痒,想看看自己的机器到底能跑到什么程度。元旦假期折腾了两天,用 Ollama + Open WebUI 搭了一套私人助手,现在写文章润色、代码问答都在上面跑,记录一下过程。

硬件和模型的搭配

我的两台机器:
  • 云服务器:4 核 8G 内存,没有显卡,Ubuntu 22.04
  • 家里的旧主机:RTX 3060 12G 显存,装的 Debian 12
模型选了 Qwen2.5-7B 和 Llama-3.1-8B 的 Q4 量化版。粗估资源占用的经验公式:参数量 × 0.6~0.7GB(Q4 量化)。7B 模型加载后大概 4.5G,3060 的 12G 显存跑它很从容,14B 的 Qwen2.5(约 9G)也能塞下,32B 就别想了。
纯 CPU 的 8G 云服务器我也试了 7B:能跑,但生成速度只有每秒三五个 token,跟人聊天像发电报,最后换成 3B 小模型,凑合当个备用。

安装 Ollama

安装简单到有点无聊:
装完是 systemd 服务,开机自启。第一个坑:Ollama 默认只监听 127.0.0.1:11434,想让局域网其他机器(或 Docker 容器)访问,得改环境变量:
注意这样暴露出去是没有任何鉴权的,我只绑了内网网段,外部访问走反代加密码。

套一个能看的界面:Open WebUI

命令行聊天终究不爽,Open WebUI 提供了类 ChatGPT 的网页界面,Docker 一条命令起:
第二个坑就在这条命令里:Linux 下的 Docker 默认没有 host.docker.internal 这个域名,不加 --add-host 那行,容器里根本连不上宿主机的 Ollama,我在这卡了半小时。浏览器打开 http://服务器IP:3000,注册的第一个账号自动是管理员。多轮对话、挂文档做 RAG、切换模型都有,家里人也能一起用。

本地模型和 API 的取舍

跑了一个月,我的结论:
  • 隐私场景(日记、工作笔记)无脑本地,数据不出机器
  • 轻任务(润色、翻译、起名字)7B 够用,零边际成本,随便造
  • 复杂推理、长代码任务还是老老实实调 API,7B 和旗舰模型的差距肉眼可见
  • 电费没有想象中夸张,3060 推理时整机功耗 200W 上下,反正不是 7×24 在跑
本地模型的意义不是替代 API,而是把「随便试、不心疼」的场景接过来。光是不用每次都复制粘贴到网页版这一点,就值回折腾的两天了。
Loading...
© 2024 - 2026 ihuadz
中文