实战:用 Ollama 零成本跑 Hermes
Hermes 实战教程第13篇:Ollama。本地大模型零 API 费用。
这篇教程带你用 Ollama 在自家电脑上免费跑起 Hermes——不花一分钱 API 费用,数据也不出家门。
为什么要本地跑?
云端大模型按 token 收费,一次重度编码会话可能烧掉 5~20 美元。更别说隐私敏感的工作,每次对话都要发给第三方。
本地跑的好处:免费、私密、无订阅。配置好后,Hermes 用起来和接 OpenRouter 或 Anthropic 完全一样——终端命令、文件编辑、网页浏览、任务委派,全都照常工作,只是模型跑在你自己机器上。
硬件门槛
| 部件 | 最低要求 | 推荐配置 |
|---|---|---|
| 内存 | 8 GB(跑 3B 小模型) | 32+ GB(跑 27B+ 大模型) |
| 硬盘 | 5 GB 空闲 | 30+ GB(多模型) |
| CPU | 4 核 | 8+ 核 |
| GPU | 不需要 | NVIDIA 8+ GB 显存,速度起飞 |
纯 CPU 也能跑,就是慢:9B 模型在 8 核 CPU 上约 10 token/秒;31B 模型约 2
5 token/秒,每条回复要等 30120 秒。建议调大超时时间(在~/.hermes/.env里设HERMES_API_TIMEOUT=1800)。
第 1 步:装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
验证是否跑起来:
ollama --version
curl http://localhost:11434/api/tags # 应返回 {"models":[]}
第 2 步:拉取模型
关键提醒:Hermes 是智能体,要靠工具调用干活。 没有工具调用能力的模型只能聊天,不能改文件、跑命令。目前本地模型里,gemma4:31b 是唯一支持可靠工具调用的,想完整体验 Hermes 就选它。
ollama pull gemma4:31b
想多拉几个模型也行,在 Hermes 里用
/model随时切换。
第 3 步:配置 Hermes
运行 hermes setup,提供商选 Custom Endpoint,填:
- Base URL:
http://localhost:11434/v1 - API Key:留空或填
no-key - Model:
gemma4:31b
或者直接编辑 ~/.hermes/config.yaml:
model:
default: "gemma4:31b"
provider: "custom"
base_url: "http://localhost:11434/v1"
第 4 步:开跑!
hermes
试试这些指令:
You: 列出当前目录所有 Python 文件,并统计每个文件的行数
You: 读一下 README.md,总结这个项目是干嘛的
You: 写一个抓取胡志明市天气的 Python 脚本
Hermes 会用终端工具、文件操作和你的本地模型完成任务——全程零云端调用。
第 5 步:按任务选模型
| 任务 | 推荐模型 | 原因 |
|---|---|---|
| 改文件、写代码、跑命令 | gemma4:31b |
唯一可靠支持工具调用的 |
| 快速问答(不需要工具) | gemma2:9b |
响应快 |
| 轻量闲聊 | llama3.2:3b |
最快但能力有限 |
会话中随时切换:/model gemma2:9b
第 6 步:提速优化
加大上下文窗口(Hermes 做智能体任务至少需要 64,000 token,默认只有 2048):
cat > /tmp/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f /tmp/Modelfile
然后把 Hermes 配置里的模型名改成 gemma4-64k。
保持模型常驻内存(默认闲置 5 分钟就卸载):
curl http://localhost:11434/api/generate \
-d '{"model": "gemma4:31b", "keep_alive": "24h"}'
第 7 步:接入 Telegram / Discord(可选)
配置好平台 token 后,运行 hermes gateway,你的本地智能体就变成聊天机器人了——依然跑在自己硬件上。
第 8 步:设置云端兜底(可选)
本地模型遇到复杂任务可能吃力,可以配置一个兜底,只在本地失败时才调用付费 API:
fallback_providers:
- provider: openrouter
model: anthropic/claude-sonnet-4
这样 90% 的用量免费(本地),只有硬骨头才碰付费接口。
常见问题
- 启动时 “Connection refused”:Ollama 没跑起来,执行
sudo systemctl start ollama或ollama serve - 响应慢:检查模型是否超过内存(会换页到磁盘);用
ollama ps看 GPU 卸载情况;大对话用/compress压缩 - 首次响应特别慢:Hermes 每次调用都会发送系统提示词和工具定义,本地模型处理这段 prefill 需要时间,属正常现象,不是卡死了
小结
用 Ollama 跑 Hermes,等于把智能体完全搬到自家电脑上——免费、私密、可控。虽然大模型响应速度不如云端,但日常编码、文件操作、网页浏览完全够用。先从小模型开始,再逐步升级到 gemma4:31b,找到性能和速度的平衡点。
下篇预告:本地模型跑通了,下一期我们聊聊怎么让 Hermes 在 Mac 上跑得更顺——包括 Apple Silicon 的 GPU 加速和内存优化技巧。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/local-llms