🤖HermesBlog
Hermes 实战教程 · 第13篇2026/8/9· Easy Understand Hermes Agent

实战:用 Ollama 零成本跑 Hermes

Hermes 实战教程第13篇:Ollama。本地大模型零 API 费用。

这篇教程带你用 Ollama 在自家电脑上免费跑起 Hermes——不花一分钱 API 费用,数据也不出家门。


为什么要本地跑?

云端大模型按 token 收费,一次重度编码会话可能烧掉 5~20 美元。更别说隐私敏感的工作,每次对话都要发给第三方。

本地跑的好处:免费、私密、无订阅。配置好后,Hermes 用起来和接 OpenRouter 或 Anthropic 完全一样——终端命令、文件编辑、网页浏览、任务委派,全都照常工作,只是模型跑在你自己机器上。

硬件门槛

部件 最低要求 推荐配置
内存 8 GB(跑 3B 小模型) 32+ GB(跑 27B+ 大模型)
硬盘 5 GB 空闲 30+ GB(多模型)
CPU 4 核 8+ 核
GPU 不需要 NVIDIA 8+ GB 显存,速度起飞

纯 CPU 也能跑,就是慢:9B 模型在 8 核 CPU 上约 10 token/秒;31B 模型约 25 token/秒,每条回复要等 30120 秒。建议调大超时时间(在 ~/.hermes/.env 里设 HERMES_API_TIMEOUT=1800)。


第 1 步:装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

验证是否跑起来:

ollama --version
curl http://localhost:11434/api/tags   # 应返回 {"models":[]}

第 2 步:拉取模型

关键提醒:Hermes 是智能体,要靠工具调用干活。 没有工具调用能力的模型只能聊天,不能改文件、跑命令。目前本地模型里,gemma4:31b 是唯一支持可靠工具调用的,想完整体验 Hermes 就选它。

ollama pull gemma4:31b

想多拉几个模型也行,在 Hermes 里用 /model 随时切换。

第 3 步:配置 Hermes

运行 hermes setup,提供商选 Custom Endpoint,填:

  • Base URLhttp://localhost:11434/v1
  • API Key:留空或填 no-key
  • Modelgemma4:31b

或者直接编辑 ~/.hermes/config.yaml

model:
  default: "gemma4:31b"
  provider: "custom"
  base_url: "http://localhost:11434/v1"

第 4 步:开跑!

hermes

试试这些指令:

You: 列出当前目录所有 Python 文件,并统计每个文件的行数
You: 读一下 README.md,总结这个项目是干嘛的
You: 写一个抓取胡志明市天气的 Python 脚本

Hermes 会用终端工具、文件操作和你的本地模型完成任务——全程零云端调用。

第 5 步:按任务选模型

任务 推荐模型 原因
改文件、写代码、跑命令 gemma4:31b 唯一可靠支持工具调用的
快速问答(不需要工具) gemma2:9b 响应快
轻量闲聊 llama3.2:3b 最快但能力有限

会话中随时切换:/model gemma2:9b

第 6 步:提速优化

加大上下文窗口(Hermes 做智能体任务至少需要 64,000 token,默认只有 2048):

cat > /tmp/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF

ollama create gemma4-64k -f /tmp/Modelfile

然后把 Hermes 配置里的模型名改成 gemma4-64k

保持模型常驻内存(默认闲置 5 分钟就卸载):

curl http://localhost:11434/api/generate \
  -d '{"model": "gemma4:31b", "keep_alive": "24h"}'

第 7 步:接入 Telegram / Discord(可选)

配置好平台 token 后,运行 hermes gateway,你的本地智能体就变成聊天机器人了——依然跑在自己硬件上

第 8 步:设置云端兜底(可选)

本地模型遇到复杂任务可能吃力,可以配置一个兜底,只在本地失败时才调用付费 API:

fallback_providers:
  - provider: openrouter
    model: anthropic/claude-sonnet-4

这样 90% 的用量免费(本地),只有硬骨头才碰付费接口。


常见问题

  • 启动时 “Connection refused”:Ollama 没跑起来,执行 sudo systemctl start ollamaollama serve
  • 响应慢:检查模型是否超过内存(会换页到磁盘);用 ollama ps 看 GPU 卸载情况;大对话用 /compress 压缩
  • 首次响应特别慢:Hermes 每次调用都会发送系统提示词和工具定义,本地模型处理这段 prefill 需要时间,属正常现象,不是卡死了

小结

用 Ollama 跑 Hermes,等于把智能体完全搬到自家电脑上——免费、私密、可控。虽然大模型响应速度不如云端,但日常编码、文件操作、网页浏览完全够用。先从小模型开始,再逐步升级到 gemma4:31b,找到性能和速度的平衡点。

下篇预告:本地模型跑通了,下一期我们聊聊怎么让 Hermes 在 Mac 上跑得更顺——包括 Apple Silicon 的 GPU 加速和内存优化技巧。

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/local-llms