🤖HermesBlog
Hermes 實戰教學 · 第13篇2026/8/9· Easy Understand Hermes Agent

實戰:用 Ollama 零成本跑 Hermes

Hermes 實戰教學第13篇:Ollama。本地大模型零 API 費用。

這篇教學帶你用 Ollama 在自家電腦上免費跑起 Hermes——不花一分錢 API 費用,資料也不出家門。


guide-local-ollama

為什麼要本地跑?

雲端大模型按 token 收費,一次重度編碼會話可能燒掉 5~20 美元。更別說隱私敏感的工作,每次對話都要發送給第三方。

本地跑的好處:免費、私密、無訂閱。配置好後,Hermes 用起來和接 OpenRouter 或 Anthropic 完全一樣——終端機指令、檔案編輯、網頁瀏覽、任務委派,全都照常運作,只是模型跑在你自己機器上。

硬體門檻

部件 最低要求 推薦配置
記憶體 8 GB(跑 3B 小模型) 32+ GB(跑 27B+ 大模型)
硬碟 5 GB 空閒 30+ GB(多模型)
CPU 4 核 8+ 核
GPU 不需要 NVIDIA 8+ GB 顯示記憶體,速度起飛

純 CPU 也能跑,就是慢:9B 模型在 8 核 CPU 上約 10 token/秒;31B 模型約 25 token/秒,每條回覆要等 30120 秒。建議調大逾時時間(在 ~/.hermes/.env 裡設 HERMES_API_TIMEOUT=1800)。


第 1 步:裝 Ollama

curl -fsSL https://ollama.com/install.sh | sh

驗證是否跑起來:

ollama --version
curl http://localhost:11434/api/tags   # 應回傳 {"models":[]}

第 2 步:拉取模型

關鍵提醒:Hermes 是智慧體,要靠工具呼叫來幹活。 沒有工具呼叫能力的模型只能聊天,不能改檔案、跑指令。目前本地模型裡,gemma4:31b 是唯一支援可靠工具呼叫的,想完整體驗 Hermes 就選它。

ollama pull gemma4:31b

想多拉幾個模型也行,在 Hermes 裡用 /model 隨時切換。

第 3 步:配置 Hermes

執行 hermes setup,提供商選 Custom Endpoint,填:

  • Base URLhttp://localhost:11434/v1
  • API Key:留空或填 no-key
  • Modelgemma4:31b

或者直接編輯 ~/.hermes/config.yaml

model:
  default: "gemma4:31b"
  provider: "custom"
  base_url: "http://localhost:11434/v1"

第 4 步:開跑!

hermes

試試這些指令:

You: 列出目前目錄所有 Python 檔案,並統計每個檔案的行數
You: 讀一下 README.md,總結這個專案是幹嘛的
You: 寫一個抓取胡志明市天氣資料的 Python 腳本

Hermes 會用終端機工具、檔案操作和你的本地模型完成任務——全程零雲端呼叫。

第 5 步:按任務選模型

任務 推薦模型 原因
改檔案、寫程式碼、跑指令 gemma4:31b 唯一可靠支援工具呼叫的
快速問答(不需要工具) gemma2:9b 回應快
輕量閒聊 llama3.2:3b 最快但能力有限

會話中隨時切換:/model gemma2:9b

第 6 步:提速優化

加大上下文視窗(Hermes 做智慧體任務至少需要 64,000 token,預設只有 2048):

cat > /tmp/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF

ollama create gemma4-64k -f /tmp/Modelfile

然後把 Hermes 配置裡的模型名稱改成 gemma4-64k

保持模型常駐記憶體(預設閒置 5 分鐘就卸載):

curl http://localhost:11434/api/generate \
  -d '{"model": "gemma4:31b", "keep_alive": "24h"}'

第 7 步:接入 Telegram / Discord(可選)

配置好平台 token 後,執行 hermes gateway,你的本地智慧體就變成聊天機器人了——依然跑在自己硬體上

第 8 步:設定雲端兜底(可選)

本地模型遇到複雜任務可能吃力,可以配置一個兜底,只在本地失敗時才呼叫付費 API:

fallback_providers:
  - provider: openrouter
    model: anthropic/claude-sonnet-4

這樣 90% 的用量免費(本地),只有硬骨頭才碰付費介面。


常見問題

  • 啟動時 “Connection refused”:Ollama 沒跑起來,執行 sudo systemctl start ollamaollama serve
  • 回應慢:檢查模型是否超過記憶體(會換頁到磁碟);用 ollama ps 看 GPU 卸載情況;大對話用 /compress 壓縮
  • 首次回應特別慢:Hermes 每次呼叫都會發送系統提示詞和工具定義,本地模型處理這段 prefill 需要時間,屬正常現象,不是卡死了

小結

用 Ollama 跑 Hermes,等於把智慧體完全搬到自家電腦上——免費、私密、可控。雖然大模型回應速度不如雲端,但日常編碼、檔案操作、網頁瀏覽完全夠用。先從小模型開始,再逐步升級到 gemma4:31b,找到效能和速度的平衡點。

下篇預告:本地模型跑通了,下一期我們聊聊怎麼讓 Hermes 在 Mac 上跑得更順——包括 Apple Silicon 的 GPU 加速和記憶體優化技巧。


📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/local-ollama-setup