實戰:用 Ollama 零成本跑 Hermes
Hermes 實戰教學第13篇:Ollama。本地大模型零 API 費用。
這篇教學帶你用 Ollama 在自家電腦上免費跑起 Hermes——不花一分錢 API 費用,資料也不出家門。
為什麼要本地跑?
雲端大模型按 token 收費,一次重度編碼會話可能燒掉 5~20 美元。更別說隱私敏感的工作,每次對話都要發送給第三方。
本地跑的好處:免費、私密、無訂閱。配置好後,Hermes 用起來和接 OpenRouter 或 Anthropic 完全一樣——終端機指令、檔案編輯、網頁瀏覽、任務委派,全都照常運作,只是模型跑在你自己機器上。
硬體門檻
| 部件 | 最低要求 | 推薦配置 |
|---|---|---|
| 記憶體 | 8 GB(跑 3B 小模型) | 32+ GB(跑 27B+ 大模型) |
| 硬碟 | 5 GB 空閒 | 30+ GB(多模型) |
| CPU | 4 核 | 8+ 核 |
| GPU | 不需要 | NVIDIA 8+ GB 顯示記憶體,速度起飛 |
純 CPU 也能跑,就是慢:9B 模型在 8 核 CPU 上約 10 token/秒;31B 模型約 2
5 token/秒,每條回覆要等 30120 秒。建議調大逾時時間(在~/.hermes/.env裡設HERMES_API_TIMEOUT=1800)。
第 1 步:裝 Ollama
curl -fsSL https://ollama.com/install.sh | sh
驗證是否跑起來:
ollama --version
curl http://localhost:11434/api/tags # 應回傳 {"models":[]}
第 2 步:拉取模型
關鍵提醒:Hermes 是智慧體,要靠工具呼叫來幹活。 沒有工具呼叫能力的模型只能聊天,不能改檔案、跑指令。目前本地模型裡,gemma4:31b 是唯一支援可靠工具呼叫的,想完整體驗 Hermes 就選它。
ollama pull gemma4:31b
想多拉幾個模型也行,在 Hermes 裡用
/model隨時切換。
第 3 步:配置 Hermes
執行 hermes setup,提供商選 Custom Endpoint,填:
- Base URL:
http://localhost:11434/v1 - API Key:留空或填
no-key - Model:
gemma4:31b
或者直接編輯 ~/.hermes/config.yaml:
model:
default: "gemma4:31b"
provider: "custom"
base_url: "http://localhost:11434/v1"
第 4 步:開跑!
hermes
試試這些指令:
You: 列出目前目錄所有 Python 檔案,並統計每個檔案的行數
You: 讀一下 README.md,總結這個專案是幹嘛的
You: 寫一個抓取胡志明市天氣資料的 Python 腳本
Hermes 會用終端機工具、檔案操作和你的本地模型完成任務——全程零雲端呼叫。
第 5 步:按任務選模型
| 任務 | 推薦模型 | 原因 |
|---|---|---|
| 改檔案、寫程式碼、跑指令 | gemma4:31b |
唯一可靠支援工具呼叫的 |
| 快速問答(不需要工具) | gemma2:9b |
回應快 |
| 輕量閒聊 | llama3.2:3b |
最快但能力有限 |
會話中隨時切換:/model gemma2:9b
第 6 步:提速優化
加大上下文視窗(Hermes 做智慧體任務至少需要 64,000 token,預設只有 2048):
cat > /tmp/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f /tmp/Modelfile
然後把 Hermes 配置裡的模型名稱改成 gemma4-64k。
保持模型常駐記憶體(預設閒置 5 分鐘就卸載):
curl http://localhost:11434/api/generate \
-d '{"model": "gemma4:31b", "keep_alive": "24h"}'
第 7 步:接入 Telegram / Discord(可選)
配置好平台 token 後,執行 hermes gateway,你的本地智慧體就變成聊天機器人了——依然跑在自己硬體上。
第 8 步:設定雲端兜底(可選)
本地模型遇到複雜任務可能吃力,可以配置一個兜底,只在本地失敗時才呼叫付費 API:
fallback_providers:
- provider: openrouter
model: anthropic/claude-sonnet-4
這樣 90% 的用量免費(本地),只有硬骨頭才碰付費介面。
常見問題
- 啟動時 “Connection refused”:Ollama 沒跑起來,執行
sudo systemctl start ollama或ollama serve - 回應慢:檢查模型是否超過記憶體(會換頁到磁碟);用
ollama ps看 GPU 卸載情況;大對話用/compress壓縮 - 首次回應特別慢:Hermes 每次呼叫都會發送系統提示詞和工具定義,本地模型處理這段 prefill 需要時間,屬正常現象,不是卡死了
小結
用 Ollama 跑 Hermes,等於把智慧體完全搬到自家電腦上——免費、私密、可控。雖然大模型回應速度不如雲端,但日常編碼、檔案操作、網頁瀏覽完全夠用。先從小模型開始,再逐步升級到 gemma4:31b,找到效能和速度的平衡點。
下篇預告:本地模型跑通了,下一期我們聊聊怎麼讓 Hermes 在 Mac 上跑得更順——包括 Apple Silicon 的 GPU 加速和記憶體優化技巧。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › guides/local-ollama-setup