第28篇:提供商路由——智能分发模型请求
Hermes 功能详解第28篇:Provider Routing。按规则自动选择模型提供商。
第28篇:提供商路由——智慧分发模型请求
上一篇我們聊了模型閘道,今天來聊聊 Hermes 是怎麼給不同任務「分配」模型的。說白了,就是主模型和輔助模型這兩套槽位的智慧路由。
主模型 vs 輔助模型
主模型就是 Agent 的「大腦」——你發的每條訊息、每次工具呼叫、每個串流回應,都走它。而輔助模型是乾雜活的:上下文壓縮、影像分析、網頁摘要、審批打分、MCP 工具路由、會話標題生成、技能搜尋……一共 11 個槽位,每個都能單獨覆蓋。
預設情況下,所有輔助任務都是 auto——也就是直接重用主模型。但如果你想省錢或提速,可以給某個任務單獨指定一個更小更快的模型。
在儀表板裡設定
開啟 Dashboard,點側邊欄的 Models,你會看到兩個區塊:
- Model Settings —— 頂部面板,給各個槽位分配模型
- Usage analytics —— 使用統計卡片,顯示每個模型跑了多少 token、花了多少錢
主模型那一行點 Change 就能開啟選擇器。左邊是已認證的提供商(沒配 API key 的不會出現),右邊是精選模型清單——注意,這不是原始 /models 介面的全量清單,而是 Hermes 針對該提供商推薦的 Agent 模型。比如 OpenRouter 上有 400+ 模型,但很多是 TTS、圖片生成、重排序之類的,這裡只給你看能當 Agent 用的。
選好模型點 Switch,Hermes 就會寫入 ~/.hermes/config.yaml。注意:這只對新會話生效。已經開啟的聊天視窗不會變,想熱切換就用 /model 斜線指令。
中途切換的坑
在會話中途切模型,Hermes 會估算你的下一條訊息是否需要對新模型的上下文視窗做預壓縮。如果會話已經接近或超過閾值,切換時會給你一個警告,但切換仍然立即生效——壓縮會在切換後的第一條使用者訊息時執行。
還有一個更重要的坑:中途切換會重置提示快取。因為快取是按模型區分的,一旦換了模型,下一條訊息就得按全價重新讀一遍整個對話歷史(本來快取能省 75-90% 的費用)。長會話裡,這一下重讀可能比兩個模型之間的單價差異還貴。所以——要切換就趁早,別聊到一半再換。
資料訓練分級的確認
有些模型(比如 muse-spark-1.2-contributor)因為廠商可能會拿你的資料訓練,所以價格更便宜。互動式選擇時會有確認彈窗,但非互動式啟動路徑(比如 Kanban 工作程序、cron 定時任務)沒法彈窗,所以預設直接拒絕。
如果你能接受無人值守任務的資料被訓練,可以記錄一個持久確認:
hermes config set security.allow_data_training_tiers_noninteractive true
Hermes 每次無人值守啟動時仍然會列印完整的資料政策警告和確認鍵,保證日誌裡有稽核軌跡。想撤銷就:
hermes config unset security.allow_data_training_tiers_noninteractive
快速上手:Nous Portal
如果你是全新安裝,最快的路徑是:
hermes setup --portal
一條指令登入 Nous Portal,300+ 模型一個訂閱全搞定。想看看配好了什麼,用 hermes portal info。Portal 訂閱者還能享受按 token 計費提供商 9 折優惠。
小提醒:model: 欄位的格式
新安裝的預設設定裡 model: "" 是個空字串哨兵,意思是「還沒設定」。第一次跑 hermes setup 或 hermes model 時,它會自動升級成包含 provider、default、base_url、api_mode 的對映結構。如果你在 config.yaml 裡看到空字串,跑一下 hermes model 就會自動寫好了。
總結一下:主模型管思考,輔助模型管雜活,auto 預設重用主模型,但你可以按任務單獨覆蓋。切換模型要趁早,快取重置的代價可能比你想的大。下篇見!
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/configuring-models