第28篇:提供商配置——接入各种大模型
Hermes Agent 官方教程第28篇:接入各种大模型
第28篇:提供商配置——接入各种大模型
如果把 Hermes 比作一家餐厅,那“提供商配置”就是决定你厨房里用哪个品牌的灶台和锅具。主厨(主模型)负责炒菜,帮厨(辅助模型)负责洗菜、切菜、摆盘——你完全可以给不同岗位配不同的工具。
两个模型槽位
Hermes 把模型分成两类:
- 主模型:负责“思考”。每一条用户消息、每一次工具调用、每一段流式回复都走它。
- 辅助模型:负责“杂活”。比如上下文压缩、图片识别、网页摘要、审批打分、MCP 工具路由、会话标题生成、技能搜索。每个辅助任务都有独立槽位,可以单独覆盖。
第一步:打开 Models 页面
在仪表盘侧边栏点击 Models,你会看到两个区域:
- Model Settings(顶部面板)——给各个槽位分配模型。
- Usage analytics(下方卡片)——按时间段统计每个模型跑过的会话、token 数、费用和能力标签。
第二步:设置主模型
点击主模型行的 Change 按钮,弹出选择器:
- 左栏:已认证的提供商(已设置 API 密钥、OAuth 或自定义端点的才会显示)。缺了就去 Keys 页面补上凭证。
- 右栏:该提供商下 Hermes 推荐的模型列表——不是原始
/models接口的全部(OpenRouter 上那个有 400 多个,含 TTS、生图、重排器),而是精选过的“智能体友好”模型。
在过滤框输入名称或 ID 缩小范围,选中后点 Switch,Hermes 就会写入 ~/.hermes/config.yaml 的 model 段。这只影响新会话——已打开的聊天标签页继续用原来的模型。想热切换当前对话,用 /model 斜杠命令。
第三步:会话中途切换的注意事项
在活跃会话中切换模型时(Hermes TUI、CLI、Telegram/Discord 的 /model),Hermes 会估算你的下一条消息是否触发预检上下文压缩。如果会话长度已接近新模型的压缩阈值,切换回复里会带警告。压缩会在切换后的第一条用户消息前执行。
⚠️ 中途切换会重置提示缓存。提示缓存按模型服务方区分,所以任何中途换模型(手动切换、自动回退、凭证池轮换)都意味着下一条消息要按全价输入 token 重读整个对话——长会话里这次重读的费用可能远超两个模型之间的单价差。能早切就早切,别拖到会话末尾。
快速路径:Nous Portal
如果你想要最省事的方案,Nous Portal 一个订阅就能用 300+ 模型。全新安装时运行:
hermes setup --portal
一条命令完成登录和设置提供商。查看接线情况:
hermes portal info
Portal 订阅者还能在按 token 计费的提供商上享受 9 折。
小提醒:model: 的两种形态
全新安装的默认配置里 model: "" 是空字符串(表示“未配置”)。第一次运行 hermes setup 或 hermes model 时,它会原地升级成包含 provider、default、base_url、api_mode 的映射结构。如果你在 config.yaml 里看到空字符串,跑一下 hermes model(或点击仪表盘里的 Change),Hermes 会自动帮你写成字典形式。
总结:主模型管思考,辅助模型管杂活,各自独立配置。仪表盘点选、CLI 命令、配置文件三种方式任选。中途切换模型记得考虑缓存重置的成本。
下一篇预告:第29篇将深入辅助模型的各个槽位——上下文压缩、视觉分析、网页摘要分别怎么调优,敬请期待。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/configuring-models