第38篇:多模型混合——MoA 智能融合
Hermes 功能详解第38篇:Mixture of Agents。多个模型答案融合更准。
这篇讲的是 Hermes Agent 的 MoA(Mixture of Agents) 功能——让多个 AI 模型像“智囊团”一样先出主意,再由一个“主笔”模型汇总写答案,帮你搞定复杂任务。
什么是 MoA?先打个比方
想象你写一份重要方案:先请三位顾问各自提建议(参考模型),你再综合他们的意见亲自执笔(聚合器)。MoA 就是这个流程的自动化版——顾问们先发言,主笔最后定稿。你平时怎么用 Hermes,现在还是怎么用,只是把模型换成 MoA 预设即可。
第1步:选择一个 MoA 预设
MoA 预设就像“套餐”,每个套餐指定了用哪些顾问、谁来主笔。在任意模型选择界面(CLI、桌面应用、网页面板)都能找到它:
/model default --provider moa # 切换到默认 MoA 预设
/model review --provider moa # 切换到名为 review 的预设
桌面应用的下拉菜单里会多出一栏 MoA presets,选中即生效。
第2步:用 /moa 快速体验一次
不想切换模型?用 /moa 命令临时用默认预设跑一次,用完自动恢复你原来的模型:
/moa 帮我设计这个不稳定测试集群的迁移方案
注意:/moa 后面跟的整句话都是提示词,不是预设名。单独输入 /moa 会显示用法说明。
第3步:配置自己的预设
在 Dashboard 或桌面应用设置里找到 Mixture of Agents,也可以直接编辑 config.yaml:
moa:
default_preset: default
presets:
default:
reference_models:
- provider: openai-codex
model: gpt-5.5
- provider: openrouter
model: deepseek/deepseek-v4-pro
aggregator:
provider: openrouter
model: anthropic/claude-opus-4.8
max_tokens: 4096
enabled: true
顾问模型(reference_models)负责出主意,聚合器(aggregator)负责写最终答案和调用工具。想混用不同厂商的模型?完全没问题。
第4步:调快速度——限制顾问字数
每个回合都要等所有顾问写完才轮到主笔,顾问写太多是变慢的主因。给顾问设个字数上限,建议会变简洁,速度明显提升:
reference_max_tokens: 600 # 顾问最多写600字,主笔输出不受限
第5步:控制顾问出场频率
默认每个用户回合顾问只出场一次(fanout: user_turn),最省钱。如果你希望顾问随时跟进最新工具结果:
fanout: per_iteration—— 每次工具调用后顾问都重新出主意,最新鲜但最贵fanout: every_n:3—— 折中方案:首轮必跑,之后每3轮刷新一次
第6步:保护隐私
顾问的输出可能泄露对话里的邮箱、电话、密钥。开启隐私过滤:
moa:
privacy_filter: display # 只隐藏界面显示的内容;full 则连喂给主笔的文本也隐藏
小总结
MoA 让你花一份力气,集多家智慧——顾问负责多角度分析,主笔负责整合执行,而且完全融入 Hermes 原有的工具调用、会话记忆等功能。先从默认预设开始,再按需调整顾问数量和字数上限,找到速度与质量的最佳平衡点。
下篇预告:第39篇将带你探索 Hermes 的“记忆持久化”机制——如何让智能体跨会话记住你的偏好与项目背景,敬请期待!
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/configuring-models