最近 Hermes 推出了一个很有意思的功能叫做 MoA(Mixture-of-Agents),可以让几个低智能的 AI 组成智囊团来回答问题。
原理是首先有一个主模型,然后任务会发给主模型和几个附属模型,他们会各自给出自己的答案,主模型在综合考虑后再给出自己的答案。
当你选择一个 MoA 预设时,该预设的聚合器(aggregator)就是实际运行的模型。它负责编写助手回复并发出工具调用。参考模型(reference models)会先运行,为聚合器提供分析依据。
之前我们就知道 AI 都会有自己的幻觉以及擅长领域,让他们各自给出答案后综合一下能够极大地减少这个问题,正所谓三个臭皮匠顶个诸葛亮。
Hermes 表示根据他们的测试效果提升明显

使用这个功能需要你先在 config.yaml 文件中配置,下面是官方的参考:
moa:
default_preset: default
presets:
default:
reference_models:
- provider: openai-codex
model: gpt-5.5
- provider: openrouter
model: deepseek/deepseek-v4-pro
aggregator:
provider: openrouter
model: anthropic/claude-opus-4.8
reference_temperature: 0.6
aggregator_temperature: 0.4
max_tokens: 4096
enabled: true
请注意这个主模型并不会因为你在 Hermes 中修改模型而修改,而是固定的主模型 + 参考模型。
我自己的选择是用 GLM-5.2 作为主模型,用之前介绍的免费 DeepSeek-V4 Flash 和 Agnes 作为参考模型。这一步你完全可以和我一样让 Hermes 帮你去做。
然后在对话中用 /moa 命令即可,后面跟上你的问题即可

可以看到图片中的提示,说明已经生效了

我这里用的是单次模式,因此会有这个提示。
实际上 MoA 有两种模式,分别是单次回答调用 MoA 和整个对话都使用 MoA
一次性试用(用完自动恢复原模型):
/moa 帮我设计一份针对这套 flaky 测试集群的迁移方案
之后所有对话切到 MoA(包括新开的):
/model default --provider moa
需要注意的是,这个方式会极大地增加你的模型消耗,每次回复从调用一个模型变成了调用 3 个模型,消耗直接翻了三倍。时间消耗也会增加。
不过如果你和我一样有用不完的免费模型可以使用,那反正不用白不用,通通加上呗。
以上就是今天的分享