🤖HermesBlog
Hermes Feature Guides · Parte 288/9/2026

Roteamento de Provedores — Despacho Inteligente de Modelos

Provider Routing — Smart Model Dispatching — easy-to-understand guide based on official docs

hermes-feature-28-provider-routing

Roteamento de Provedores — Despacho Inteligente de Modelos

Se você já sentiu que seu agente de IA está usando uma marreta para quebrar uma noz, você não está sozinho. A maioria dos agentes executa tudo através de um único modelo grande e poderoso — até mesmo as pequenas tarefas paralelas que não precisam de tanta capacidade cerebral. O Hermes muda isso com um sistema inteligente de duas camadas: um modelo principal para o raciocínio e modelos auxiliares para as tarefas menores.

Pense nisso como uma cozinha de restaurante. Você tem o chef principal (o modelo principal) que cuida de cada pedido, e depois tem estações especializadas — um confeiteiro, um churrasqueiro, um auxiliar de cozinha — cada um cuidando da sua própria tarefa. É exatamente assim que o Hermes funciona.

Dois Tipos de Slots de Modelo

O Hermes usa dois tipos de slots de modelo:

  • Modelo principal — o cérebro. Cada mensagem do usuário, cada loop de chamada de ferramenta, cada resposta em streaming passa por esse modelo.
  • Modelos auxiliares — os ajudantes. Eles cuidam da compressão de contexto, visão (análise de imagens), sumarização de páginas web, pontuação de aprovação, roteamento de ferramentas MCP, geração de títulos de sessão e busca de habilidades. Cada um tem seu próprio slot e pode ser substituído de forma independente.

A melhor parte? Você pode configurar tudo isso direto do painel de controle.

A Página de Modelos

Abra o painel e clique em Models na barra lateral. Você verá duas seções:

  1. Model Settings — o painel superior onde você atribui modelos aos slots.
  2. Usage analytics — cartões classificados mostrando cada modelo que executou uma sessão, com contagens de tokens, custo e selos de capacidade.

O cartão superior é o painel Model Settings. A linha principal sempre mostra o que o agente vai iniciar para novas sessões. Clique em Change para abrir o seletor.

Definindo o Modelo Principal

O seletor tem duas colunas:

  • Esquerda — provedores autenticados. Apenas provedores que você configurou (chave de API definida, OAuth ou endpoint personalizado) aparecem aqui. Se um provedor estiver faltando, vá até Keys e adicione sua credencial.
  • Direita — a lista curada de modelos para o provedor selecionado. Estes são os modelos agênticos que o Hermes recomenda, não a lista bruta de /models (que no OpenRouter inclui mais de 400 modelos, incluindo TTS, geradores de imagem e rerankers).

Digite no campo de filtro para refinar por nome do provedor, slug ou ID do modelo.

Escolha um modelo, clique em Switch, e o Hermes o grava em ~/.hermes/config.yaml na seção model. Isso se aplica apenas a novas sessões — qualquer aba de chat que você já tenha aberta continua rodando com o modelo com o qual foi iniciada. Para trocar dinamicamente o chat atual, use o comando /model dentro dele.

Trocas no Meio da Sessão e Avisos de Contexto

Quando você troca de modelo dentro de uma sessão ativa, o Hermes estima se sua próxima mensagem vai executar a compressão de contexto preflight em relação à janela do novo modelo. Se a sessão já estiver perto ou acima do limite de compressão desse modelo, a resposta da troca inclui um aviso. A troca ainda é aplicada imediatamente; a compressão é executada na primeira mensagem do usuário após a troca.

Importante: Trocas no meio da sessão redefinem o cache de prompt. Os caches de prompt são vinculados ao modelo que atende à solicitação, então qualquer mudança de modelo no meio da conversa significa que a próxima mensagem relê a conversa inteira ao preço integral de tokens de entrada, em vez da taxa com cache (desconto de ~75–90%). Em uma sessão longa, essa releitura única pode superar a diferença por token entre os dois modelos. Troque quando precisar, mas prefira fazer isso no início de uma conversa.

Camadas de Treinamento de Dados Sem Supervisão

Alguns modelos têm desconto porque o fornecedor pode treinar com seus prompts e respostas. A seleção interativa de modelos sempre mostra um prompt de confirmação. Mas caminhos de inicialização não interativos, como workers do Kanban e agentes cron, falham de forma segura porque não podem fazer essa pergunta.

Se o treinamento com os dados da carga de trabalho sem supervisão for aceitável, registre uma confirmação persistente:

hermes config set security.allow_data_training_tiers_noninteractive true

O Hermes ainda imprime o aviso completo da política de dados e a chave de confirmação em cada inicialização sem supervisão, para que os logs dos workers mantenham uma trilha de auditoria. Revogue com hermes config unset security.allow_data_training_tiers_noninteractive.

Definindo Modelos Auxiliares

Clique em Show auxiliary para revelar os 11 slots de tarefas. Cada tarefa auxiliar tem como padrão auto — ou seja, o Hermes tenta usar seu modelo principal também para essa função. Se essa rota estiver indisponível ou falhar por capacidade, auto segue qualquer cadeia de fallback específica da tarefa, depois a cadeia de fallback principal e, por fim, a cadeia de descoberta auxiliar integrada do Hermes.

Substitua uma tarefa específica quando quiser um modelo mais barato ou mais rápido para uma tarefa paralela. Por exemplo, você pode querer um modelo pequeno para gerar títulos de sessão, mas manter seu modelo grande para tarefas de visão.

Caminho Mais Rápido: Nous Portal

Nous Portal oferece mais de 300 modelos com uma única assinatura. Em uma instalação nova, execute hermes setup --portal para fazer login e definir a Nous como seu provedor em um único comando. Inspecione o que está configurado com hermes portal info. Assinantes do Portal também ganham 10% de desconto em provedores cobrados por token.

Uma Nota sobre o Esquema model:

Em uma instalação totalmente nova, a configuração padrão incluída tem model: "" (uma string vazia como sentinela que significa “ainda não configurado”). Na primeira vez que você executar hermes setup ou hermes model, essa chave é atualizada in-place para um mapeamento com as subchaves provider, default, base_url e api_mode. Se você vir uma string vazia em config.yaml, execute hermes model (ou clique em Change no painel) e o Hermes gravará o formato de dicionário para você.


O despacho inteligente de modelos significa que você não está pagando preço de modelo topo de linha por tarefas mecânicas. Seu modelo principal cuida do raciocínio pesado, enquanto modelos menores e mais baratos cuidam das tarefas rotineiras. É eficiente, econômico e dá a você controle granular sobre cada parte do fluxo de trabalho do seu agente.

📖 Documentação oficial

この記事は Hermes Agent のDocumentação oficialに基づいています:Documentação oficial › user-guide/configuring-models