Execute LLMs Locais no Mac
Run Local LLMs on Mac — easy-to-understand guide based on official docs
Execute LLMs Locais no Mac
Então você já está com o Hermes Agent rodando no seu Mac e está pronto para mergulhar no mundo dos LLMs locais. Ótima escolha! Mas antes de começar a conversar, você precisa entender como o Hermes lida com modelos. Pense nisso como montar uma cozinha: você tem seu chef principal e, em seguida, um monte de ajudantes especializados para tarefas específicas.
Os Dois Tipos de Slots de Modelo
O Hermes usa dois tipos de slots de modelo:
- Modelo principal — este é o seu chef de cozinha. Cada mensagem do usuário, cada loop de chamada de ferramenta, cada resposta em streaming passa por este modelo. É o cérebro da operação.
- Modelos auxiliares — estes são seus sous-chefs. Eles cuidam de tarefas menores, como compressão de contexto, visão (análise de imagens), resumo de páginas web, pontuação de aprovação, roteamento de ferramentas MCP, geração de títulos de sessão e busca de habilidades. Cada um tem seu próprio slot e pode ser substituído de forma independente.
Começando: O Caminho Mais Rápido
Se você é novo no Hermes, a maneira mais rápida de configurar modelos é através do Nous Portal. Ele dá acesso a mais de 300 modelos com uma única assinatura. Em uma instalação nova, basta executar:
hermes setup --portal
Isso faz o login e define a Nous como seu provedor em um único comando. Você pode verificar o que está configurado com hermes portal info. Além disso, assinantes do portal ganham 10% de desconto em provedores cobrados por token. Nada mal, né?
A Página de Modelos
Abra o dashboard e clique em Models na barra lateral. Você verá duas seções:
- Model Settings — o painel superior onde você atribui modelos aos slots.
- Usage analytics — cards classificados mostrando cada modelo que executou uma sessão, com contagem de tokens, custo e selos de capacidade.
O card superior é o painel Model Settings. A linha principal mostra o que o agente vai iniciar para novas sessões. Clique em Change para abrir o seletor.
Definindo o Modelo Principal
O seletor tem duas colunas:
- Esquerda — provedores autenticados. Apenas provedores que você configurou (chave de API definida, OAuth ou endpoint personalizado) aparecem aqui. Se um provedor estiver faltando, vá até Keys e adicione a credencial.
- Direita — a lista curada de modelos para o provedor selecionado. Estes são os modelos agênticos que o Hermes recomenda, não a lista bruta de
/models(que no OpenRouter inclui mais de 400 modelos, incluindo TTS, geradores de imagem e rerankers).
Digite no campo de filtro para refinar por nome do provedor, slug ou ID do modelo. Escolha um modelo, clique em Switch, e o Hermes grava em ~/.hermes/config.yaml. Isso se aplica apenas a novas sessões — qualquer aba de chat que você já tenha aberta continua rodando com o modelo com o qual começou. Para trocar a quente no chat atual, use o comando /model dentro dele.
Trocas no Meio da Sessão: Um Alerta
Quando você troca de modelo dentro de uma sessão ativa, o Hermes estima se sua próxima mensagem vai rodar compressão de contexto de pré-flight contra a janela do novo modelo. Se a sessão já estiver perto ou acima do limite de compressão desse modelo, você receberá um aviso. A troca ainda é aplicada imediatamente, mas a compressão roda na primeira mensagem do usuário após a troca.
Importante: Trocas no meio da sessão resetam o cache de prompt. Os caches de prompt são vinculados ao modelo que atende a requisição, então qualquer mudança de modelo no meio da conversa significa que a próxima mensagem relê a conversa inteira ao preço total de tokens de entrada, em vez da taxa com cache (~75–90% de desconto). Em uma sessão longa, essa releitura única pode superar a diferença por token entre os dois modelos. Troque quando precisar, mas prefira fazer isso no início da conversa.
Níveis de Treinamento de Dados Sem Supervisão
Alguns modelos como muse-spark-1.2-contributor têm desconto porque o fornecedor pode treinar com seus prompts e respostas. A seleção interativa de modelos sempre mostra um prompt de confirmação. Mas caminhos de inicialização não interativos (como workers do Kanban e agentes cron) falham por padrão, porque não conseguem fazer essa pergunta.
Se o treinamento com os dados da carga de trabalho não supervisionada for aceitável, registre uma confirmação persistente:
hermes config set security.allow_data_training_tiers_noninteractive true
O Hermes ainda imprime o aviso completo da política de dados em cada inicialização não supervisionada, então os logs dos workers mantêm uma trilha de auditoria. Revogue com:
hermes config unset security.allow_data_training_tiers_noninteractive
Definindo Modelos Auxiliares
Clique em Show auxiliary para revelar os 11 slots de tarefas. Toda tarefa auxiliar tem como padrão auto — ou seja, o Hermes tenta usar seu modelo principal para essa função também. Se essa rota não estiver disponível, auto segue qualquer cadeia de fallback específica da tarefa, depois a cadeia de fallback principal e, em seguida, a cadeia de descoberta auxiliar integrada do Hermes. Substitua uma tarefa específica quando quiser um modelo mais barato ou mais rápido para um trabalho secundário.
Uma Nota sobre o Esquema model:
Em uma instalação totalmente nova, a configuração padrão incluída tem model: "" (uma string vazia como sentinela que significa “ainda não configurado”). Na primeira vez que você executar hermes setup ou hermes model, essa chave é atualizada no local para um mapeamento com as subchaves provider, default, base_url e api_mode. Se você vir uma string vazia no config.yaml, execute hermes model (ou clique em Change no dashboard) e o Hermes gravará o formato de dicionário para você.
É isso! Agora você está pronto para configurar modelos como um profissional. Boas conversas!
📖 Documentação oficial
この記事は Hermes Agent のDocumentação oficialに基づいています:Documentação oficial › guides/local-llm-on-mac