Provider-Routing — Intelligente Modellverteilung
Provider Routing — Smart Model Dispatching — easy-to-understand guide based on official docs
Provider-Routing — Intelligente Modellverteilung
Wenn du je das Gefühl hattest, dass dein KI-Agent mit Kanonen auf Spatzen schießt, bist du nicht allein. Die meisten Agenten lassen alles über ein einziges großes, leistungsstarkes Modell laufen — selbst die kleinen Nebenaufgaben, die nicht viel Denkleistung brauchen. Hermes ändert das mit einem cleveren Zwei-Ebenen-System: ein Hauptmodell für das Denken und Hilfsmodelle für die kleinen Aufgaben.
Stell es dir wie eine Restaurantküche vor. Du hast deinen Küchenchef (das Hauptmodell), der jede Bestellung bearbeitet, und dann gibt es spezialisierte Stationen — einen Patissier, einen Griller, einen Vorbereitungskoch — die jeweils ihre eigene Aufgabe übernehmen. Genau so funktioniert Hermes.
Zwei Arten von Modell-Slots
Hermes verwendet zwei Arten von Modell-Slots:
- Hauptmodell — das Gehirn. Jede Benutzernachricht, jede Tool-Call-Schleife, jede gestreamte Antwort fließt durch dieses Modell.
- Hilfsmodelle — die Sidekicks. Sie übernehmen Kontextkomprimierung, Vision (Bildanalyse), Webseiten-Zusammenfassung, Genehmigungs-Scoring, MCP-Tool-Routing, Sitzungstitel-Generierung und Skill-Suche. Jedes hat seinen eigenen Slot und kann unabhängig überschrieben werden.
Das Beste daran? Du kannst das alles direkt über das Dashboard konfigurieren.
Die Modelle-Seite
Öffne das Dashboard und klicke in der Seitenleiste auf Modelle. Du siehst zwei Bereiche:
- Modelleinstellungen — das obere Panel, in dem du Modelle den Slots zuweist.
- Nutzungsanalyse — sortierte Karten, die jedes Modell zeigen, das eine Sitzung ausgeführt hat, mit Token-Anzahl, Kosten und Fähigkeits-Badges.
Die oberste Karte ist das Modelleinstellungen-Panel. Die Hauptzeile zeigt immer, welches Modell der Agent für neue Sitzungen startet. Klicke auf Ändern, um den Auswahldialog zu öffnen.
Das Hauptmodell festlegen
Der Auswahldialog hat zwei Spalten:
- Links — authentifizierte Provider. Nur Provider, die du eingerichtet hast (API-Key gesetzt, OAuth-verbunden oder als benutzerdefinierter Endpunkt definiert), erscheinen hier. Wenn ein Provider fehlt, gehe zu Schlüssel und füge seine Zugangsdaten hinzu.
- Rechts — die kuratierte Modellliste für den ausgewählten Provider. Das sind die agentischen Modelle, die Hermes empfiehlt, nicht der rohe
/models-Dump (der bei OpenRouter 400+ Modelle umfasst, einschließlich TTS, Bildgeneratoren und Rerankern).
Tippe in das Filterfeld, um nach Providername, Slug oder Modell-ID einzugrenzen.
Wähle ein Modell, klicke auf Wechseln, und Hermes schreibt es in ~/.hermes/config.yaml unter den Abschnitt model. Das gilt nur für neue Sitzungen — jeder bereits geöffnete Chat-Tab läuft mit dem Modell weiter, mit dem er gestartet wurde. Um den aktuellen Chat live zu wechseln, verwende den /model-Slash-Befehl darin.
Wechsel mitten in der Sitzung und Kontextwarnungen
Wenn du Modelle innerhalb einer aktiven Sitzung wechselst, schätzt Hermes ab, ob deine nächste Nachricht eine Preflight-Kontextkomprimierung gegen das Fenster des neuen Modells auslöst. Wenn die Sitzung bereits nahe an oder über der Komprimierungsschwelle des Modells liegt, enthält die Wechselantwort eine Warnung. Der Wechsel wird trotzdem sofort angewendet; die Komprimierung läuft bei der ersten Benutzernachricht nach dem Wechsel.
Wichtig: Wechsel mitten in der Sitzung setzen den Prompt-Cache zurück. Prompt-Caches sind an das Modell gebunden, das die Anfrage bedient. Jeder Modellwechsel mitten im Gespräch bedeutet, dass die nächste Nachricht die gesamte Konversation zum vollen Input-Token-Preis neu liest, statt zum gecachten (ca. 75–90 % reduzierten) Satz. Bei einer langen Sitzung kann dieses einmalige Neulesen den Token-Preisunterschied zwischen den beiden Modellen bei weitem übertreffen. Wechsle, wenn du musst, aber bevorzugt früh in einem Gespräch.
Unbeaufsichtigte Datentrainings-Stufen
Einige Modelle sind rabattiert, weil der Anbieter möglicherweise mit deinen Prompts und Antworten trainiert. Die interaktive Modellauswahl zeigt immer einen Bestätigungsdialog. Aber nicht-interaktive Startpfade wie Kanban-Worker und Cron-Agenten schlagen im Zweifel fehl, weil sie diese Frage nicht stellen können.
Wenn das Training mit den Daten der unbeaufsichtigten Arbeitslast akzeptabel ist, speichere eine dauerhafte Bestätigung:
hermes config set security.allow_data_training_tiers_noninteractive true
Hermes gibt bei jedem unbeaufsichtigten Start trotzdem die vollständige Datenrichtlinien-Warnung und den Bestätigungsschlüssel aus, sodass Worker-Logs einen Prüfpfad behalten. Widerrufe es mit hermes config unset security.allow_data_training_tiers_noninteractive.
Hilfsmodelle festlegen
Klicke auf Hilfsmodelle anzeigen, um die 11 Aufgaben-Slots zu sehen. Jede Hilfsaufgabe ist standardmäßig auf auto gesetzt — das bedeutet, Hermes versucht auch dein Hauptmodell für diese Aufgabe. Wenn dieser Weg nicht verfügbar ist oder einen Kapazitätsfehler verursacht, folgt auto jeder aufgabenspezifischen Fallback-Kette, dann der Haupt-Fallback-Kette, dann der integrierten Hermes-Hilfsmodell-Erkennungskette.
Überschreibe eine bestimmte Aufgabe, wenn du ein günstigeres oder schnelleres Modell für eine Nebenaufgabe möchtest. Zum Beispiel könntest du ein winziges Modell für die Sitzungstitel-Generierung wollen, aber dein großes Modell für Vision-Aufgaben behalten.
Schnellster Weg: Nous Portal
Nous Portal bietet 300+ Modelle mit einem einzigen Abonnement. Bei einer frischen Installation führe hermes setup --portal aus, um dich mit einem einzigen Befehl anzumelden und Nous als deinen Provider zu setzen. Überprüfe die Einrichtung mit hermes portal info. Portal-Abonnenten erhalten außerdem 10 % Rabatt auf token-abgerechnete Provider.
Ein Hinweis zum model:-Schema
Bei einer brandneuen Installation enthält die mitgelieferte Standardkonfiguration model: "" (einen leeren String als Sentinel für „noch nicht konfiguriert“). Beim ersten Ausführen von hermes setup oder hermes model wird dieser Schlüssel direkt zu einem Mapping mit den Unter-Schlüsseln provider, default, base_url und api_mode aufgewertet. Wenn du jemals einen leeren String in config.yaml siehst, führe hermes model aus (oder klicke im Dashboard auf Ändern), und Hermes schreibt die Dict-Form für dich.
Intelligente Modellverteilung bedeutet, dass du keine Flaggschiff-Preise für Routinearbeiten zahlst. Dein Hauptmodell übernimmt das schwere Denken, während kleinere, günstigere Modelle die Routineaufgaben erledigen. Es ist effizient, kostengünstig und gibt dir granulare Kontrolle über jeden Teil des Workflows deines Agenten.
📖 Offizielle Dokumentation
この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › user-guide/configuring-models