🤖HermesBlog
Hermes Feature Guides · Partie 288/9/2026

Routage des fournisseurs — Répartition intelligente des modèles

Provider Routing — Smart Model Dispatching — easy-to-understand guide based on official docs

hermes-feature-28-provider-routing

Routage des fournisseurs — Répartition intelligente des modèles

Si vous avez déjà eu l’impression que votre agent IA utilise un marteau-pilon pour écraser une noix, vous n’êtes pas seul. La plupart des agents font tourner tout via un seul gros modèle puissant — même les petites tâches annexes qui ne nécessitent pas autant de matière grise. Hermes change la donne avec un système intelligent à deux niveaux : un modèle principal pour la réflexion, et des modèles auxiliaires pour les tâches secondaires.

Imaginez une cuisine de restaurant. Vous avez votre chef cuisinier (le modèle principal) qui s’occupe de chaque commande, et puis vous avez des postes spécialisés — un pâtissier, un grillardin, un commis de cuisine — chacun s’occupant de sa propre tâche. C’est exactement comme ça que fonctionne Hermes.

Deux types d’emplacements de modèles

Hermes utilise deux types d’emplacements de modèles :

  • Modèle principal — le cerveau. Chaque message utilisateur, chaque boucle d’appel d’outil, chaque réponse en streaming passe par ce modèle.
  • Modèles auxiliaires — les acolytes. Ils gèrent la compression de contexte, la vision (analyse d’images), la synthèse de pages web, le scoring d’approbation, le routage des outils MCP, la génération de titres de session et la recherche de compétences. Chacun a son propre emplacement et peut être remplacé indépendamment.

Le meilleur dans tout ça ? Vous pouvez configurer tout cela directement depuis le tableau de bord.

La page Modèles

Ouvrez le tableau de bord et cliquez sur Modèles dans la barre latérale. Vous verrez deux sections :

  1. Paramètres des modèles — le panneau supérieur où vous assignez les modèles aux emplacements.
  2. Analytiques d’utilisation — des cartes classées montrant chaque modèle ayant exécuté une session, avec les compteurs de jetons, les coûts et les badges de capacités.

La carte du haut est le panneau Paramètres des modèles. La ligne principale affiche toujours le modèle que l’agent lancera pour les nouvelles sessions. Cliquez sur Changer pour ouvrir le sélecteur.

Définir le modèle principal

Le sélecteur comporte deux colonnes :

  • Gauche — les fournisseurs authentifiés. Seuls les fournisseurs que vous avez configurés (clé API définie, OAuth, ou endpoint personnalisé) apparaissent ici. Si un fournisseur est manquant, allez dans Clés et ajoutez ses identifiants.
  • Droite — la liste de modèles organisée pour le fournisseur sélectionné. Ce sont les modèles agentiques recommandés par Hermes, pas le simple dump /models (qui sur OpenRouter inclut plus de 400 modèles, y compris TTS, générateurs d’images et rerankers).

Tapez dans le champ de filtre pour affiner par nom de fournisseur, slug ou ID de modèle.

Choisissez un modèle, cliquez sur Changer, et Hermes l’écrit dans ~/.hermes/config.yaml sous la section model. Cela ne s’applique qu’aux nouvelles sessions — tout onglet de discussion déjà ouvert continue avec le modèle avec lequel il a démarré. Pour changer à chaud la discussion en cours, utilisez la commande slash /model à l’intérieur de celle-ci.

Changements en cours de session et avertissements de contexte

Lorsque vous changez de modèle au sein d’une session active, Hermes estime si votre prochain message déclenchera une compression de contexte de pré-vol par rapport à la fenêtre du nouveau modèle. Si la session est déjà proche ou au-dessus du seuil de compression de ce modèle, la réponse au changement inclut un avertissement. Le changement s’applique immédiatement ; la compression s’exécute sur le premier message utilisateur après le changement.

Important : Les changements de modèle en cours de session réinitialisent le cache de prompt. Les caches de prompt sont liés au modèle qui sert la requête, donc tout changement de modèle en pleine conversation signifie que le message suivant relit l’intégralité de la conversation au prix plein des jetons d’entrée, au lieu du tarif en cache (réduction d’environ 75 à 90 %). Sur une longue session, cette relecture unique peut éclipser la différence par jeton entre les deux modèles. Changez quand vous en avez besoin, mais privilégiez un changement en début de conversation.

Niveaux d’entraînement de données sans surveillance

Certains modèles sont moins chers parce que le fournisseur peut s’entraîner sur vos prompts et vos réponses. La sélection interactive de modèles affiche toujours une invite de confirmation. Mais les chemins de démarrage non interactifs comme les workers Kanban et les agents cron échouent en mode fermé car ils ne peuvent pas poser cette question.

Si l’entraînement sur les données de la charge de travail sans surveillance est acceptable, enregistrez un accusé de réception persistant :

hermes config set security.allow_data_training_tiers_noninteractive true

Hermes affiche toujours l’avertissement complet sur la politique de données et la clé d’accusé de réception à chaque démarrage sans surveillance, afin que les journaux des workers conservent une piste d’audit. Révoquez-le avec hermes config unset security.allow_data_training_tiers_noninteractive.

Définir les modèles auxiliaires

Cliquez sur Afficher les auxiliaires pour révéler les 11 emplacements de tâches. Chaque tâche auxiliaire est par défaut sur auto — ce qui signifie qu’Hermes essaie aussi votre modèle principal pour cette tâche. Si cette route est indisponible ou rencontre une erreur de type capacité, auto suit toute chaîne de repli spécifique à la tâche, puis la chaîne de repli principale, puis la chaîne de découverte auxiliaire intégrée d’Hermes.

Remplacez une tâche spécifique lorsque vous voulez un modèle moins cher ou plus rapide pour une tâche secondaire. Par exemple, vous pourriez vouloir un petit modèle pour la génération de titres de session, mais garder votre gros modèle pour les tâches de vision.

Le chemin le plus rapide : Nous Portal

Nous Portal fournit plus de 300 modèles sous un seul abonnement. Sur une nouvelle installation, exécutez hermes setup --portal pour vous connecter et définir Nous comme votre fournisseur en une seule commande. Inspectez ce qui est configuré avec hermes portal info. Les abonnés Portal bénéficient également de 10 % de réduction sur les fournisseurs facturés aux jetons.

Une note sur le schéma model:

Sur une toute nouvelle installation, la configuration par défaut incluse a model: "" (un sentinelle de chaîne vide signifiant « pas encore configuré »). La première fois que vous exécutez hermes setup ou hermes model, cette clé est mise à niveau sur place vers un mapping avec les sous-clés provider, default, base_url et api_mode. Si vous voyez un jour une chaîne vide dans config.yaml, exécutez hermes model (ou cliquez sur Changer dans le tableau de bord) et Hermes écrira la forme dictionnaire pour vous.


La répartition intelligente des modèles signifie que vous ne payez pas le prix fort pour du travail de routine. Votre modèle principal gère la réflexion lourde, tandis que des modèles plus petits et moins chers gèrent les tâches courantes. C’est efficace, économique, et cela vous donne un contrôle granulaire sur chaque partie du flux de travail de votre agent.

📖 Documentation officielle

Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › user-guide/configuring-models