Provider Routing — Smart Model Dispatching
Provider Routing — Smart Model Dispatching — easy-to-understand guide based on official docs
Enrutamiento de Proveedores — Despacho Inteligente de Modelos
Si alguna vez has sentido que tu agente de IA está usando una maza para romper una nuez, no estás solo. La mayoría de los agentes ejecutan todo a través de un único modelo grande y potente — incluso las pequeñas tareas secundarias que no necesitan tanta capacidad cerebral. Hermes cambia eso con un sistema inteligente de dos niveles: un modelo principal para pensar, y modelos auxiliares para las tareas menores.
Piénsalo como la cocina de un restaurante. Tienes a tu chef ejecutivo (el modelo principal) que se encarga de cada pedido, y luego tienes estaciones especializadas — un pastelero, un parrillero, un ayudante de cocina — cada uno manejando su propia tarea. Así es exactamente como funciona Hermes.
Dos Tipos de Ranuras de Modelo
Hermes utiliza dos tipos de ranuras de modelo:
- Modelo principal — el cerebro. Cada mensaje del usuario, cada bucle de llamada a herramientas, cada respuesta en streaming fluye a través de este modelo.
- Modelos auxiliares — los ayudantes. Estos manejan la compresión de contexto, la visión (análisis de imágenes), el resumen de páginas web, la puntuación de aprobaciones, el enrutamiento de herramientas MCP, la generación de títulos de sesión y la búsqueda de habilidades. Cada uno tiene su propia ranura y puede ser anulado de forma independiente.
¿La mejor parte? Puedes configurar todo esto directamente desde el panel de control.
La Página de Modelos
Abre el panel de control y haz clic en Modelos en la barra lateral. Verás dos secciones:
- Configuración de Modelos — el panel superior donde asignas modelos a las ranuras.
- Analíticas de uso — tarjetas clasificadas que muestran cada modelo que ejecutó una sesión, con conteos de tokens, costos e insignias de capacidades.
La tarjeta superior es el panel de Configuración de Modelos. La fila principal siempre muestra lo que el agente iniciará para nuevas sesiones. Haz clic en Cambiar para abrir el selector.
Configurando el Modelo Principal
El selector tiene dos columnas:
- Izquierda — proveedores autenticados. Solo los proveedores que hayas configurado (con clave API establecida, OAuth o definidos como endpoint personalizado) aparecen aquí. Si falta un proveedor, ve a Claves y añade su credencial.
- Derecha — la lista curada de modelos para el proveedor seleccionado. Estos son los modelos agénticos que Hermes recomienda, no el volcado crudo de
/models(que en OpenRouter incluye más de 400 modelos, incluyendo TTS, generadores de imágenes y rerankers).
Escribe en el cuadro de filtro para reducir por nombre de proveedor, slug o ID de modelo.
Elige un modelo, pulsa Cambiar, y Hermes lo escribe en ~/.hermes/config.yaml bajo la sección model. Esto aplica solo a sesiones nuevas — cualquier pestaña de chat que ya tengas abierta seguirá ejecutando el modelo con el que comenzó. Para cambiar en caliente el chat actual, usa el comando de barra /model dentro de él.
Cambios a Mitad de Sesión y Advertencias de Contexto
Cuando cambias de modelo dentro de una sesión activa, Hermes estima si tu próximo mensaje ejecutará compresión de contexto de preflight contra la ventana del nuevo modelo. Si la sesión ya está cerca o por encima del umbral de compresión de ese modelo, la respuesta al cambio incluye una advertencia. El cambio se aplica de inmediato; la compresión se ejecuta en el primer mensaje del usuario después del cambio.
Importante: Los cambios a mitad de sesión restablecen la caché de prompt. Las cachés de prompt están vinculadas al modelo que sirve la solicitud, así que cualquier cambio de modelo a mitad de conversación significa que el siguiente mensaje relee toda la conversación al precio completo de tokens de entrada en lugar de la tarifa cacheada (con descuento de ~75–90%). En una sesión larga, esta relectura única puede eclipsar la diferencia por token entre los dos modelos. Cambia cuando lo necesites, pero prefiere hacerlo al inicio de una conversación.
Niveles de Entrenamiento de Datos No Supervisados
Algunos modelos tienen descuento porque el proveedor puede entrenar con tus prompts y respuestas. La selección interactiva de modelos siempre muestra un aviso de confirmación. Pero las rutas de inicio no interactivas, como los trabajadores de Kanban y los agentes cron, fallan de forma segura porque no pueden hacer esa pregunta.
Si el entrenamiento con los datos de la carga de trabajo no supervisada es aceptable, registra un reconocimiento persistente:
hermes config set security.allow_data_training_tiers_noninteractive true
Hermes aún imprime la advertencia completa de la política de datos y la clave de reconocimiento en cada inicio no supervisado, para que los registros del trabajador conserven un rastro de auditoría. Revócalo con hermes config unset security.allow_data_training_tiers_noninteractive.
Configurando Modelos Auxiliares
Haz clic en Mostrar auxiliares para revelar las 11 ranuras de tareas. Cada tarea auxiliar tiene como valor predeterminado auto — lo que significa que Hermes intenta usar tu modelo principal también para ese trabajo. Si esa ruta no está disponible o falla con un error de capacidad, auto sigue cualquier cadena de respaldo específica de la tarea, luego la cadena de respaldo principal, y luego la cadena de descubrimiento auxiliar integrada de Hermes.
Anula una tarea específica cuando quieras un modelo más barato o más rápido para un trabajo secundario. Por ejemplo, podrías querer un modelo pequeño para la generación de títulos de sesión pero mantener tu modelo grande para tareas de visión.
La Ruta Más Rápida: Nous Portal
Nous Portal ofrece más de 300 modelos con una sola suscripción. En una instalación nueva, ejecuta hermes setup --portal para iniciar sesión y configurar Nous como tu proveedor en un solo comando. Inspecciona lo que está conectado con hermes portal info. Los suscriptores de Portal también obtienen 10% de descuento en proveedores facturados por tokens.
Una Nota sobre el Esquema model:
En una instalación completamente nueva, la configuración predeterminada incluida tiene model: "" (un centinela de cadena vacía que significa “aún no configurado”). La primera vez que ejecutes hermes setup o hermes model, esa clave se actualiza en el lugar a un mapeo con subclaves provider, default, base_url y api_mode. Si alguna vez ves una cadena vacía en config.yaml, ejecuta hermes model (o haz clic en Cambiar en el panel de control) y Hermes escribirá la forma de diccionario por ti.
El despacho inteligente de modelos significa que no estás pagando precios de modelo insignia por trabajo rutinario. Tu modelo principal maneja el pensamiento pesado, mientras que modelos más pequeños y baratos manejan las tareas habituales. Es eficiente, rentable y te da control granular sobre cada parte del flujo de trabajo de tu agente.
📖 Documentación oficial
Este artículo se basa en la documentación oficial de Hermes Agent :Docs oficiales › user-guide/configuring-models