🤖HermesBlog
Guides des Fonctionnalités Hermes · Partie 338/9/2026

Extraction de Documents — Scans en Texte

Extraction de Documents — Scans en Texte — guide facile à comprendre basé sur la documentation officielle

Imaginez que vous tendiez un contrat à un collègue, et qu’il le feuillette en disant : « C’est que des images, je n’arrive pas à lire un seul mot. » C’est exactement le problème que nous résolvons aujourd’hui. L’outil read_file d’Hermes Agent peut désormais « ouvrir » des fichiers comme le ferait un humain — transformant les PDF, les documents Word, les feuilles Excel, et même les anciens fichiers Office en texte brut qu’il peut réellement comprendre.

hermes-feature-33-document-extraction

Trois formats, zéro configuration

Les formats les plus courants fonctionnent directement, sans installation nécessaire :

  • Les notebooks Jupyter (.ipynb)
  • Les documents Word (.docx)
  • Les feuilles de calcul Excel (.xlsx)

Ils sont convertis en texte Markdown et prennent en charge la lecture paginée via les paramètres offset et limit — comme si vous feuilletiez un livre, page par page.

Tout le reste : installation automatique, sans souci

Pour les PDF, les anciens fichiers Office (.doc, .ppt, .xls), OpenDocument et les livres numériques (.epub), Hermes installe automatiquement un convertisseur appelé firecrawl-anydoc lors de la première utilisation. Vous n’avez rien à faire.

Une petite réserve : si votre configuration système désactive l’installation automatique (security.allow_lazy_installs défini sur false), seuls les trois formats intégrés fonctionnent — tout le reste est traité comme du binaire. De plus, les fichiers de plus de 50 Mo sont rejetés pour éviter des temps de traitement excessivement longs.

Fonctionne aussi dans les environnements distants

Que votre code s’exécute sur Docker, Modal ou un serveur distant SSH, les fichiers sont automatiquement transférés vers votre machine locale pour la conversion. Lire un document dans un environnement sandbox fonctionne exactement comme le lire localement.

Le grand avertissement : les scans sont de « faux PDF »

Voici le piège : la conversion PDF ne lit que la couche texte. Si un PDF est un scan (contrats papier, fax, documents signés), ce ne sont que des images — pas de couche texte — et le résultat est vide.

Hermes le détecte intelligemment : si plus de 20 % des pages ne produisent aucun texte (ou plus de 10 pages en valeur absolue), il ajoute un avertissement montrant quelles pages sont vides et le dernier texte apparu avant elles.

Par exemple :

[AVERTISSEMENT DE COUVERTURE D'EXTRACTION : 198 des 311 pages de ce PDF n'ont produit aucun texte...
  pages 42-77 (36 pages) — après « Antigua Maintenance Corp Bylaws » (p41)
  pages 92-213 (122 pages) — après « ... Covenants, Codes and Regulations » (p91)]

Deux façons de corriger le problème

Cas 1 : Seulement quelques pages sont des scans — Utilisez le rendu + la vision. Convertissez ces pages en images :

pdftoppm -jpeg -r 150 -f 92 -l 94 document.pdf /tmp/page

Ensuite, utilisez l’outil vision_analyze pour « regarder » les images. Cela nécessite que les outils poppler soient installés sur votre système (qu’Hermes utilise de toute façon pour la détection).

Cas 2 : La plupart des pages sont des scans — Utilisez l’OCR pour une reconnaissance par lots. Hermes dispose d’une compétence ocr-and-documents basée sur marker-pdf, prenant en charge plus de 90 langues et gérant les formules et les tableaux. Elle nécessite 3 à 5 Go d’espace disque pour l’installation.

Résumé

read_file permet à l’IA de lire presque tous les formats de documents courants — mais rappelez-vous : un PDF doit avoir une couche texte pour être lu directement. Conseil pratique : si vous manipulez régulièrement des scans, installez la compétence OCR dès le départ. Si vous ne rencontrez que quelques pages scannées occasionnellement, utilisez pdftoppm pour convertir les images + l’analyse par vision. Ne faites pas faire de l’OCR à l’IA sur un document entier à l’aveugle — lisez d’abord l’avertissement, traitez uniquement les pages réellement vides, et économisez du temps et des efforts.

📖 Documentation officielle

Cet article est basé sur la documentation officielle de Hermes Agent :Docs officiels › user-guide/features/document-extraction