🤖HermesBlog
Guide alle Funzionalità di Hermes · Parte 338/9/2026

Estrazione di Documenti — Dalla Scansione al Testo

Estrazione di Documenti — Dalla Scansione al Testo — guida facile da comprendere basata sulla documentazione ufficiale

Immagina di consegnare un contratto a un collega, e lui lo sfoglia dicendo: “Sono tutte immagini, non riesco a leggere una parola.” È esattamente il problema che risolviamo oggi. Lo strumento read_file di Hermes Agent ora può “aprire” i file come farebbe un umano — trasformando PDF, documenti Word, fogli Excel e persino vecchi file Office in testo semplice che può davvero capire.

hermes-feature-33-document-extraction

Tre Formati, Zero Configurazione

I formati più comuni funzionano subito, senza bisogno di installare nulla:

  • Notebook Jupyter (.ipynb)
  • Documenti Word (.docx)
  • Fogli di calcolo Excel (.xlsx)

Questi vengono convertiti in testo Markdown e supportano la lettura paginata tramite i parametri offset e limit — proprio come sfogliare un libro, pagina per pagina.

Tutto il Resto: Auto-Installato, Nessuna Preoccupazione

Per PDF, vecchi file Office (.doc, .ppt, .xls), OpenDocument ed ebook (.epub), Hermes installa automaticamente un convertitore chiamato firecrawl-anydoc al primo utilizzo. Non devi muovere un dito.

Un’avvertenza: se la configurazione di sistema disabilita l’auto-installazione (security.allow_lazy_installs impostato su false), funzionano solo i tre formati integrati — tutto il resto viene trattato come binario. Inoltre, i file oltre i 50MB vengono rifiutati per evitare tempi di elaborazione eccessivamente lunghi.

Funziona Anche in Ambienti Remoti

Che il tuo codice giri su Docker, Modal o un server remoto SSH, i file vengono automaticamente trasferiti alla tua macchina locale per la conversione. Leggere un documento in una sandbox funziona esattamente come leggerlo localmente.

Il Grande Avvertimento: Le Scansioni Sono “PDF Finti”

Ecco la trappola: la conversione PDF legge solo il livello di testo. Se un PDF è una scansione (contratti cartacei, fax, documenti firmati), è tutto immagini — nessun livello di testo — e il risultato è vuoto.

Hermes lo rileva intelligentemente: se più del 20% delle pagine non produce testo (o più di 10 pagine in assoluto), antepone un avviso che mostra quali pagine sono vuote e l’ultimo testo apparso prima di esse.

Per esempio:

[AVVISO DI COPERTURA ESTRAZIONE: 198 di 311 pagine in questo PDF non hanno prodotto testo...
  pagine 42-77 (36 pagine) — dopo "Antigua Maintenance Corp Bylaws" (p41)
  pagine 92-213 (122 pagine) — dopo "... Covenants, Codes and Regulations" (p91)]

Due Modi per Risolvere

Caso 1: Solo poche pagine sono scansioni — Usa rendering + visione. Converti quelle pagine in immagini:

pdftoppm -jpeg -r 150 -f 92 -l 94 document.pdf /tmp/page

Poi usa lo strumento vision_analyze per “guardare” le immagini. Questo richiede che gli strumenti poppler siano installati sul tuo sistema (che Hermes usa comunque per il rilevamento).

Caso 2: La maggior parte delle pagine sono scansioni — Usa l’OCR per il riconoscimento batch. Hermes ha una skill ocr-and-documents basata su marker-pdf, che supporta oltre 90 lingue e gestisce formule e tabelle. Servono 3–5GB di spazio su disco per installarla.

read_file permette all’AI di leggere quasi ogni formato di documento comune — ma ricorda: un PDF deve avere un livello di testo per essere letto direttamente. Consiglio pratico: se gestisci regolarmente scansioni, installa subito la skill OCR. Se ti capita solo qualche pagina scansionata di tanto in tanto, usa pdftoppm per convertire le immagini + analisi visiva. Non far fare all’AI un OCR cieco dell’intero documento — leggi prima l’avviso, elabora solo le pagine davvero vuote e risparmia tempo e fatica.


📖 Documentazione ufficiale

この記事は Hermes Agent のDocumentazione ufficialeに基づいています:Documentazione ufficiale › user-guide/features/document-extraction