Dokumentextraktion — Scans in Text
Dokumentextraktion — Scans in Text — leicht verständlicher Leitfaden auf Basis der offiziellen Dokumentation
Stell dir vor, du gibst einem Kollegen einen Vertrag, und er blättert ihn durch und sagt: “Das sind doch alles nur Bilder, ich kann kein Wort lesen.” Genau dieses Problem lösen wir heute. Das read_file-Tool von Hermes Agent kann Dateien jetzt “öffnen” wie ein Mensch – und PDFs, Word-Dokumente, Excel-Tabellen und sogar alte Office-Dateien in Klartext verwandeln, den es wirklich versteht.
Drei Formate, null Einrichtung
Die gängigsten Formate funktionieren sofort, ohne Installation:
- Jupyter-Notebooks (
.ipynb) - Word-Dokumente (
.docx) - Excel-Tabellen (
.xlsx)
Diese werden in Markdown-Text umgewandelt und unterstützen das seitenweise Lesen über die Parameter offset und limit – genau wie das Blättern in einem Buch, Seite für Seite.
Alles andere: automatisch installiert, keine Sorgen
Für PDFs, alte Office-Dateien (.doc, .ppt, .xls), OpenDocument und E-Books (.epub) installiert Hermes beim ersten Gebrauch automatisch einen Konverter namens firecrawl-anydoc. Du musst keinen Finger rühren.
Eine Einschränkung: Wenn deine Systemkonfiguration die Auto-Installation deaktiviert (security.allow_lazy_installs auf false gesetzt), funktionieren nur die drei eingebauten Formate – alles andere wird als Binärdaten behandelt. Außerdem werden Dateien über 50 MB abgelehnt, um übermäßig lange Verarbeitungszeiten zu vermeiden.
Funktioniert auch in entfernten Umgebungen
Egal, ob dein Code auf Docker, Modal oder einem SSH-Remote-Server läuft – Dateien werden automatisch zur Konvertierung auf deinen lokalen Rechner übertragen. Das Lesen eines Dokuments in einer Sandbox funktioniert genauso wie das lokale Lesen.
Die große Warnung: Scans sind “falsche PDFs”
Hier ist die Falle: Die PDF-Konvertierung liest nur die Textebene. Wenn ein PDF ein Scan ist (Papierverträge, Faxe, unterschriebene Dokumente), besteht es nur aus Bildern – ohne Textebene – und das Ergebnis ist leer.
Hermes erkennt das intelligent: Wenn mehr als 20 % der Seiten keinen Text liefern (oder absolut mehr als 10 Seiten), wird eine Warnung vorangestellt, die anzeigt, welche Seiten leer sind und welcher letzte Text davor erschien.
Zum Beispiel:
[EXTRAKTIONS-WARNUNG: 198 von 311 Seiten in diesem PDF lieferten keinen Text...
Seiten 42-77 (36 Seiten) – nach "Antigua Maintenance Corp Bylaws" (S. 41)
Seiten 92-213 (122 Seiten) – nach "... Covenants, Codes and Regulations" (S. 91)]
Zwei Möglichkeiten, das zu beheben
Fall 1: Nur wenige Seiten sind Scans – Verwende Rendering + Vision. Konvertiere diese Seiten in Bilder:
pdftoppm -jpeg -r 150 -f 92 -l 94 dokument.pdf /tmp/seite
Dann nutze das Tool vision_analyze, um die Bilder zu “betrachten”. Dafür müssen die Poppler-Tools auf deinem System installiert sein (die Hermes ohnehin für die Erkennung verwendet).
Fall 2: Die meisten Seiten sind Scans – Verwende OCR zur Stapelerkennung. Hermes hat einen Skill namens ocr-and-documents, der auf marker-pdf basiert, über 90 Sprachen unterstützt und Formeln sowie Tabellen verarbeitet. Für die Installation werden 3–5 GB Speicherplatz benötigt.
Zusammenfassung
Mit read_file kann KI fast jedes gängige Dokumentformat lesen – aber denk daran: Ein PDF braucht eine Textebene, um direkt gelesen zu werden. Praktischer Rat: Wenn du regelmäßig mit Scans arbeitest, installiere den OCR-Skill am besten gleich. Wenn du nur gelegentlich auf ein paar gescannte Seiten stößt, nutze pdftoppm zur Bildkonvertierung + Bildanalyse. Lass KI nicht blind ein ganzes Dokument per OCR verarbeiten – lies zuerst die Warnung, verarbeite nur die wirklich leeren Seiten und spare so Zeit und Mühe.
📖 Offizielle Dokumentation
この記事は Hermes Agent のOffizielle Dokumentationに基づいています:Offizielle Dokumentation › user-guide/features/document-extraction