🤖HermesBlog
Panduan Fitur Hermes · Parte 338/9/2026

Ekstraksi Dokumen — Pindaian ke Teks

Ekstraksi Dokumen — Pindaian ke Teks — panduan mudah dipahami berdasarkan dokumentasi resmi

Bayangkan Anda memberikan kontrak kepada rekan kerja, dan mereka membalik-baliknya sambil berkata, “Ini semua gambar, saya tidak bisa membaca satu kata pun.” Itulah masalah yang akan kita perbaiki hari ini. Tool read_file milik Hermes Agent sekarang bisa “membuka” file seperti manusia — mengubah PDF, dokumen Word, spreadsheet Excel, dan bahkan file Office lawas menjadi teks biasa yang bisa dipahaminya.

hermes-feature-33-document-extraction

Tiga Format, Tanpa Pengaturan Apa Pun

Format yang paling umum sudah bisa langsung digunakan, tanpa perlu instalasi:

  • Notebook Jupyter (.ipynb)
  • Dokumen Word (.docx)
  • Spreadsheet Excel (.xlsx)

File-file ini diubah menjadi teks Markdown dan mendukung pembacaan per halaman melalui parameter offset dan limit — seperti membalik-balik buku, halaman demi halaman.

Format Lainnya: Terpasang Otomatis, Tanpa Khawatir

Untuk PDF, file Office lawas (.doc, .ppt, .xls), OpenDocument, dan ebook (.epub), Hermes secara otomatis memasang konverter bernama firecrawl-anydoc saat pertama kali digunakan. Anda tidak perlu melakukan apa pun.

Satu catatan: jika konfigurasi sistem Anda menonaktifkan pemasangan otomatis (security.allow_lazy_installs disetel ke false), hanya tiga format bawaan yang berfungsi — format lainnya akan diperlakukan sebagai file biner. Selain itu, file yang lebih besar dari 50MB akan ditolak untuk menghindari waktu pemrosesan yang terlalu lama.

Berfungsi Juga di Lingkungan Jarak Jauh

Baik kode Anda berjalan di Docker, Modal, atau server jarak jauh SSH, file akan secara otomatis ditransfer kembali ke mesin lokal Anda untuk dikonversi. Membaca dokumen di sandbox sama persis seperti membacanya secara lokal.

Peringatan Besar: Pindaian adalah “PDF Palsu”

Inilah jebakannya: konversi PDF hanya membaca lapisan teks. Jika PDF adalah hasil pindaian (kontrak kertas, faks, dokumen bertanda tangan), semuanya berupa gambar — tidak ada lapisan teks — dan hasilnya akan kosong.

Hermes mendeteksi ini secara cerdas: jika lebih dari 20% halaman tidak menghasilkan teks (atau lebih dari 10 halaman secara absolut), ia akan menambahkan peringatan yang menunjukkan halaman mana yang kosong dan teks terakhir yang muncul sebelum halaman-halaman tersebut.

Contohnya:

[PERINGATAN CAKUPAN EKSTRAKSI: 198 dari 311 halaman dalam PDF ini tidak menghasilkan teks...
  halaman 42-77 (36 halaman) — setelah "Antigua Maintenance Corp Bylaws" (hal. 41)
  halaman 92-213 (122 halaman) — setelah "... Covenants, Codes and Regulations" (hal. 91)]

Dua Cara untuk Mengatasinya

Kasus 1: Hanya beberapa halaman yang merupakan pindaian — Gunakan rendering + visi. Ubah halaman-halaman tersebut menjadi gambar:

pdftoppm -jpeg -r 150 -f 92 -l 94 document.pdf /tmp/page

Kemudian gunakan tool vision_analyze untuk “melihat” gambar-gambar tersebut. Ini memerlukan tool poppler yang terpasang di sistem Anda (yang sebenarnya sudah digunakan Hermes untuk deteksi).

Kasus 2: Sebagian besar halaman adalah pindaian — Gunakan OCR untuk pengenalan massal. Hermes memiliki skill ocr-and-documents yang berbasis marker-pdf, mendukung 90+ bahasa dan menangani rumus serta tabel. Skill ini membutuhkan ruang disk 3–5GB untuk instalasi.

Ringkasan

read_file memungkinkan AI membaca hampir semua format dokumen umum — tetapi ingat: PDF memerlukan lapisan teks untuk dapat dibaca langsung. Saran praktis: jika Anda sering menangani pindaian, pasang skill OCR sejak awal. Jika Anda hanya sesekali menemui beberapa halaman pindaian, gunakan pdftoppm untuk mengubah gambar + analisis visi. Jangan biarkan AI melakukan OCR pada seluruh dokumen secara membabi buta — baca peringatannya terlebih dahulu, proses hanya halaman yang benar-benar kosong, dan hemat waktu serta tenaga.


📖 Dokumentasi resmi

この記事は Hermes Agent のDokumentasi resmiに基づいています:Dokumentasi resmi › user-guide/features/document-extraction