Trích xuất Tài liệu — Chuyển Bản quét thành Văn bản
Trích xuất Tài liệu — Chuyển Bản quét thành Văn bản — hướng dẫn dễ hiểu dựa trên tài liệu chính thức
Trích Xuất Tài Liệu — Từ Bản Quét Sang Văn Bản
Hãy tưởng tượng bạn đưa một bản hợp đồng cho đồng nghiệp, và họ lật qua rồi nói: “Toàn ảnh thôi, mình không đọc được chữ nào.” Đó chính xác là vấn đề chúng ta giải quyết hôm nay. Công cụ read_file của Hermes Agent giờ đây có thể “mở” tệp như con người — chuyển PDF, tài liệu Word, bảng tính Excel, thậm chí cả tệp Office cũ thành văn bản thuần túy mà nó thực sự hiểu được.
Ba Định Dạng, Không Cần Cài Đặt Gì
Các định dạng phổ biến nhất hoạt động ngay lập tức, không cần cài đặt thêm:
- Notebook Jupyter (
.ipynb) - Tài liệu Word (
.docx) - Bảng tính Excel (
.xlsx)
Các định dạng này được chuyển thành văn bản Markdown và hỗ trợ đọc theo trang thông qua tham số offset và limit — giống như lật từng trang sách vậy.
Mọi Thứ Khác: Tự Động Cài Đặt, Khỏi Lo
Đối với PDF, tệp Office cũ (.doc, .ppt, .xls), OpenDocument và sách điện tử (.epub), Hermes tự động cài đặt một bộ chuyển đổi tên là firecrawl-anydoc trong lần sử dụng đầu tiên. Bạn không cần làm gì cả.
Một lưu ý: nếu cấu hình hệ thống của bạn tắt tính năng tự cài đặt (security.allow_lazy_installs được đặt thành false), chỉ có ba định dạng tích hợp hoạt động — mọi thứ khác sẽ bị xử lý như tệp nhị phân. Ngoài ra, các tệp trên 50MB sẽ bị từ chối để tránh thời gian xử lý quá lâu.
Hoạt Động Cả Trong Môi Trường Từ Xa
Dù mã của bạn chạy trên Docker, Modal hay máy chủ SSH từ xa, các tệp vẫn được tự động chuyển về máy cục bộ của bạn để chuyển đổi. Đọc tài liệu trong môi trường sandbox hoạt động y hệt như đọc cục bộ.
Cảnh Báo Lớn: Bản Quét Là “PDF Giả”
Đây là cái bẫy: chuyển đổi PDF chỉ đọc lớp văn bản. Nếu PDF là bản quét (hợp đồng giấy, fax, tài liệu đã ký), tất cả chỉ là hình ảnh — không có lớp văn bản — và kết quả sẽ trống rỗng.
Hermes phát hiện điều này một cách thông minh: nếu hơn 20% số trang không trích xuất được văn bản (hoặc hơn 10 trang tuyệt đối), nó sẽ thêm cảnh báo hiển thị những trang nào trống và văn bản cuối cùng xuất hiện trước đó.
Ví dụ:
[CẢNH BÁO PHẠM VI TRÍCH XUẤT: 198 trên 311 trang trong PDF này không trích xuất được văn bản...
trang 42-77 (36 trang) — sau "Antigua Maintenance Corp Bylaws" (tr.41)
trang 92-213 (122 trang) — sau "... Covenants, Codes and Regulations" (tr.91)]
Hai Cách Khắc Phục
Trường hợp 1: Chỉ vài trang bị quét — Dùng kỹ thuật render + thị giác máy tính. Chuyển những trang đó thành hình ảnh:
pdftoppm -jpeg -r 150 -f 92 -l 94 document.pdf /tmp/page
Sau đó dùng công cụ vision_analyze để “nhìn” các hình ảnh. Cách này yêu cầu cài đặt công cụ poppler trên hệ thống của bạn (mà Hermes vốn đã dùng để phát hiện).
Trường hợp 2: Hầu hết các trang đều bị quét — Dùng OCR để nhận dạng hàng loạt. Hermes có kỹ năng ocr-and-documents dựa trên marker-pdf, hỗ trợ hơn 90 ngôn ngữ và xử lý được công thức lẫn bảng biểu. Cần 3–5GB dung lượng ổ đĩa để cài đặt.
Tóm Lại
read_file cho phép AI đọc gần như mọi định dạng tài liệu phổ biến — nhưng hãy nhớ: PDF cần có lớp văn bản để đọc trực tiếp. Lời khuyên thực tế: nếu bạn thường xuyên xử lý bản quét, hãy cài sẵn kỹ năng OCR. Nếu thỉnh thoảng mới gặp vài trang bị quét, hãy dùng pdftoppm để chuyển thành hình ảnh + phân tích bằng thị giác máy tính. Đừng bắt AI OCR toàn bộ tài liệu một cách mù quáng — hãy đọc cảnh báo trước, chỉ xử lý những trang thực sự trống, vừa tiết kiệm thời gian vừa tiết kiệm công sức.
📖 Tài liệu chính thức
この記事は Hermes Agent のTài liệu chính thứcに基づいています:Tài liệu chính thức › user-guide/features/document-extraction