第20篇:視覺能力——AI 看懂圖片
Hermes 功能詳解第20篇:視覺與圖片貼上。直接把圖片發給 AI,它能看懂內容並分析。
這篇講的是:如何讓 Hermes Agent 直接「看」你貼上的圖片,並幫你分析、描述或處理它——就像把照片遞給一個聰明的助手,它馬上能接住並理解。
圖片貼上:就像「遞照片」給 AI
想像一下,你正在跟 Hermes 聊天,突然想讓它看看你電腦上的截圖。你不需要把圖片儲存成檔案再上傳,直接複製圖片(Ctrl+C / Cmd+C),然後在輸入框裡貼上即可。
貼上後,圖片會變成一個 [📎 Image #1] 的小徽章,顯示在輸入框上方。你可以一次貼上多張圖,每張都有獨立編號。按 Ctrl+C 可以清空所有已附著的圖片。
這些圖片會被自動儲存到 ~/.hermes/images/ 資料夾,檔名帶時間戳記,方便你日後查找。
第1步:複製圖片
在任意地方複製一張圖片到剪貼簿——截圖、瀏覽器裡的圖片、甚至手機傳來的圖都行。
第2步:貼上圖片(三種方式)
方式一:直接 Ctrl+V / Cmd+V
這是最直覺的方式。Hermes 會智慧判斷:如果剪貼簿裡只有圖片(沒有文字),它會自動把圖片附著進來。
⚠️ 注意:如果你的終端機不支援直接貼上圖片(某些老舊終端機),請用方式二。
方式二:使用 /paste 指令(最可靠)
在輸入框輸入:
/paste
然後按 Enter。Hermes 會主動檢查剪貼簿,把圖片拉進來。這是最穩妥的備援方案,尤其當你的終端機「吞掉」了 Ctrl+V 時。
方式三:VS Code 系列終端機專用設定
如果你在 VS Code、Cursor 或 Windsurf 裡使用 Hermes,輸入:
/terminal-setup
它會自動設定好快捷鍵,讓 Cmd+Enter、復原/重做等操作不被 IDE 攔截。
第3步:輸入問題並送出
圖片附著好後,輸入你的問題,比如「這張圖表說明了什麼?」或「幫我看看這個報錯截圖」,按 Enter 送出。
各平台支援情況一覽
| 環境 | 直接貼上 | /paste |
需要裝什麼 |
|---|---|---|---|
| macOS 終端機 / iTerm2 | ✅ | ✅ | 無需設定 |
| Linux (X11) | ✅ | ✅ | sudo apt install xclip |
| Linux (Wayland) | ✅ | ✅ | sudo apt install wl-clipboard |
| WSL2 (Windows Terminal) | ✅ | ✅ | 無需設定 |
| VS Code 系列(本機) | ✅ | ✅ | 建議執行 /terminal-setup |
| SSH 遠端連線 | ❌ | ❌ | 見下文 |
SSH 遠端怎麼辦? 遠端伺服器讀不到你本機剪貼簿。解決辦法:把圖片上傳到伺服器(用 scp 或拖曳),或者直接貼圖片 URL,讓 AI 透過連結看圖。
為什麼終端機不能直接貼上圖片?
終端機本質是文字通道。當你按 Ctrl+V 時,終端機只讀取剪貼簿裡的文字,圖片資料它「看不見」。所以 Hermes 繞了個彎——它直接呼叫系統工具(如 macOS 的 osascript、Linux 的 xclip)去讀剪貼簿,繞過終端機限制。
圖片怎麼被 AI 處理?
Hermes 很聰明:如果你目前用的模型支援視覺(如 GPT-4V、Claude、Gemini),圖片會以原始像素傳送,AI 直接「看」圖。如果模型不支援視覺,Hermes 會自動呼叫輔助視覺工具,先讓另一個模型描述圖片,再把文字描述注入對話。你完全不用操心這些細節。
小結
複製圖片 → 貼上(或 /paste)→ 提問,三步搞定。不同平台有對應的準備工具,SSH 場景用 URL 或檔案路徑替代。視覺能力讓 Hermes 從「文字助手」升級為「多模態夥伴」。
下篇預告:當圖片和文字都能處理之後,Hermes 還能做什麼?下一篇我們聊聊它的檔案操作能力——讓 AI 直接讀寫你電腦上的檔案,敬請期待!
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/features/memory