第20篇:视觉能力——AI 看懂图片
Hermes 功能详解第20篇:视觉与图片粘贴。直接把图片发给 AI,它能看懂内容并分析。
这篇讲的是:如何让 Hermes Agent 直接“看”你粘贴的图片,并帮你分析、描述或处理它——就像把照片递给一个聪明的助手,它马上能接住并理解。
图片粘贴:就像“递照片”给 AI
想象一下,你正在跟 Hermes 聊天,突然想让它看看你电脑上的截图。你不需要把图片保存成文件再上传,直接复制图片(Ctrl+C / Cmd+C),然后在输入框里粘贴即可。
粘贴后,图片会变成一个 [📎 Image #1] 的小徽章,显示在输入框上方。你可以一次粘贴多张图,每张都有独立编号。按 Ctrl+C 可以清空所有已附着的图片。
这些图片会被自动保存到 ~/.hermes/images/ 文件夹,文件名带时间戳,方便你日后查找。
第1步:复制图片
在任意地方复制一张图片到剪贴板——截图、浏览器里的图片、甚至手机传来的图都行。
第2步:粘贴图片(三种方式)
方式一:直接 Ctrl+V / Cmd+V
这是最直觉的方式。Hermes 会智能判断:如果剪贴板里只有图片(没有文字),它会自动把图片附着进来。
⚠️ 注意:如果你的终端不支持直接粘贴图片(某些老旧终端),请用方式二。
方式二:使用 /paste 命令(最可靠)
在输入框输入:
/paste
然后回车。Hermes 会主动检查剪贴板,把图片拉进来。这是最稳妥的兜底方案,尤其当你的终端“吞掉”了 Ctrl+V 时。
方式三:VS Code 系列终端专用设置
如果你在 VS Code、Cursor 或 Windsurf 里使用 Hermes,输入:
/terminal-setup
它会自动配置好快捷键,让 Cmd+Enter、撤销/重做等操作不被 IDE 拦截。
第3步:输入问题并发送
图片附着好后,输入你的问题,比如“这张图表说明了什么?”或“帮我看看这个报错截图”,按回车发送。
各平台支持情况一览
| 环境 | 直接粘贴 | /paste |
需要装什么 |
|---|---|---|---|
| macOS 终端 / iTerm2 | ✅ | ✅ | 无需配置 |
| Linux (X11) | ✅ | ✅ | sudo apt install xclip |
| Linux (Wayland) | ✅ | ✅ | sudo apt install wl-clipboard |
| WSL2 (Windows Terminal) | ✅ | ✅ | 无需配置 |
| VS Code 系列(本地) | ✅ | ✅ | 建议跑 /terminal-setup |
| SSH 远程会话 | ❌ | ❌ | 见下文 |
SSH 远程怎么办? 远程服务器读不到你本地剪贴板。解决办法:把图片上传到服务器(用 scp 或拖拽),或者直接贴图片 URL,让 AI 通过链接看图。
为什么终端不能直接粘贴图片?
终端本质是文本通道。当你按 Ctrl+V 时,终端只读取剪贴板里的文字,图片数据它“看不见”。所以 Hermes 绕了个弯——它直接调用系统工具(如 macOS 的 osascript、Linux 的 xclip)去读剪贴板,绕过终端限制。
图片怎么被 AI 处理?
Hermes 很聪明:如果你当前用的模型支持视觉(如 GPT-4V、Claude、Gemini),图片会以原始像素发送,AI 直接“看”图。如果模型不支持视觉,Hermes 会自动调用辅助视觉工具,先让另一个模型描述图片,再把文字描述注入对话。你完全不用操心这些细节。
小结
复制图片 → 粘贴(或 /paste)→ 提问,三步搞定。不同平台有对应的准备工具,SSH 场景用 URL 或文件路径替代。视觉能力让 Hermes 从“文字助手”升级为“多模态伙伴”。
下篇预告:当图片和文字都能处理之后,Hermes 还能做什么?下一篇我们聊聊它的文件操作能力——让 AI 直接读写你电脑上的文件,敬请期待!
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/persistent-memory