🤖HermesBlog
Hermes 功能详解 · 第20篇2026/8/9· Easy Understand Hermes Agent

第20篇:视觉能力——AI 看懂图片

Hermes 功能详解第20篇:视觉与图片粘贴。直接把图片发给 AI,它能看懂内容并分析。

这篇讲的是:如何让 Hermes Agent 直接“看”你粘贴的图片,并帮你分析、描述或处理它——就像把照片递给一个聪明的助手,它马上能接住并理解。


视觉能力:AI 看懂图片

图片粘贴:就像“递照片”给 AI

想象一下,你正在跟 Hermes 聊天,突然想让它看看你电脑上的截图。你不需要把图片保存成文件再上传,直接复制图片(Ctrl+C / Cmd+C),然后在输入框里粘贴即可

粘贴后,图片会变成一个 [📎 Image #1] 的小徽章,显示在输入框上方。你可以一次粘贴多张图,每张都有独立编号。按 Ctrl+C 可以清空所有已附着的图片。

这些图片会被自动保存到 ~/.hermes/images/ 文件夹,文件名带时间戳,方便你日后查找。


第1步:复制图片

在任意地方复制一张图片到剪贴板——截图、浏览器里的图片、甚至手机传来的图都行。

第2步:粘贴图片(三种方式)

方式一:直接 Ctrl+V / Cmd+V

这是最直觉的方式。Hermes 现在把粘贴当成一个“分层流程”:先试普通文字粘贴,终端没送干净就退回原生剪贴板 / OSC52 文字,最后如果剪贴板或粘贴内容其实是一张图(或图片路径),就自动附着图片。所以像 macOS 截图临时路径、file://... 图片 URI 这类内容,现在能直接变成图片附着,而不是傻傻地留在输入框里当文本。

⚠️ 注意:如果你的剪贴板里只有图片、没有文字,终端还是没法直接传二进制图片数据,请用方式二。

方式二:使用 /paste 命令(最可靠)

在输入框输入:

/paste

然后回车。Hermes 会主动检查剪贴板,把图片拉进来。这是最稳妥的兜底方案,尤其当你的终端“吞掉”了 Ctrl+V 时。

方式三:VS Code 系列终端专用设置

如果你在 VS Code、Cursor 或 Windsurf 里使用 Hermes,输入:

/terminal-setup

它会自动配置好快捷键,让 Cmd+Enter、撤销/重做等操作不被 IDE 拦截。注意只在本地机器上跑,别在 SSH 会话里执行。

第3步:输入问题并发送

图片附着好后,输入你的问题,比如“这张图表说明了什么?”或“帮我看看这个报错截图”,按回车发送。


各平台支持情况一览

环境 直接粘贴 /paste 需要装什么
macOS 终端 / iTerm2 无需配置
Linux (X11) sudo apt install xclip
Linux (Wayland) sudo apt install wl-clipboard
WSL2 (Windows Terminal) 无需配置
VS Code 系列(本地) 建议跑 /terminal-setup
SSH 远程会话 见下文

SSH 远程怎么办? 远程服务器读不到你本地剪贴板。解决办法:把图片上传到服务器(用 scp 或拖拽),或者直接贴图片 URL,让 AI 通过链接看图。


为什么终端不能直接粘贴图片?

终端本质是文本通道。当你按 Ctrl+V 时,终端只读取剪贴板里的文字,图片数据它“看不见”。所以 Hermes 绕了个弯——它直接调用系统工具(如 macOS 的 osascript、Linux 的 xclip)去读剪贴板,绕过终端限制。


图片怎么被 AI 处理?

Hermes 很聪明:如果你当前用的模型支持视觉(如 GPT-4V、Claude、Gemini),图片会以原始像素发送,AI 直接“看”图。如果模型不支持视觉,Hermes 会自动调用辅助视觉工具,先让另一个模型描述图片,再把文字描述注入对话。你完全不用操心这些细节

想手动控制这个行为,可以在 config.yaml 里设 agent.image_input_mode

  • auto(默认):模型支持视觉就发像素,否则走描述路径。
  • native:永远发像素,哪怕目录里说这个模型只支持文本。
  • text:永远走描述路径,绝不把像素塞给主模型。

如果某个后端能收文字但拒收图片(比如 openai-codex 遇到图片请求直接报 server_error),就把 auxiliary.vision 指向另一个支持视觉的 provider 和模型,图片就会自动改走描述路径。

另外,vision_analyze 工具本身也遵循同样的路由:主模型支持视觉、且它的 provider 支持在工具结果里带图片时(目前是 Anthropic、OpenAI、Azure-OpenAI 和 Gemini 3.x 这几套),它会跳过辅助描述模型,直接把原始像素作为多模态工具结果返回,主模型下一轮就能原生看到图——没有额外调用、没有文字摘要的信息损失、也没有额外延迟。


图片太大、调用太多?两个小开关

原生嵌入的图片会跟着会话一路重发,所以有两个 config.yaml 键帮你控制成本:

vision:
  embed_target_bytes: 262144   # 单次嵌入的字节预算,默认 256 KB
  max_calls_per_image: 3       # 不设则子代理限 3 次,主代理不限
  • embed_target_bytes:超过预算(或宽度超过 1568 px)的图会被压成 JPEG。普通截图 256 KB 够用;如果模型老说表格“看不清”,就调大一点(比如 1048576)。
  • max_calls_per_image:同一张图(含局部裁剪)每个会话最多嵌入几次。到上限后工具会直接拒绝,让模型用已经看到的内容作答。设 0 表示不限。

小结

复制图片 → 粘贴(或 /paste)→ 提问,三步搞定。不同平台有对应的准备工具,SSH 场景用 URL 或文件路径替代。视觉能力让 Hermes 从“文字助手”升级为“多模态伙伴”。

下篇预告:当图片和文字都能处理之后,Hermes 还能做什么?下一篇我们聊聊它的文件操作能力——让 AI 直接读写你电脑上的文件,敬请期待!

📖 官方文档

本文根据 Hermes Agent 官方文档编写,原文见:官方文档 › user-guide/features/vision