Hermes 路线图:给 AI 装上体检报告系统
Hermes 官方路线图第8篇:结构化可观测性——每次运行的耗时、成本、失败原因全可查。
AI 干活慢、费钱、失败,最气人的是不知道卡在哪一步。Hermes 的路线图里,要给每次运行装上“黑匣子”——哪个环节慢、烧了多少 token、为什么失败,事后全查得到。
这个方向是什么:给 AI 的每一次“出差”写工作日志
想象你是一家公司的老板,派了一位全能助理(AI)去办一件复杂的差事:订机票、联系客户、查资料、写报告、发邮件。助理回来告诉你“办好了”,但你想知道:机票在哪家订的?客户电话打了多久?资料查了几次?邮件发出去没有?如果助理办事特别慢或者花超了预算,你甚至不知道是哪个环节出了问题。
结构化可观测性,就是给这位助理配一本强制填写的“工作日志”。不是让他事后回忆,而是每走一步,系统自动记录:此刻在做什么、调用了哪个工具、花了多少钱、用了多少时间、结果如何。这本日志不是给人看的流水账,而是可以按“会话”“工具”“供应商”分类检索的数据库。
Hermes 这次规划的方向,就是把这本“日志”从可选的辅助功能,变成核心引擎里自带的标准配置。就像飞机上的黑匣子,平时不显眼,但一旦需要排查问题,它就是唯一的真相来源。
官方规划了哪些事:从“记什么”到“怎么用”
规划里最基础的一件事,是给所有关键动作打上“结构化 spans”。你可以把 span 理解为日志里的一条带时间戳的条目。模型调用是一条,工具调用是一条,插件钩子是一条,记忆调用是一条,甚至连消息投递到哪个平台都有一条。这些条目不是孤立的,而是像套娃一样嵌套:一次运行是一个大盒子,里面装着“调用模型”“调用工具”“发送结果”几个中盒子,中盒子里还有更细的小盒子。这样,任何一步出问题,都能顺着盒子一层层剥开,精确到毫秒级定位。
第二件事,是给这些日志加上“财务和绩效标签”。每次调用大模型,花了多少 token、折合多少钱、耗时多久,全部按会话、按工具、按供应商、按平台自动归集。这就好比助理的每一笔差旅费都自动记到对应的项目编号下,月底一看报表,哪个客户最烧钱、哪家航空公司最慢,一目了然。官方特别提到了“慢工具/慢 provider 诊断”,意思是系统会自动标记那些响应时间异常长的环节,不用你手动对比历史数据。
第三件事,是记录“决策路径”。比如,当首选模型供应商超时,系统自动切换到备用供应商,这个过程会留下一条完整的“fallback 决策”记录:为什么切换、切换时等了多久、备用供应商表现如何。这就像助理在出差时临时改签航班,日志里要写明原航班延误了多久、改签后是否准时到达。同时,prompt 缓存命中情况也会被记录——如果缓存命中了,说明这次没花钱重新计算,这对成本分析至关重要。
最后,规划里提到“导出运行包”。这相当于把一次运行的所有日志、输入输出、配置参数打包成一个文件。这个包可以用来调试,也可以发给支持团队分析。官方特别强调了两条红线:一是可观测性默认关闭,只有你主动开启才会记录和上传数据,绝不在你不知情时把日志发到外部;二是调试包里默认不包含任何密钥,即使你把这个包发给别人,对方也拿不到你的 API 密钥或敏感信息。
验收标准很简单:操作员要能回答三个问题——这次运行为什么慢?为什么贵?为什么失败?只要这三问能通过日志得到答案,这个功能就算合格。
对用户意味着什么:从“猜”到“查”,从“认栽”到“索赔”
以前,AI 模型跑得慢,你只能干等;跑得贵,你只能看账单发呆;跑失败了,你只能重试。有了结构化可观测性,你第一次有了“事后复盘”的能力。下次再遇到“AI 突然变笨”的情况,你可以打开日志,看到底是记忆检索没找到关键信息,还是工具调用超时,还是模型供应商临时抽风。
对于开发者来说,这意味着调试时间从“小时级”缩短到“分钟级”。对于普通用户,这意味着你可以理直气壮地追问:“为什么这次花了这么多钱?”——而答案不再是“模型成本波动”,而是精确到“你在第三步调用了三次同一个工具,每次都重复计算了相同的长文本”。
更贴心的是,隐私保护被写进了设计原则。日志默认留在本机,只有你明确同意才会发送遥测数据;导出的调试包也经过了脱敏处理。这就像助理的工作日志虽然详细,但涉及你隐私的对话内容会被自动打码,只有你本人能看到全文。
总而言之,Hermes 正在把“AI 的可解释性”从一句口号,变成一件可以实际使用的工具。它不是为了让 AI 更聪明,而是为了让 AI 的每一次“犯傻”都有据可查。对于所有依赖 AI 干活的人来说,这大概是最实用的“售后保障”了。
📖 官方文档
本文根据 Hermes Agent 官方文档编写,原文见:GitHub ›/issues/35923