Hermes 杀疯了:12天干掉700个紧急Bug,还承诺永远清零
Hermes 杀疯了:12天干掉700个紧急Bug,还承诺永远清零
1720次提交、998个PR、381位贡献者、12天清零全部P0/P1。一个开源项目的极限操作,到底干了什么?
01 先把数字摆出来
7月1日,Nous Research 发布了 Hermes Agent v0.18.0,代号"The Judgment Release"——审判日版本。
名字嚣张,但数据更嚣张:
| 指标 | 数值 |
|---|---|
| 提交数 | ~1,720 |
| 合并 PR | 998 |
| 文件变更 | 2,215 |
| 新增代码 | ~251,000 行 |
| 删除代码 | ~41,000 行 |
| 关闭 Issues | 949 |
| 贡献者 | 381(370+ 来自社区) |
这不是一个季度的数据——这是从 v0.17.0 到一个版本的增量。
运维视角:251K 行新增代码什么概念?相当于一个中等规模项目的全部代码量,塞进了一个版本。我见过太多项目发版就发个"Bug fixes and improvements",这个团队是真敢往里塞。
02 最狠的:12天清零全部P0/P1
这个版本最核心的故事不是新功能,而是一个工程管理上的变态操作。
过去一周半,团队把几乎所有精力砸在一件事上:解决 Hermes Agent 仓库里每一个 P0 和 P1 级别的 Issue 和 PR。
结果:
| 优先级 | Issues 关闭 | PRs 合并 |
|---|---|---|
| P0(致命) | 3 | 8 |
| P1(高优) | 493 | 188 |
| 合计 | 496 | 196 |
≈700 个最高优先级条目,全部清零。
发布那一刻,整个仓库零个 P0、零个 P1。最后一个修复的是一个中断保护压缩的 fork bug(issue #56391),修完就发了版。
而且团队公开承诺:从今以后,维持 P0/P1 永久为零。
我在运维圈混了 11 年,说实话,敢公开做这种承诺的开源项目,一只手数得过来。大部分项目都是"积压越多越不想看,越不想看积压越多"的死循环。
运维视角:这就像把监控里所有 Critical 和 Warning 告警全部处理干净,一条不剩,然后立 flag 说"以后也不会有了"。你敢吗?我反正不敢。但人家做到了,而且是在 370+ 个外部贡献者同时提 PR 的混乱局面下做到的。社区贡献者 @kshitijk4poor 一个人就带队修了 cron 可靠性、压缩 fork、凭证泄露防护等一大堆 P1,堪称卷王。
03 Mixture-of-Agents:多模型协作终于不是玩具了
MoA(多智能体混合)不是新概念,但这一版把它做成了一等公民。
之前用 MoA 要配一堆东西,现在直接在模型选择器里选——和选 Claude、GPT、Grok 一样简单。给它起个名字比如"my-council",就能像用单个模型一样用。
更关键的是透明性:
- 每个参考模型(GPT-5、Claude、Grok 等)的完整输出,以带标签的独立块展示
- 最终聚合答案流式输出,不用等所有模型跑完才出结果
- 所有模型共享工具调用状态,不是各说各话
用大白话说:你让一个"AI 专家组"讨论问题,你能看到每个人说了什么,最后的主持人实时总结——而不是等半小时吐一大坨出来。
运维视角:这就像你同时找了三个 DBA 看同一个慢查询,老张说"缺索引",小李说"锁竞争",老王说"Buffer Pool 不够"。以前 AI 只会给你其中一个答案,现在你全看到了,还能对比。运维排错最怕的就是单点判断——多一双眼睛永远更好。
04 "我修好了" → "测试通过了,这是证据"
AI 写代码最大的毛病是什么?"我觉得应该没问题了。"
这一版 Hermes 加了一套验证机制:
- 写代码之后,实际跑项目测试,而不是用模型自己判断"我改对了"
/goal命令支持完成契约:你定义"怎样算搞定",Agent 对照硬证据判断完成度,而不是随便停pre_verify钩子:你可以接入自定义验证脚本
翻译成人话:以前 Agent 说"改好了",你得上线跑了才知道是不是真的好了。现在 Agent 说"改好了",测试结果就贴在旁边。
运维视角:这 TM 才是正确的。运维最烦的是什么?开发说"我测过了没问题",结果一上线就炸。验证不是靠嘴说的,是靠 CI 绿了没有、监控有没有异常。AI 终于学会了这一点。
05 /learn:让 AI 自己写技能,别再手搓了
用过 Hermes 的都知道,Skills 是核心能力——定义好一个技能,AI 就能按 SOP 执行复杂任务。
但写技能是体力活。
现在有了 /learn 命令:指一个目录、一个 URL、或者最近的工作流,AI 自动提炼成可复用的技能,而且会自动遵守你项目里的 CONTRIBUTING.md 规范。
配套的 /journey 命令更直观——展示 Hermes 积累的所有记忆和技能的时间线,桌面端还有一个可交互的径向记忆图,不再是一个黑盒。
运维视角:这不就是运维知识库的自动化吗?以前新人入职,老运维口传心授,或者翻 Wiki。现在你带 AI 排查一次故障,它就自己写成 SOP 存起来了,下次遇到直接复用。这才是 AI 该干的事。
06 其他值得关注的更新
| 功能 | 一句话 |
|---|---|
| 🖥️ 桌面端编程驾驶舱 | 多终端面板、PR 风格 diff、内嵌编辑器、Git worktree 管理 |
| 🌐 Gateway 生产级伸缩 | Scale-to-zero 空闲休眠 + 优雅下线,升级不断连 |
📝 /prompt 编辑器 | 调用 $EDITOR 写多行 Prompt,告别单行输入框 |
| ☁️ Google Vertex AI 原生接入 | 服务账号自动换 OAuth2 Token,无需静态 API Key |
| 🔒 安全加固 | MCP 配置持久化锁定、Cron 凭证防泄露、Slack Token 脱敏、aiohttp CVE 修复 |
| 🔧 后台子代理并行 | delegate_task 多个子代理后台并发,不阻塞聊天 |
07 升级指南
# 如果你用的是 npm 发行版
npm install -g hermes-agent@latest
# 如果用的是 Docker
docker pull nousresearch/hermes-agent:v2026.7.1
# 如果用的是 pip
pip install --upgrade hermes-agent
升级后建议跑一次配置兼容性检查:
hermes doctor
08 写在最后
这个版本让我感触最深的不只是功能,而是一种工程态度。
大多数开源项目到了 370+ 贡献者的规模,Issue 积压是常态,P1 永远清不完也是常态。但 Nous 团队选择了最不性感、最不"可宣传"的一件事来做:还清技术债。
700 个高优条目,12 天清零,然后公开承诺"以后也是零"。
这不是炫技,这是给自己上镣铐。
作为一个管了 11 年服务器的运维,我太清楚"告警清零"需要多大的决心和执行能力。那些 P1 里肯定有挂了半年的陈年老 Bug,有说不清是谁的锅的边界条件,有"能跑就别动"的设计缺陷。
但他们全修了。
这种态度,比任何一个新功能都更让我对这个项目有信心。
参考来源: