Hermes Agent 0.20 发布:从「打字聊天」到「开口说话」,这个 AI 助手终于像个真人了

大家好,我是老张。
你有没有这种感觉——跟 AI 助手聊天,总是差点意思?
你打字,它回复。你等它生成完,再看一大段文字。明明是对话,却更像在写邮件。偶尔想打断它说"不对,不是这个方向",发现只能 /stop 重新来。
今天聊的这个项目,老张已经用了快半年——Hermes Agent,刚刚发布了 v0.20.0(代号 2026.8.3)。225k Star,43.5k Fork,3650 个 commit,1400 个 PR,647 位贡献者——这是 Hermes 史上最大的一个版本,而且它解决的就是上面说的那些"差点意思"。
📊 项目速览
| 项目 | 详情 |
|---|---|
| GitHub | NousResearch/hermes-agent |
| Star | 225k ⭐ |
| 版本 | v0.20.0 (2026.8.3) |
| 技术栈 | Python + Node.js (Desktop) |
| 协议 | MIT |
| 安装 | pip install hermes-agent 或 Shell 一键脚本 |
🚀 这次更新,我挑 6 个最重要的聊
1️⃣ 语音对话——终于能像跟人说话一样了
以前 Hermes 的语音模式:你说一句 → 等它生成完 → 听一长段语音。跟打语音留言差不多。
现在完全不一样了:
- 边说边生成:回复一边生成一边说出来,不用等整段生成完
- 随时打断:你直接开口说话,它就会停下来听你说,模型知道被打断了
- 唤醒词:喊"Hey Hermes"就开始听,检测在本地跑,音频不出你的机器
- 全平台支持:飞书、微信、WhatsApp 发语音都能识别+文字回复
说实话,这体验终于对得起"对话"两个字了。你可以在终端里用它,从房间另一头喊它——终端会听你说话了。
2️⃣ 桌面端变身工作台——不只是聊天窗口
桌面端之前就是个聊天框。现在变成了一个真正的工作台:
- Artifacts 卡片:Agent 生成的 HTML/应用直接在右侧预览,沙箱隔离
- 插件 SDK:可以开发自己的桌面插件,Kanban 就是第一个官方插件
- 全局快捷键快速输入:任何地方按快捷键,弹出输入框,消息直达 Hermes
- 多窗口:可以同时开多个会话窗口和预览
简单说,Hermes 桌面端从一个"聊天客户端"变成了一个"开发工作站"。你在让它写前端的同时,右边就能实时预览效果。
3️⃣ Agent 之间能对话了——A2A 协议
这是老张觉得比较有想象力的一点。
Hermes 现在实现了 Agent-to-Agent (A2A) v1.0 协议。翻译成人话就是:一个 Hermes Agent 可以跟另一个 Agent 对话、协作、互相调用。
比如你有一个专门做代码审查的 Agent,一个专门做测试的 Agent,一个专门写文档的 Agent。以前你得分别跟它们聊。现在 Hermes 可以自动发现它们,把任务分过去,汇总结果回来。
这个协议是标准的,不同框架的 Agent 也能互通——不限于 Hermes。
4️⃣ 工具自己修自己——少浪费 Token
这可能是运维最关心的——工具调用失败时的处理。
老张用 AI 助手最烦的事:一个命令执行输出被截断了,Agent 不知道,继续往下操作;一个文件搜索没找到结果,Agent 以为文件不存在;patch 编辑失败,Agent 反复重试同样的操作。
v0.20.0 做了一波"工具自愈"升级:
- 终端输出截断 → 自动存到文件,Agent 可以读取完整内容
- patch 已应用的编辑 → 返回"已存在",不重复操作
- 搜索零结果 → 自动尝试近似匹配,给出备选建议
- 文件写入 → 立即验证磁盘内容是否正确
少浪费 Token = 少花钱 = 运行更稳定,这对实际使用体验的提升非常大。
5️⃣ 命令行变身——运维的瑞士军刀
CLI 端也加了一波实用命令:
| 命令 | 功能 |
|---|---|
| !command | 直接执行 shell 命令,不走 Agent 回合,秒回 |
| /init | 扫描项目,自动生成 AGENTS.md |
| /diff | 查看改动(staged / 全部 / 当前会话) |
| /context | 拆解当前上下文窗口占用了多少 Token |
| /focus | 精简输出模式,长输出可以收起 |
| Ctrl+S | 暂存半条没写完的 prompt |
还有 hermes import-agent,一键从 Claude Code 或 Codex CLI 迁移配置到 Hermes。
6️⃣ 压缩更聪明,长会话也不卡
这是底层优化,但直接影响体验。
以前上下文压缩是"一次性大暂停",压缩的时候整个 Agent 卡住。现在改成了每轮微压缩——摊到每轮对话里做,不再有那一大段等待。
另外,压缩后保证最近 N 条用户消息一定不会被裁掉,不会出现"聊着聊着 Agent 忘了刚才在说什么"的情况。压缩阈值现在还能按模型单独配置。
🛠️ 安装/升级
如果你已经在用:
pip install --upgrade hermes-agent
hermes update
如果是新装:
curl -fsSL https://get.hermes-agent.com | bash
桌面端从 GitHub Releases 下载对应平台的安装包。
💡 老张的评价
✅ 这次更新最实在的地方
- 语音体验质变:不是加了个功能,是把整个语音交互重做了一遍,真的能用了
- 桌面端不再是聊天框:Artifacts + 插件 + 快速输入,工具属性拉满
- 工具自愈:解决的是"AI 用工具经常出错"的核心痛点,直接影响效率
- 性能翻倍:冷启动 14s → 1.8s,这个数字说明他们真的在优化底层
⚠️ 值得注意
- 版本号从 0.19 跳到 0.20,但这个版本改动量非常大,升级后建议重新检查配置
- 语音功能需要额外安装依赖(STT/TTS 引擎),不是 pip install 完就能用的
- 桌面插件 SDK 还在早期,开发文档可能不够完善
🎯 适合谁用?
| 场景 | 推荐程度 |
|---|---|
| 日常 AI 编程助手 | ⭐⭐⭐⭐⭐ |
| 运维自动化(脚本生成、日志分析) | ⭐⭐⭐⭐⭐ |
| 多 Agent 协作开发 | ⭐⭐⭐⭐ |
| 语音交互场景(开车/做饭时用) | ⭐⭐⭐⭐ |
| 企业内部 AI 工作台 | ⭐⭐⭐⭐ |
🔗 资源汇总
💬 互动话题
- 你用 AI 助手最受不了的一件事是什么?老张是"截断的输出它不知道"。
- Agent 之间能对话了,你想让它们帮你干什么?
- 用过 Hermes 的兄弟们,这个版本你升级了吗?体验怎么样?
欢迎评论区聊聊 👇