上周(6/29 - 7/5)AI 圈出了不少大事。我挑几条跟 Hermes 最相关的,顺便聊聊我的感受。

Hermes v0.18.0 "The Judgment Release"——团队疯了一把

7月1日,Nous Research 发布了 Hermes Agent v0.18.0,代号「Judgment Release」。说疯,是因为团队在十二天里干了一件离谱的事:把仓库里 所有 P0 和 P1 的 issue + PR 全部清空了

什么概念?3 个 P0 的 issue、8 个 P0 的 PR、493 个 P1 的 issue、188 个 P1 的 PR,总共接近 700 个最高优先级的任务。零个遗留。

从 v0.17.0 到现在,1,720 个 commit、998 个合并的 PR、2,215 个文件改动、25 万行新增、370 多位贡献者。数字说得过去,但更关键的是方向。

几个我觉得比较有意思的变化:

MoA(Mixture-of-Agents)成一级公民了。 以前 MoA 是个模式,你要手动切换。现在它直接出现在 model picker 里,跟 Claude、GPT、Grok 并列。选一个预设的模型委员会,你的 prompt 自动路由过去,每个参考模型的输出都会展示出来,最终答案实时流式呈现。说白了——你那些拿不准的问题,可以让好几个模型一起给你拿主意。

/goal 加上了 completion contracts。 以前 /goal 告诉 Hermes 该干什么,但怎么算"干完了"得靠猜。现在你可以定义一个明确的完成条件,循环会自动判断。这个看着小,但实际用起来差别很大——之前经常遇到 agent 说"做完了"但回头一看只跑了半截的情况。

/learn 和 /journey。 /learn 能把工作流自动变成可复用的 skill。/journey 让你能看到 agent 过去积累了哪些记忆和技能。对我来说最有价值的是后者——Hermes 跑久了之后,你到底学了什么?有没有跑偏?直接翻出来看看。

还有背景 subagent。 之前派 subagent 出去干活,你得等着。现在可以后台执行,不耽误主线任务。

回顾一下这周的 commit 分布:Bug 修复 483 个、新功能 115 个、测试 60 个、文档 39 个、重构 27 个。热门模块是 desktop(102)、gateway(71)、agent(44)。Gateway 的改动量不小,看 release notes 说实现了 scale-to-zero 和 drain coordination,终于能正经部署了。

说实话,清 P0/P1 这件事本身值得一个 respect。开源项目做了大半年,bug 堆起来是常态。能停下来,专门花两周把所有高优问题解决掉——这不是技术问题,是态度问题。

升级命令:

hermes update

美团开源 LongCat-2.0——国产算力里程碑

6月30日同一周,美团放了个大招。

LongCat-2.0,总参数量 1.6T(万亿级),采用 MoE 架构,动态激活参数约 48B。原生支持 1M token 超长上下文。训练是在 5 万卡国产算力集群 上完成的——这是业界第一个完全依托国产算力跑通从预训练到推理全链路的万亿参数模型。

而且,全面开源

几个数据点:
- OpenRouter 平台累计调用量全球前三
- Hermes 评估体系月度调用量全球第一
- Claude Code 基准下月度调用量全球第二(仅次于 Claude Opus 4.8)

美团还公布了训练过程中的一些工程细节:月均单日训练中断率通过自研 HCCL 容错机制降低了七成以上,模型训练 MFU 提升到原来的 1.5 倍。

30 万亿 tokens 的训练数据,万卡集群。把这些数字串起来,含义很清楚:国产算力在超大规模模型训练这条路上,已经能实打实地跑了。

余承东挂帅开源盘古 2.0——华为亮底牌

同样是 6 月 30 日,华为在 HDC 2026 上由余承东亲自发布了 openPangu-2.0-Flash。

参数规模 92B(MoE,激活参数约 6B),支持 512K 上下文。基于昇腾 NPU 训练。注意 Flash 只是小版本,Pro 版本 505B 参数、激活 18B,7 月份上线。

余承东在发布会上的原话挺有意思:

去年国庆节前夕,公司又让我来负责这个大模型。我会带领团队一路赶超,从中国第一,走向将来的世界第一。在我余承东的字典里没有第二,只有第一。

他还回顾了华为 2021 年发布盘古大模型的历史——当时是国内第一个,也是全球最早的大模型之一。"后来没做好,不应该。" 这个评价挺坦诚。

不过不得不提一句,华为的 openPangu 授权协议(OPENPANGU MODEL LICENSE VERSION 2.0)跟标准开源协议不太一样,有额外的商用限制条款。真用到生产环境的话,建议仔细看看 LICENSE。

评测数据倒是挺能打:AIME 2026 得分 93.3(思考模式)、SWE-bench Verified 63.1、GPQA-Diamond 83.7。在国产模型中属于第一梯队。

DeepSeek + 北大开源 DSpark——推理速度翻倍

6 月 28 日,DeepSeek 团队联合北京大学开源了 DSpark(Confidence-Scheduled Speculative Decoding)。

这套推测解码方案实测数据是:DeepSeek-V4-Flash 提速 60%-85%,V4-Pro 提升 57%-78%。而且不只是 DeepSeek 自己的模型,Qwen3-4B/8B/14B 和 Gemma4-12B 也验证有效。

随 DSpark 一起开源的 DeepSpec 代码库(MIT 许可),包含了训练和评估推测解码草稿模型的全套工具。这个对中小企业来说挺有意义——不需要自己搞一套底层优化,直接复用即可。

注意一个细节:论文作者名单里有 DeepSeek 创始人梁文锋。刚拿了 500 亿融资还亲自写技术论文,这个确实不多见。

微软 HARC 安全对齐——选了 Qwen 做基座

7 月 2 日,微软在 Hugging Face 上发布了 HARC-Qwen2.5-7B-Instruct。

这不是从零训练的模型,而是把微软的安全对齐方法 HARC(Harmfulness and Refusal Directions Coupling)的 LoRA 权重合并到通义千问 Qwen2.5-7B 上。Apache-2.0 许可。

有意思的在于信号意义:微软作为 OpenAI 的主要投资方,安全对齐研究却选了竞争对手阿里旗下的 Qwen 做基座。 这打破了巨头之间技术栈壁垒分明的印象。前端安全研究正在从单一模型内部优化,走向跨模型、跨组织的技术复用。

豆包 / 千问智能体下线——监管落地

7 月 4 日,字节跳动的豆包和阿里旗下的千问同时弹窗通知:智能体功能将于 7 月 15 日 下线。

这条新闻跟当天的法规撞上了——正是《人工智能拟人化互动服务管理暂行办法》生效的日期。

所谓"智能体",在豆包和千问的场景里,指的是用户可以自定义人设和规则的 AI 聊天角色。这个功能一直处于灰色地带:软色情、情感依赖、未成年保护……监管要管是早晚的事。

字节的做法是把业务迁移到猫箱 App,走独立的合规体系。阿里暂时没有给出替代方案。

"7 月 15 日"这个日期值得留意——可能是国内 AI 拟人化服务的一个分水岭。


有意思的一周。

顶级开源项目在卷质量(Hermes 清 P0/P1),国产模型在卷规模(LongCat 万亿参数),在卷落地效(DSpark 推理加速),也在卷合规(智能体下线)。

至于 Hermes,v0.18 让我最想试的是 MoA 预设和 /journey。这周有空跑一下看看。

你的 Hermes 升级到 v0.18 了吗?有什么有意思的发现欢迎聊聊——我整理到后续文章里。


🛑 质检员合规自检表

数据项来源
Hermes v0.18 commits/PRs/issuesGitHub Release v2026.7.1 {数据来源: github.com/NousResearch/hermes-agent/releases}
美团 LongCat-2.0 1.6T 参数/5万卡/30T tokensAIToolly / ZOL报道 {数据来源: aitoolly.com, ai.zol.com.cn}
openPangu-2.0-Flash 92B/512K/评测分数Hugging Face openPangu-2.0-Flash 页面 {数据来源: huggingface.co/openpangu/openPangu-2.0-Flash}
DSpark 60%-85% 提速科创板日报 / DeepSeek论文 {数据来源: m.cls.cn/detail/2411046}
微软HARC-Qwen2.5-7Breadaitime.com {数据来源: readaitime.com/news/2026-07-02/1aor2sh9}
豆包/千问智能体7月15日下线财新网 {数据来源: companies.caixin.com/2026-07-04/102460931.html}

更多推荐