2026 年 7‑8 月大模型技术前沿汇总|LLM / 多模态世界模型 / 语音音频模型新进展
📝 说明:本文整理近期海内外主流厂商开源 & 闭源模型动态,涵盖大语言模型、多模态 & 世界模型、语音音频三大板块,包含模型架构、关键参数、性能指标、开源协议、API 定价与落地信息,适合技术从业者快速跟进行业最新动态。
一、大语言模型与推理技术进展
本章节聚焦 MoE 大模型、Agent 代码智能体、开源权重融合争议事件,国内腾讯、美团相继放出重量级开源 MoE 模型,海外聚焦软件工程智能体能力。
1. 腾讯混元发布并开源 Hy3 大模型
腾讯混元正式发布 Hy3 正式版,采用 MoE 混合专家架构,总参数 295B,激活参数 21B,上下文窗口 256K,以 Apache 2.0 协议完全开源。
核心优化集中在后训练数据质量与 RL 算力规模,Agent、推理、长上下文能力可对标 2‑5 倍参数量的旗舰大模型。
- 评测表现:内部 270 位专家盲测得分
2.67/4,优于 GLM5.1;幻觉率从12.5%下降至5.4%,工具调用稳定性、多轮意图保持大幅提升。 - 产品落地:国内元宝 APP 已接入 Hy3,免费提供文件生成、数据分析、网页制作功能。
- 云 API 定价:输入 1 元 / 百万 tokens,输出 4 元 / 百万 tokens;OpenRouter、Nous Portal、CodeBuddy 提供两周限时免费体验。
参考链接:
- https://hy.tencent.com/research/hy3
- https://github.com/Tencent-Hunyuan/Hy3
- https://huggingface.co/tencent/Hy3
2. 美团 LongCat‑2.0 MIT 协议正式开源
美团 LongCat 团队开源 LongCat‑2.0,许可证为宽松的 MIT,完整开放模型权重与推理代码。
- 架构:MoE 1.6T 总参数,推理激活约480B参数,支持100 万 token 超长上下文。
- 定位:Agent 原生大模型,可直接对接 Claude Code、OpenClaw、Hermes Agent 等主流智能体框架。
- 部署:支持 GPU/NPU 推理,已经完成国内大规模生产集群验证。
参考链接:
3. SpaceXAI × Cursor 联合发布 Grok 4.5
SpaceXAI 联合 Cursor 推出面向知识工作场景的通用 Agent 模型 Grok 4.5,MoE 架构,主打软件工程、数据科学、金融法律任务。
- 关键指标:上下文窗口
500k,推理速度80 TPS,Token 效率号称两倍于同类领先模型;官方内部评估能力对标 Claude Opus 4.7,后续计划升级至 1M 上下文。 - 训练特点:引入万亿级 Cursor 真实交互数据,通过真实环境强化学习强化工具调用、bug 修复、结果校验能力。
- 定价:基础版:输入 $2 / 百万 token,输出 $6 / 百万 token;高速版:输入 $4 / 百万 token,输出 $18 / 百万 token。
- 上线渠道:Grok Build、Cursor 全平台、SpaceXAI 控制台;Cursor 订阅用户首周双倍额度。
- 备注:训练数据意外混入 Cursor 代码快照,CursorBench 测评结果不计入官方成绩。
参考链接:
4. Cognition 发布 SWE‑1.7 代码智能体模型
Devin 背后团队 Cognition 发布新一代最强代码智能体 SWE‑1.7,基座基于 Kimi K2.7,依靠大规模强化学习完成迭代,挑战行业 “后训练天花板”。
- 基准成绩:
- FrontierCode 1.1 Main:
42.3%,接近 GPT‑5.5、Claude Opus 4.8 - Terminal‑Bench 2.1:
81.5% - SWE‑Bench Multilingual:
77.8%
- FrontierCode 1.1 Main:
- 核心技术:top‑p 采样重放、跨洲多集群分布式训练、高质量数据清洗流水线、自压缩长上下文;思维链更加精炼,具备完备代码库探查能力。
- 上线:Devin Web / Desktop / CLI 全平台上线,Cerebras 提供 1000 TPS 高速推理版本。
参考链接:
5. Rio‑3.5‑Open‑397B:证实为 Nex 与 Qwen 权重线性融合
里约官方机构 IplanRIO 发布的 Rio‑3.5‑Open‑397B 引发社区争议,Nex‑AGI 团队验证该模型并非独立训练,是 Nex N2 Pro 与 Qwen3.5‑397B‑A17B 按照 0.6:0.4 做线性权重融合。
验证两点证据:
- 移除硬编码系统提示词后,120 次身份提问中 79.2% 自称 Nex,不会自称 Rio,还可以复述 Nex‑AGI 机构信息;
- 权重数学计算,全层权重余弦相似度
0.986‑0.993,排除随机巧合。
事件后续:IplanRIO 更新 HuggingFace 说明,称本应发布蒸馏后版本,误上传原始融合权重并公开致歉;项目澄清没有消耗公共训练经费,属于官方沟通表述偏差。
参考链接:
- https://github.com/nex-agi/Nex-N2/issues/4
- https://huggingface.co/prefeitura-rio/Rio-3.5-Open-397B/commit/a778c1ec4e21180ee55c3ea016a348e549e75f09
二、多模态与世界模型动态
图像生成、统一视觉大模型、具身智能、交互式世界模型集中爆发。字节、蚂蚁灵波连续输出多模态开源成果;Meta 推出 Muse 图像视频系列;Mistral 发布机器人导航模型。
1. 字节跳动 Seedream 5.0 Pro 图像生成模型
字节 Seed 团队发布 Seedream 5.0 Pro 图像生成模型,在图文一致性、文字渲染、人像质感、可控编辑能力大幅升级。四大核心能力:
- 复杂信息可视化:支持图表、时间轴、信息图生成,适配科普、商业海报等高信息密度场景;
- 交互式精准编辑:圈选点选局部修改、草图转图、材质色彩替换、图层分离、多图融合;
- 写实影像与人像:强化光影、材质、皮肤细节,支持摄影摇拍效果,兼顾写实人像与 3A 游戏角色;
- 原生多语种渲染:十多种语言直接生成图像内文字,适配不同语种排版。
上线火山方舟体验中心,后续逐步落地豆包、即梦平台;官方提示像素级编辑、细粒度文字还有优化空间。
参考链接:
2. SeFi‑Image 开源多规格文生图模型系列
SeFi‑Image 开源一套语义优先扩散架构文生图模型,语义与纹理生成流程解耦,语义潜变量先降噪,给纹理生成提供结构锚点。
- 参数规格:
1B / 2B / 5B,每个尺寸提供 Base、RL 对齐版、Turbo 少步蒸馏加速版; - 训练成本:5B 版本仅消耗约 125K A800 GPU 小时,GenEval、LongTextBench 等基准表现不俗;
- 资源开放:推理代码、权重上传 GitHub 与 Hugging Face,支持命令行与 Python API 调用。
参考链接:
3. Meta 发布 Muse Image & Muse Video 预览版
Meta Superintelligence Labs 推出 Muse Image 图像生成模型,同步放出 Muse Video 预览版。
Muse Image 采用 Agentic 设计,推理过程可调用搜索、代码工具,自我纠错;支持精细局部编辑、多参考图合成,可理解 Instagram 社交语境。Arena 榜单文生图、单图编辑、多图编辑三项任务均排名第二。
- 落地:Muse Image 上线 Meta AI 网页 / App、美国区 Instagram Stories、部分国家 WhatsApp,后续接入 Facebook;
- Muse Video 处于预览阶段,面向创作者逐步开放。
参考链接:
- https://ai.meta.com/blog/introducing-muse-image-muse-video-msl/
- https://about.fb.com/news/2026/07/introducing-muse-image-meta-ai/
4. Reve 2.1 图像生成模型
Reve 发布 Reve 2.1,距离上一版本仅一个月。核心改进是结构化布局规划替代纯文本 Prompt,图像规划、精细渲染能力提升,保持 4K 生成质量,训练算力仅为行业常规方案 1/10。
Arena.ai、Design Arena 评测均位列第二,刷新历史分数;目前 API 尚未全面对外开放。
参考链接:
5. SenseNova‑Vision:统一范式视觉多模态模型
SenseNova 发布 SenseNova‑Vision 系列,包含 7B‑MoT 权重、50M 规模数据集、推理代码与技术报告。
创新性把检测、OCR、关键点、深度估计、分割、三维重建全部转化为统一图文生成任务,不需要为每个任务单独设计预测头。
覆盖任务:目标检测、OCR、关键点检测;深度、法向量稠密几何;各类分割;多视图三维重建。
COCO、NYUv2、RefCOCO 等基准达到或接近 SOTA;许可证 CC BY‑NC 4.0,仅限非商业。
⚠️注意:不是单项任务最优,结果依赖解析规则,对提示词敏感,几何预测结果需要二次校验。
参考链接:
- https://github.com/OpenSenseNova/SenseNova-Vision
- https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT
6. 蚂蚁灵波 LingBot‑Vision + Depth 2.0 深度补全
蚂蚁灵波发布 LingBot‑Vision 自监督视觉基础模型,以及 LingBot‑Depth 2.0 深度补全模型。
- LingBot‑Vision:掩码边界建模,无需人工标注学习亚像素边界;蒸馏 S/B/L 三个版本,NYUv2 深度估计 RMSE 达到
0.296,优于 DINOv3‑7B; - LingBot‑Depth 2.0:掩码深度任务建模,透明、反射物体重建效果提升,DIODE‑Indoor 数据集 RMSE 相比前代减半。
全部开源,Apache2.0 协议,提供 pip 包、Python 接口与可视化 demo。
参考链接:
7. 蚂蚁灵波 LingBot‑Video:具身智能 MoE 视频基础模型
面向机器人具身智能的开源 MoE 视频基座 LingBot‑Video:
- 架构:单流 DiT + Sparse MoE,总参数 30B,激活仅 3B;1M token 序列推理速度为稠密模型 3.18 倍,适配机器人实时仿真;
- 训练:互联网视频预训练 + 7 万小时具身数据,奖励对齐优化物理真实性;
- 评测:RBench 视频生成基准得分
0.620排名第一,优于 Wan2.6、Seedance 1.5 Pro; - 开源协议 Apache2.0,放出 Dense‑1.3B、MoE‑30B‑A3B 与 Qwen 重写器全套权重。
参考链接:
8. 蚂蚁灵波 LingBot‑World 2.0 交互式世界模型
LingBot‑World 2.0 主打长时间可交互开放世界生成,实现小时级生成无明显视觉漂移。
- 性能:720p@60fps 流式输出,亚秒级控制延迟;
- Agentic Harness 双智能体:Pilot Agent(玩家视角)+ Director Agent(导演视角);支持自由探索、战斗、多人协同、事件触发;
- 开源版本:14B causal‑fast 权重,CC BY‑NC‑SA 4.0,仅限非商业;可通过 Reactor、灵光移动端体验;完整演示将在 WAIC2026 上海展出;
⚠️局限:公开版功能不全,长期记忆、真实物理仿真仍有短板。
参考链接:
9. Mistral Robostral Navigate 具身导航模型
Mistral 首款机器人导航模型 Robostral Navigate,8B 参数。 仅依靠自然语言指令 + 普通 RGB 摄像头,不需要深度相机、LiDAR,就可以驱动轮式、足式、飞行机器人在未知环境导航。跨机型、摄像头参数泛化,R2R‑CE 未见环境导航成功率76.6%。
当前仅企业合作渠道,不开源、无公开 API。
参考链接:
三、语音与音频专用模型进展
实时 ASR、全双工语音、多说话人转录、小语种语音模型集中更新;阿里、小米持续迭代国内方言识别;OpenAI 连续发布两代实时音频能力。
1. 阿里 Fun‑ASR‑Realtime 实时语音识别升级
阿里升级实时 ASR 模型 Fun‑ASR‑Realtime:
- 首字延迟控制百毫秒级别,识别精度逼近离线版本,支持上下文自我纠错;
- 支持 30 种语言、16 种汉语方言,方言平均字符准确率
88.62%;工业场景中文88.42%,英文91.58%,东南亚语言专项优化; - 离线版本 Fun‑ASR‑Flash 在 Artificial Analysis 字错率低至
1.7%全球第一; - 落地案例:支撑影视飓风百小时直播实时字幕生成;阿里云百炼开放体验。
参考链接:
2. OpenAI GPT‑Realtime‑2.1 / 2.1‑mini 实时音频模型
OpenAI 发布两代 Realtime 音频 API 模型,上线 Playground 与开发者 API:
- GPT‑Realtime‑2.1:增量迭代,优化字母、数字信息识别;
- GPT‑Realtime‑2.1‑mini:mini 系列首次支持推理、工具调用,维持原有定价;
- 底层缓存优化,全系列 p95 延迟下降至少 25%。
参考链接:
3. OpenAI GPT‑Live:新一代全双工语音交互
GPT‑Live 实现真正边听边说全双工对话,分为 GPT‑Live‑1 / GPT‑Live‑1‑mini。 复杂推理、搜索、Agent 任务异步交给 GPT‑5.5 处理,保障语音对话流畅。
- 用户策略:ChatGPT 付费用户默认 GPT‑Live‑1,免费用户默认 mini 版本;API 需要登记等待开放通知;
- 限制:暂不支持视频、屏幕共享;部分语种口音、流利度存在缺陷。
参考链接:
4. Cohere 开源阿拉伯语 ASR 模型 Cohere Transcribe Arabic
2B 参数 Conformer 架构,专门针对阿拉伯语多方言优化,同时支持英语、阿英混合语码场景。 Open Universal Arabic ASR Leaderboard 平均 WER 25.87,优于 Whisper、OmniASR;人工评测 96% 偏好度高于竞品。 Apache2.0 开源,HuggingFace 开放权重,支持 transformers、vLLM 部署。
参考链接:
5. xAI Grok Voice 新增 21 款旗舰语音音色
xAI 更新 Grok Voice,新增 21 套旗舰 TTS 音色,同时重训练 Ara、Eve、Leo、Rex、Sal 原有 5 套语音,优化节奏、重音、自然度。 全部支持 25 + 语言,面向客服、角色配音、解说、教育讲解场景优化;在 Voice Agent API、TTS API、Grok Voice Agent Builder 可用;支持[pause]、<whisper>等标记控制语音效果。
参考链接:
6. 小米 MiMo‑V2.5‑ASR 开放 API 与 Token 订阅
小米 MiMo‑V2.5‑ASR 正式开放 API,接入 Token Plan 订阅套餐。
- 能力:中英双语,粤语、吴语、闽南语、四川话等方言;支持中英混合、歌词转写、远场噪声、多人重叠说话;多项基准行业领先;
- 计费:按量计费 0.5 元 / 小时;包月包年 Token Plan,一次订阅解锁 MiMo‑V2.5 全系列模型,适合高用量业务。
参考链接:
7. MOSI 开源端到端多说话人音频 MOSS‑Transcribe‑Diarize‑0.9B
0.9B 版本开源,Pro 版本暂不开放,后续走 API 服务。
- 架构:Whisper‑Medium 编码器 + Qwen3‑0.6B 解码器,端到端一体化,不再是传统 ASR + 说话人分离级联;输出带时间戳、说话人 ID 完整 SRT 转录;
- 能力:128K 上下文,最长处理 90 分钟音频,支持热词提示;
- 评测:AISHELL‑4、Alimeeting、播客、电影数据集字错率、说话人匹配效果优于主流方案;
- 部署:vLLM、SGLang Omni 支持;单张 H100 可达近百倍实时速度;附带 web 工具,支持 SRT/ASS 导出、视频烧录字幕。
参考链接:官方项目主页
四、行业小结(CSDN 增加的总结段落)
🔍 近期行业几个明显趋势:
- 国内开源 MoE 爆发:腾讯 Hy3、美团 LongCat‑2.0 接连放出大参数量 MoE 开源模型,超长上下文、Agent 能力成为标配;
- 具身与世界模型快速落地:蚂蚁灵波连续输出视觉、视频、交互式世界模型全套开源栈,世界模型从概念走向可交互原型;
- 代码智能体继续内卷:SWE‑1.7 进一步缩小开源与顶级闭源代码模型差距;
- 语音走向全双工、端到端多人转录:OpenAI GPT‑Live 代表下一代语音交互范式;国内持续深耕方言、复杂噪声场景;
- 开源社区风险事件增多:Rio‑3.5 事件提醒从业者,需要关注权重融合、蒸馏、模型溯源问题,避免把权重缝合模型当成全新训练模型。
本文信息均来自官方博客、GitHub、HuggingFace 公开页面,部分模型性能以厂商公开评测为准,实际生产效果建议自行复现验证。
更多推荐
所有评论(0)