OpenAI发布GPT-5.6系列
- B站:啥都会一点的研究生
最近一周AI科技圈又发生了啥新鲜事
OpenAI发布GPT-5.6系列限量预览版
OpenAI推出了GPT-5.6系列的三款模型:旗舰级Sol、面向日常工作的Terra以及高性价比的Luna。其中,Sol在编程工作流测试Terminal-Bench 2.1上取得了91.95%的新最优成绩,超过了Anthropic的Claude Fable 5等模型,在网络安全领域的ExploitBench上仅用约三分之一的输出token就达到了与竞品相当的表现。该系列还引入了更灵活的提示缓存机制,定价上Sol约为Anthropic Claude Fable 5的一半。此次发布因美国政府介入而采取受限预览形式,初期仅向少数合作伙伴开放

https://openai.com/index/previewing-gpt-5-6-sol/
OpenAI仅用9个月自研推理芯片Jalapeño成功
OpenAI发布其首款自研推理加速芯片Jalapeño,该芯片由前谷歌TPU核心成员Richard Ho主导,联合博通和Celestica打造,专为ChatGPT等大模型工作负载优化,从设计到流片仅耗时9个月,创下高性能ASIC领域最快开发纪录。该芯片通过减少数据搬运以提升实际利用率,计划于2026年底部署于微软等数据中心,早期测试显示其每瓦性能大幅优于当前先进水平
https://openai.com/index/openai-broadcom-jalapeno-inference-chip/
网易有道发布Confucius4-TTS开源模型
Confucius4-TTS核心突破在于实现了不依赖参考文本的零样本语音克隆,仅需3秒参考音频即可复刻原声,并支持中、英、日、韩等14种语言的无口音跨语种切换,同时具备情感韵律迁移能力。该模型采用语音编码器、大语言模型与流匹配生成框架结合的端到端架构,参数规模达13亿,已基于Apache协议在GitHub全量开源,提供完整54G模型权重及配套工具链,支持本地离线部署与商用

https://github.com/netease-youdao/Confucius4-TTS
豆包大模型2.1发布
火山引擎在Force大会上推出新一代豆包大模型2.1,其Pro版本在代码生成(Terminal Bench 2.1)、智能体(GDPVal)与视觉语言模型等核心能力评测中进入全球第一梯队,部分成绩超越Claude Opus 4.7。该模型能独立完成仓库级代码理解与端到端项目交付,并驱动智能体在复杂异常环境中进行动态路径规划与自我纠错

https://mp.weixin.qq.com/s/NiLniO_7EEc7DcS-i-PBqQ
豆包推出专业版
豆包正式上线专业版服务,该服务基于最新的豆包2.1系列大模型,核心是全新的“办公任务模式”,该模式接入了可执行Agent任务的模型,能自主拆解目标并操作本地电脑、使用浏览器、调用Office套件及“Skills”技能来完成任务,涵盖应用开发、数据分析、流程自动化等领域。专业版采用三级阶梯定价,连续包月费用从68元至500元不等,提供比免费版高5倍以上的旗舰模型使用额度,同时为在校大学生提供连续包月38元的专属折扣价
https://mp.weixin.qq.com/s/Sb-NMXTrWFQES1EDO_Gr2g
通义千问推出原生语言世界模型 Qwen-AgentWorld
Qwen-AgentWorld是首个原生语言世界模型,能够在单一模型中同时覆盖MCP、Search、Terminal、SWE、Web、OS、Android这七大智能体交互领域。该模型基于超过1000万条真实环境交互轨迹,经由CPT→SFT→RL三阶段训练而成。在配套的AgentWorldBench评测基准上,Qwen-AgentWorld-397B-A17B取得了最高的整体模拟质量(58.71分),超越了GPT-5.4(58.25分)等前沿模型。研究还探索了世界模型赋能智能体的两种范式:作为解耦的环境模拟器,可控模拟训练在WideSearch任务上超越了使用真实环境训练的模型(F1:50.3% vs. 45.6%);作为统一智能体基础模型,LWM预热训练能显著提升多轮智能体任务性能,即使在完全未训练过的Claw等域外任务上也能带来超过11个百分点的增益

https://github.com/QwenLM/Qwen-AgentWorld
百川发布新一代医疗增强大模型M4
百川智能与清华大学联合发布的医疗增强大模型Baichuan-M4,在OpenAI提出的权威医疗评测HealthBench上以68.6分的综合成绩位列世界第一,领先第二名GPT-5.5超过10分,其事实性幻觉率降至3.3%,为同行业最低。该模型的核心突破在于模拟临床医生的主动问诊能力,通过借鉴医学教育中的OSCE方法构建了动态问诊评测体系,并首创“证据锚定”技术,让每一句医学结论都能精确对应到原始论文的具体段落,循证引用精度达到90.0。此外,M4还引入了全病程记忆和Agent架构,能够调度问诊、记忆与循证能力完成连续诊疗,在长上下文临床记忆评测中得分86.9,较上一代提升21.1分

https://mp.weixin.qq.com/s/WBWQFRH5d8z1MBvCMHSWDQ
Momenta冲刺港股IPO,“物理AI基座模型构建者”
自动驾驶公司Momenta已正式启动港股上市进程,其在招股书中将自身定位为“物理AI基座模型的构建者”。其核心支撑是已实现量产的世界模型R7,该模型依托超120亿公里真实行驶里程和超1亿段“黄金数据”进行训练。公司营收从2023年的7.43亿元增长至2025年的24.13亿元,其中以授权车企使用其系统的“许可收入”增长尤为显著,从0.23亿元激增至9.68亿元。Momenta在量产车搭载的第三方城市NOA市场中市占率达65%,其商业路径被概括为“一个飞轮,两条腿”,即通过量产车收集数据迭代世界模型,再赋能L4级完全自动驾驶
https://mp.weixin.qq.com/s/rfoGnsuOYCINXZw5TQ9dhw
字节跳动发布Seed2.1系列模型
Seed2.1系列模型重点提升通用Agent在复杂任务中的可靠交付能力,以及代码工程在真实企业开发场景中的端到端稳定性。在评测方面,其Pro版本在衡量真实工作经济价值的GDPval基准上获得最高分,并在高难度的Agents’ Last Exam(ALE)基准中处于第一梯队。模型在手机端任务基准MobileWorld上取得最高分,并通过强化学习将任务平均步数减少16%。在代码能力上,Seed2.1 Pro在开发者众测中面对真实仓库任务,以59.1%的胜率优于Claude Opus 4.6。此外,模型在多模态理解、视频分析和长文本处理等基础能力上也保持业界领先

https://mp.weixin.qq.com/s/lU3ctCGQFL1aNEVSYlSX7A
百度开源新OCR模型Unlimited OCR
Unlimited OCR采用参考滑动窗口注意力机制,让模型在解码时能持续参考完整图像信息,而输出端只保留最近128个历史Token,从而将KV Cache规模保持恒定。在OmniDocBench v1.5上,其综合得分达到93.23%,相比DeepSeek OCR提升6.22%,并在40页以上的长文档解析中保持稳定。在效率方面,生成6000个Token时,其推理速度比DeepSeek OCR提升约35%,且延迟基本保持稳定。值得注意的是,技术报告中的核心作者“YY”被网友猜测为前DeepSeek OCR团队研究员魏浩然

https://github.com/baidu/Unlimited-OCR
更多推荐
所有评论(0)