logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

下周二晚8点!聊聊OpenMoE 2,为什么 Diffusion MoE 可能是下一代大模型架构方向

摘要: OpenMoE 2首次提出结合扩散语言模型(DLM)与混合专家(MoE)的架构,并开源训练代码。其核心创新包括:1)利用非因果建模特性实现专家选择路由(expert-choice routing),显著提升负载均衡与训练效率;2)通过扩散步骤和稀疏性调整灵活控制计算密度;3)在多轮训练中,扩散MoE展现出优于传统自回归模型的表现,解决了参数过拟合问题。研究还探讨了自适应计算、共享专家等关键

文章图片
#人工智能#语言模型
专为电影摄影理解的多模态大模型ShotVL及其训练策略:SFT+GRPO

摘要:11月18日晚8点,青稞Talk第90期邀请同济大学博士生刘洪博分享《ShotBench:面向增强MLLM摄影语言理解的训练与评估体系》。该研究提出首个电影摄影语言理解评测框架ShotBench,涵盖8大核心维度,评测24个主流多模态模型并发现性能缺陷。团队构建大规模训练集ShotQA,开发基于SFT+GRPO训练的ShotVL模型,取得领先效果。直播将探讨任务构建、评测框架及实际应用,展示

文章图片
#人工智能
小模型当老师,大模型反而学得更好了?

港大提出LightReasoner:让小模型教大模型“关键推理”,效率提升90%! 今天要和大家聊一篇非常有意思的工作——LightReasoner。 这篇由香港大学发表的最新论文,挑战了AI界一个习以为常的认知:“大模型一定比小模型强,小模型只能被教导,不能当老师。” 结果他们发现:小模型不仅能够

文章图片
#经验分享
如何解决RL阶段的Off-Policy问题?聊聊大模型时代的信任域策略优化TRPO

摘要:大型语言模型(LLM)在强化学习阶段面临策略部署与更新不匹配的核心挑战,主要表现为训练-推理精度差异、MoE路由不稳定和异步训练时序偏差。信任域策略优化(TRPO)通过代理目标函数和KL散度约束有效控制策略偏离,确保训练稳定性。青稞社区将于12月20日举办直播,由研究科学家Yingru Li分享《TRPO重生:大模型时代的信任域策略优化》,探讨LLM特有的Off-Policy挑战及解决方案。

文章图片
#人工智能
NeurIPS 2025!阿里开源 UniEdit:首个大型开放域大模型知识编辑基准

华东师范大学联合阿里巴巴、合肥工业大学提出首个开放域知识编辑基准UniEdit,覆盖25个知识领域、31.1万条样本,被NeurIPS接收。该研究基于Wikidata构建大规模数据集,提出NMCS算法统一评估编辑的可靠性和泛化性。实验发现当前编辑方法虽能记住修改内容,但在多跳推理等复杂场景下泛化性不足,且社会科学领域编辑难度更大。UniEdit不仅推动模型编辑研究,还可应用于事实一致性检测、多跳推

文章图片
#人工智能
小米大模型 Plus 团队提出BTL-UI:基于直觉-思考-关联的GUI Agent推理

小米大模型Plus团队提出"眨眼-思考-链接"(BTL)框架,模拟人类认知过程改进GUI智能体交互能力。该框架将交互分解为三个阶段:Blink快速定位界面元素,Think进行高级推理决策,Link生成可执行命令。团队还设计了BTL奖励机制,整合过程与结果监督,在ScreenSpot等基准测试中取得显著提升,7B模型定位准确率达89.1%,3B模型在AndroidControl-

文章图片
#ui#人工智能
周六上午10点!和SAPO一作聊聊大模型 RL 算法演进

摘要:本文系统梳理了大模型强化学习(RL)算法的演进历程,从理论基石TRPO到实用算法PPO、GRPO、GSPO,再到最新融合创新算法SAPO。TRPO奠定了KL散度约束的理论基础,PPO通过裁剪机制实现平衡优化,GRPO创新性地舍弃价值模型,GSPO提升至序列级优化解决稳定性问题。SAPO则通过软门控机制和自适应温度控制,在保持稳定性的同时提升样本效率。1月10日青稞Talk第102期将邀请通义

文章图片
#人工智能
大模型为什么会产生“离群值”?深度解析RoPE与注意力机制

摘要:本文探讨了大语言模型(LLM)中离群值(Outliers)的存在意义及其与Attention机制的关系。研究发现,离群值主要出现在前几个token中,对模型性能至关重要,移除会导致灾难性性能下降。从Attention机制角度分析,这些离群值与RoPE位置编码密切相关,是模型处理长文本依赖的关键机制。离群值帮助模型在RoPE干扰下保持远程召回能力,低频分量维度的大信号导致离群值出现。研究还发现

文章图片
#人工智能
RLLaVA 开源!多模态大模型 RL 训练框架的设计与实践

当我们将目光投向 多模态大模型(VLM) 时,RL 的研究正展现出巨大的想象空间与学术潜力。

文章图片
#经验分享#人工智能
比肩 GPT-5 的 Kernel Coding 模型!Dr. Kernel 用多轮 RL 训练大模型 GPU Kernel 生成

来自港科大、字节跳动、港中深和南洋理工的研究者们发现可验证不等于可长期可训练再叠加多轮交互带来的长程信用分配与训练不稳定,使得长期、可扩展的 RL 训练一直缺少系统化方案。

文章图片
#经验分享#人工智能
    共 156 条
  • 1
  • 2
  • 3
  • 16
  • 请选择