logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

无需RL也能强推理!哈佛新采样方法靠 “幂分布 + MCMC”,基础模型推理竟追平 GRPO

RL 后训练是否真正“学到”新能力? 文献质疑很多推理提升其实是对基座模型分布的“锐化”,并指出 RL 常出现多样性塌缩、pass@k→single‑shot 的再分配等现象(引言与相关工作)。作者转而追问:仅靠采样能否在推理时把这些能力“唤出”?避免 RL 的现实痛点:RL 需要可验证奖励、数据清洗与大规模超参搜索,训练不稳定且常牺牲多样性。本文欲在不训练的前提下,获取与 RL 相当的单次推理性

文章图片
NeurIPS 2025 | 港科大&上交大HoloV:多模态大模型“瘦身”新突破,剪枝88.9%视觉Token,性能几乎无损

关键词:视觉令牌剪枝、多模态大语言模型、全局上下文保留、注意力机制偏差、HoloV框架、自适应令牌分配、视觉上下文重提取、位置偏差、注意力分散

文章图片
#人工智能
推理模型集体翻车!康奈尔大学:数学推理中越强的大模型,协作时越容易被“带偏”?

论文揭示了现有独立推理LLMs在协作场景中的根本局限性:即使是最强的模型也无法有效抵抗错误推理的干扰或利用正确推理的引导。这一发现挑战了传统基准测试对模型推理能力的评价标准,为构建真正具备协作能力的多智能体推理系统提供了重要理论基础和方法论创新。

文章图片
连中 ICCV 顶会!多模态大模型新范式,高分论文创新点都在这!

架构革新(如Mamba在扩散模型中的应用、统一化基础模型设计)、效率提升(如知识蒸馏、无需训练框架)及垂直领域突破(如自动驾驶、医疗影像、遥感分析)等

文章图片
#多模态
大模型后训练新突破!普林斯顿陈丹琦团队:RL 靠On-Policy数据,实现 “少遗忘+高增益” 双优

语言模型(Language Model, LM)在进行下游任务的后训练(Post-Training)时,常常面临灾难性遗忘(Catastrophic Forgetting)的问题,即模型在学习新任务的同时丢失了原有的知识能力。本文提出从策略数据(On-Policy Data) 的角度系统分析并缓解遗忘现象。通过在多类任务、多种模型上的实验,论文发现RL因其使用当前策略生成的数据进行训练,相较于SF

文章图片
#人工智能#机器学习
连中 ICCV 顶会!多模态大模型新范式,高分论文创新点都在这!

架构革新(如Mamba在扩散模型中的应用、统一化基础模型设计)、效率提升(如知识蒸馏、无需训练框架)及垂直领域突破(如自动驾驶、医疗影像、遥感分析)等

文章图片
#多模态
大模型后训练新突破!普林斯顿陈丹琦团队:RL 靠On-Policy数据,实现 “少遗忘+高增益” 双优

语言模型(Language Model, LM)在进行下游任务的后训练(Post-Training)时,常常面临灾难性遗忘(Catastrophic Forgetting)的问题,即模型在学习新任务的同时丢失了原有的知识能力。本文提出从策略数据(On-Policy Data) 的角度系统分析并缓解遗忘现象。通过在多类任务、多种模型上的实验,论文发现RL因其使用当前策略生成的数据进行训练,相较于SF

文章图片
#人工智能#机器学习
图像编辑新突破!天大&快手提出GRAG:4 行代码改造DiT注意力层,实现图像编辑 “指令跟随-原图保真” 双优

Diffusion Transformer、MM-Attention、可控图像编辑、GRAG、天津大学、快手Kolors、分组相对注意力引导(Group Relative Attention Guidance, GRAG)、多模态注意力(Multi-Modal Attention, MM-Attention)、图像编辑(Image Editing)、视觉语言模型(Vision-Language M

文章图片
#人工智能#机器学习
NeurIPS 2025 | 港科大&上交大HoloV:多模态大模型“瘦身”新突破,剪枝88.9%视觉Token,性能几乎无损

关键词:视觉令牌剪枝、多模态大语言模型、全局上下文保留、注意力机制偏差、HoloV框架、自适应令牌分配、视觉上下文重提取、位置偏差、注意力分散

文章图片
#人工智能
    共 25 条
  • 1
  • 2
  • 3
  • 请选择