logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

清华大学人工智能研究院开源“天授”强化学习平台

深度强化学习(deep RL)近年来取得了令人瞩目的进步,在Atari游戏、围棋等领域战胜了人类。但是,在面对不确定环境、不完全信息的任务时仍然面临很大的挑战。如何求解非完全信息、不确...

GRPO=高级版拒绝采样?强化学习祛魅时刻:负样本“去芜存菁”才是关键!

所以,这篇文章的出发点就是,重新审视和比较几种有代表性的 RL 方法(特别是 GRPO 和极简的 RAFT、以及基础的 Reinforce),弄清楚它们成功的关键因素,尤其是负样本(模型答错的例子)到底该怎么用,以及能不能找到一种既简单又有效的 RL 训练方法。这个方法是对基础 Reinforce 算法的一个小改进,核心思想是:既不学习“所有回答都正确”的题目(可能太简单了),也不学习“所有回答都

又一篇CCF-A!强化学习+多目标优化,吊打传统方法!

文章提出一种基于单偏好条件模型的多目标组合优化学习方法,设计相应强化学习算法,在多个问题上实验,验证其相比其他方法在解质量、速度和模型效率上的优势。更值得关注的是,阿里云最新发布的多目标大模型对齐技术,在金融交易RL系统中平衡收益与风险,夏普比率较单目标模型。首次提出CMORL问题,考虑学习过程中目标的动态变化,拓展了多目标强化学习的研究范畴。定义CMORL问题,将其建模为多目标马尔可夫决策过程序

鹏城实验室开源All Robots In One:百万规模标准化具身智能数据集

©作者 |鹏城实验室来源 |机器之心今年以来,具身智能正在成为学术界和产业界的热门领域,相关的产品和成果层出不穷。今天,鹏城实验室多智能体与具身智能研究所(以下简称鹏城具身所)联合南方科技大学、中山大学正式发布并开源其最新的具身智能领域学术成果 ——ARIO(All Robots In One)具身大规模数据集,旨在解决当前具身智能领域所面临的数据获取难题。论文标题:All Robots in..

罗福莉担任通讯作者,小米 × 北大联合发布R3:让MoE强化学习从崩盘回归可控

方法,看似简单却一针见血:在推理(rollout)阶段记录每层、每个 token 的专家路由选择(Top-K mask),并在训练前向中原样回放,同时保留训练端 logits 的梯度与可学习性。作者提出的 R3(Rollout Routing Replay),核心思想是记录推理时的路由决策,并在训练阶段原样回放,以此保持训练与推理之间的专家选择一致。这样,模型在前向计算中依旧可保持梯度可传播(so

#回归#数据挖掘#人工智能 +2
多智能体强化学习(MARL)近年研究概览

©PaperWeekly 原创 ·作者|李文浩学校|华东师范大学博士生研究方向|强化学习最近由于写论文的原因,梳理了一下近几年的多智能体强化学习(MA...

GPT之父Alec Radford新作:从文档级到Token级,重塑大模型数据过滤范式

通过结合 SAE 的特征提取能力与 Token 级的精细操作,该研究展示了一种在预训练阶段进行能力干预的可行路径。(替换为 <hidden>)训练的模型,在经过轻量级拒绝微调后,在遗忘域(HealthSearchQA)的拒绝率高于基线模型,且未对无关领域(Alpaca)造成误伤。Token 级过滤能在预训练阶段实现 7000 倍的等效计算效率阻滞,并意外提升了模型的拒绝(Refusal)能力。实验

仅需73美元!Karpathy单卡复现GPT-2,揭秘Muon优化器与架构细节

这不仅仅是摩尔定律和 H100 硬件暴力的胜利,更是软件栈(Flash Attention 3, torch.compile)、优化算法(Muon)和数据质量(FineWeb-edu)共同进化的结果。总有一些你不认识的人,知道你想知道的东西。73 美元复现 GPT-2 的背后,不是单一技术的突变,而是对 Transformer 组件、优化器行为以及硬件特性的极致理解与压榨。Karpathy 强调,

0.6B参数逆袭7B基线?OpenTrackVLA重磅开源:重写具身智能的算力法则

左侧复杂的网络代表了完整的训练过程,OpenTrackVLA 的使命就是把右侧那个“未开放”的黑盒彻底打开。它抛弃了臃肿的通用大模型,转而采用了一个基于。(arXiv:2505.23189),虽然证明了 VLA 模型在野外环境下的强大潜力,但它却给开发者留下了一个巨大的遗憾——这相当于给进入模型的每个数据打上了时间戳、视角和指令类型的标签,告诉 Qwen-0.6B:“这是第 5 秒的画面,请注意”

ICLR 2026 | GPT-5竟给废图打高分?首个图表“信达雅”评测基准发布

但一旦涉及信息层次组织、叙事逻辑,或者更主观的视觉美感,表现就明显乏力,容易被“好看的皮囊”迷惑,也很难系统地评价“这张图是否真的帮人看懂了数据”。从 VisJudge-Bench 的实验结果可以看出,今天的大模型已经具备了一定的图表理解能力,闭源商用模型整体领先,开源模型也在快速追赶,且模型越「大」,模型越「强」的趋势依然存在。对任何追求“通用智能”的大模型来说,理解和评估可视化的能力,不仅是“

#人工智能
    共 1547 条
  • 1
  • 2
  • 3
  • 155
  • 请选择