
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
仅供参考,未经实验验证。项目主页:https://masked-visual-actions.github .io/论文地址:https://arxiv.org/pdf/2607.19343它本质上就是"视频版的 Stable Diffusion Inpainting":在潜空间里把掩码视频和噪声拼接,用视频扩散模型逐帧去噪补全。前向推理时掩码贴在机器人身上(模型补全世界),逆向推理时掩码贴在物体
项目主页:https://masked-visual-actions.github.io/论文地址:https://arxiv.org/pdf/2607.19343把"动作"直接画在视频像素上,用"贴胶带"的方式告诉模型已知条件,同一个模型既能做"给动作猜结果"(正向),也能做"给结果猜动作"(逆向)——而且只练了正向,逆向直接就会。回到原文训练数据来自真实+仿真视频,用"自动抠图"和"3D渲染"
仅供参考,未经实验验证。两个项目都实现了三层记忆架构 + 闭环自进化的核心设计,这在技术层面确实存在高度相似性。Evolver 更强调协议约束和审计追踪,适合需要合规和可追溯性的企业场景;Hermes Agent 更强调实用性和多平台部署,适合个人用户和多样化集成场景。争议的核心在于:这种架构相似是"趋同进化"(独立发现最优解)还是"代码清洗"(借鉴后重写),目前双方各执一词,社区尚无定论。Evo
数据集构建基于分割:使用 Segment Anything 分割出机器人臂作为掩码。基于渲染:利用 URDF 模型和相机外参渲染机器人网格,生成掩码条件。模型训练:以 Wan-Fun-Control 2.1(14B)为基座模型,采用 LoRA(秩256)微调,将掩码视频与参考帧拼接作为条件输入。视频模型能够吸收关于视觉世界如何运动、交互以及对接触做出反应的丰富先验知识,这使得它们成为机器人世界建模
论文标题(监控视频中稀有交通事件的两阶段零样本时空定位)论文地址给定一段时长为DDD秒的交通监控视频VVV,我们预测一个元组t∗x∗y∗c∗t∗x∗y∗c∗,其中t∗∈0Dt∗∈0Dx∗y∗∈012x∗y∗∈012(Qwen3-VL 在010002010002网格上输出原始坐标;我们在合并和评估前将其除以 1000),且c∗∈Cc∗∈C。
仅供参考,未经实验验证。DeepSeek-R1 的故事是一个关于**“自我进化”**的故事:从一个未经任何监督的基座模型出发,通过纯强化学习的激励,模型自发学会了思考、反思、验证;再通过人类的少量引导(冷启动数据)和多阶段打磨,最终成为一个既强大又实用的推理专家;最后,它将这份智慧传递给更小、更快的模型,让整个开源社区受益。有时候,我们不需要手把手教模型如何思考,只需要给它正确的激励,它就能自己找
仅供参考,未经实验验证。作者提出了代码训练有助于提升数学推理能力,以及提出了SFT、RFT、DPO、PPO、GRPO统一范式的视角。这段内容来自代码训练比通用语料更能提升数学能力—— 先训代码再训数学,效果比直接训数学或先训通用语料再训数学都要好ArXiv 论文对数学推理帮助不大—— 用大量学术论文做预训练,数学 benchmark 上几乎没提升甚至下降想提升模型数学能力:先让它学代码,再学数学;
仅供参考,未经实验验证。这篇我们对SFT、DPO目标函数求导进行推导,由于RFT和在线RFT的目标函数求导与SFT同理(GC都是常数),故跳过了这两个。目标函数= 标准答案的平均 log 概率求导→ 期望和梯度交换,常数1∣o∣∣o∣1提出来,求和与梯度交换结果→ 每个 token 的梯度是∇θlogπθ∇θlogπθ,前面乘的系数是1(因为没有筛选、没有奖励、没有惩罚,所有 token
仅供参考,未经实验验证。这篇我们对GRPO目标函数求导进行推导。The objective of GRPO is (assumeπθold=πθ\pi_{\theta_{old}} = \pi_{\theta}πθold=πθfor simplified analysis):JGRPO(θ)=E[q∼Psft(Q),{oi}i=1G∼πθold(O∣q)]1G∑i=1G1∣oi∣∑t=1∣o
仅供参考,未经实验验证。大型语言模型在数学推理方面取得了显著进展,这既是人工智能的重要试验场,如果能进一步发展,也可能对科学研究产生影响。通过使用强化学习来扩展推理能力,并奖励正确的最终答案,大型语言模型在一年内从表现不佳提升到在 AIME 和 HMMT 等定量推理竞赛中达到饱和。然而,这种方法面临着根本性的局限。追求更高的最终答案准确率并不能解决一个关键问题:正确的答案并不能保证正确的推理。此外







