logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

物理原生智能Phi:破解泛在具身智能的技术范式

2026年7月 世界人工智能大会(WAIC)创新发展论坛上,清华大学李升波教授发表了题为《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》的主题演讲,介绍了”物理原生智能”(Physics-native Intelligence, Phi)的概念与定义,并系统阐述其核心特征与技术体系,为破解泛在物理世界的智能开发难题提供了全新技术范式。

文章图片
#人工智能#算法
ICLR 2025 Spotlight | SmODE: 神经常微分网络让深度强化学习的控制更加丝滑!

这种设计不仅能够实现自适应的低通滤波,还具备对Lipschitz常数的有效控制,从而增强了神经元对输入扰动的抑制能力,并实现了更为平滑的输出。作为一种策略网络,与传统的多层感知机和LipsNet相比,SmODE在控制动作输出的平滑性方面表现出色,显著提升了各种强化学习任务中的平均回报。在系统时间常数固定的情况下,虽然较大的时间常数能够保证较好的平滑性,但也会引入额外的延时。考虑到对动作平滑性和高性

文章图片
#算法
NeurIPS 2024 | DACER:扩散模型与在线强化学习强强联合创造新SOTA!

然而在大多数传统的在线强化学习算法中,策略函数通常被参数化为可学习的高斯分布,这限制了它们表达复杂策略的能力。通过利用扩散模型的反向去噪过程,DACER能够有效地学习多模态分布,使得创建更复杂的策略并提高策略性能成为可能。为展示DACER的多模态能力,我们选择了五个需要多模态策略的点:(0.5, 0.5)、(0.5, -0.5)、(-0.5, -0.5)、(-0.5, 0.5)和(0, 0)。相比

文章图片
#算法
ICLR 2025 Spotlight | SmODE: 神经常微分网络让深度强化学习的控制更加丝滑!

这种设计不仅能够实现自适应的低通滤波,还具备对Lipschitz常数的有效控制,从而增强了神经元对输入扰动的抑制能力,并实现了更为平滑的输出。作为一种策略网络,与传统的多层感知机和LipsNet相比,SmODE在控制动作输出的平滑性方面表现出色,显著提升了各种强化学习任务中的平均回报。在系统时间常数固定的情况下,虽然较大的时间常数能够保证较好的平滑性,但也会引入额外的延时。考虑到对动作平滑性和高性

文章图片
#算法
车辆学院团队在强化学习领域取得重要进展

为进一步改进该算法的迭代稳定性,并降低参数敏感度,团队提出了三项全新的值分布梯度修正技术,即Expected Value Substituting(EVS)、Twin Value Distribution Learning(TVDL)和Variance-Based Critic Gradient Adjustment(VCGA),并将其嵌入到第二代DSAC算法中(又称为DSAC-T)。目前,研究团

#算法#人工智能
ICLR 2025 Spotlight | SmODE: 神经常微分网络让深度强化学习的控制更加丝滑!

这种设计不仅能够实现自适应的低通滤波,还具备对Lipschitz常数的有效控制,从而增强了神经元对输入扰动的抑制能力,并实现了更为平滑的输出。作为一种策略网络,与传统的多层感知机和LipsNet相比,SmODE在控制动作输出的平滑性方面表现出色,显著提升了各种强化学习任务中的平均回报。在系统时间常数固定的情况下,虽然较大的时间常数能够保证较好的平滑性,但也会引入额外的延时。考虑到对动作平滑性和高性

文章图片
#算法
到底了