logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

扩散模型与视频相结合,迎来3D/视频的新变革!

【Video+Diffusion】是一个结合视频生成和扩散模型的研究领域,旨在通过先进的深度学习技术生成高质量、高分辨率的视频内容。这个方向利用扩散模型的强控制性和稳定性,通过逐步去除噪声并恢复数据,来生成逼真的视频序列。研究者们通过设计创新的框架和方法实现了从文本描述或图像提示到视频内容的高效转换,这些方法不仅提升了视频生成的效率和质量,同时也降低了计算资源的需求。

文章图片
#人工智能
太猛了!π0.5 模型让机器人在全新家庭环境 “无缝衔接” 家务,端到端学习 + 知识迁移绝配!

π0.5 基于 π0 构建,训练分预训练和后训练两阶段。预训练用离散标记实现高效训练,后训练引入“动作专家”支持连续动作生成与实时推理。推理时先推断高级子任务,再基于子任务预测低级动作。π₀.₅基于π₀模型,通过异构数据协同训练(融合多机器人数据、web数据等),实现了移动操作器在全新家庭环境中的端到端控制,可完成清洁厨房、整理卧室等长时复杂任务。其采用两阶段训练(预训练用离散标记,后训练引入动作

文章图片
#机器人#学习
刷爆 AI 圈!DeepSeek-R1 荣登 Nature 封面,梁文锋团队创新训练框架,让大模型靠奖励机制学会高阶推理!

重磅重磅!!DeepSeek-R1 的研究荣登最新一期的!通讯作者正是梁文锋。如果训练出的大模型能够规划解决问题所需的步骤,那么它们往往能够更好地解决问题。这种与人类处理更复杂问题的方式类似,但这对人工智能有极大挑战,需要人工干预来添加标签和注释。在本周的期刊中,DeepSeek 的研究人员揭示了他们如何能够在极少的人工输入下训练一个模型,并使其进行推理。DeepSeek-R1 模型采用强化学习进

文章图片
#人工智能
ICLR | 思维与行动的协同:ReAct框架如何重塑大模型的问题解决能力

在问答、事实核查、交互式决策等多种任务上,ReAct 均展现出超越单一推理或行动基线的性能,且仅需少量示例即可学习。ReAct 生成的轨迹清晰地展示了模型的“心路历程”,使得人类可以轻松审查其决策依据,判断其结论是源于内部知识还是外部事实,从而大大提高了模型的可信度和可诊断性。通过与外部知识库的互动,ReAct 有效地缓解了 CoT 方法中普遍存在的知识幻觉问题,使其在知识密集型任务中更加可靠。

文章图片
#react.js#前端#前端框架
告别“思而不学”!通义×北大破局之作RL-PLUS,让大模型真正学会思考,突破推理边界!

该问题的核心在于,RLVR本质上是一种在线策略(on-policy)学习,在面对LLM巨大的解空间和稀疏的奖励信号时,模型倾向于利用(Exploitation)和优化已知的推理路径,而难以进行有效的向外探索(Exploration)以发现新知识。激励模型发现新知识。实验证明,该方法不仅在多项推理任务上取得了SOTA性能,更重要的是,它有效解决了“能力边界塌缩”问题,为大型语言模型实现持续的自我进化

文章图片
大模型后训练遗忘困局被破解,斯坦福陈丹琦团队重磅突破!在线数据成RL“学得久、记得牢“的核心密钥

模型与策略表示:语言模型(LM)用策略πθy∣xπθ​y∣x表示,其中yyy是基于提示xxx生成的响应;目标任务TTT的最优策略记为π∗⋅∣xπ∗⋅∣x。损失函数定义监督微调(SFT):最小化交叉熵损失,LSFTθ;x∑y​−π∗y∣xlogπθ​y∣x,基于最优策略采样的真实响应y∗y^{*}y∗计算。

文章图片
#人工智能
深度学习本质被看透!何恺明团队2025年以“简化+结构沟“为核心,五大方向突破,推动AI从工程优化到理论可解释

2025年,何恺明团队以“简化、结构、泛化、物理性、重构”为关键词,完成了一场对深度学习核心范式的系统性反思与重塑。在生成领域,团队通过去除噪声条件、引入分形结构、设计单步流场等创新,剥离冗余组件,揭示了生成建模的本质机制;在表征学习中,以“解构退化”的反向思维,证明了简洁架构的强大潜力;在物理推理方向,融合经典力学与神经算子,实现了可解释、多任务的物理建模;在理论层面,重审数据集偏差问题,为行业

文章图片
#人工智能#深度学习
NeurIPS 2025 | 手持8张4090,怎么练大模型最划算?LLM炼丹哈佛给出终极配方

本文探讨了在计算资源受限(如仅有 8 张 RTX 4090)的真实环境下,如何科学地分配算力以训练出高性能的垂直领域语言模型。研究基于哈佛与斯坦福团队发表于 NeurIPS 2025 的EvoLM项目,通过对 100 多个 1B/4B 规模模型进行全生命周期(预训练 PT、持续预训练 CPT、监督微调 SFT、强化学习 RL)的穷举式实验,揭示了模型训练动力学的核心规律。文章否定了盲目追求大参数量

文章图片
#深度学习#人工智能#机器学习
为SFT正名!清华突破性发现:大模型胡言乱语的“罪魁祸首”,竟是这0.1%的“幻觉神经元”

大型语言模型(LLMs)虽然在很多任务上表现出色,但经常会产生,也就是生成看似合理但实际上错误的内容,这严重影响了它们的可靠性。目前的研究大多从宏观角度(如训练数据、训练目标)来分析幻觉,却鲜有研究深入到微观的层面。这就像医生只知道病人的症状,却不知道身体里哪个细胞出了问题,导致难以根除病灶。现有的难题在于,我们不知道模型内部究竟是哪些微小的计算单元在“撒谎”,以及它们是如何运作的。为了解决该问题

文章图片
#深度学习#人工智能#机器学习
μP神话破灭!复旦邱锡鹏团队推翻OpenAI关键理论,大模型学习率设置有了新公式

在大模型预训练这一高成本系统工程中,Batch Size(批大小)与 Learning Rate(学习率)的设定,直接影响训练效率与模型性能。它们如同赛车的动力与操控:Batch Size 决定每次迭代处理的数据量,影响训练速度与稳定性;Learning Rate 则控制模型参数更新的步幅,关乎收敛效果与最终性能。长期以来,行业普遍依赖两大经典理论指导超参设置:然而,随着 WSD(热身‑稳定‑衰减

文章图片
#学习#人工智能#深度学习
    共 195 条
  • 1
  • 2
  • 3
  • 20
  • 请选择