
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Ⅰ. ReKep实现将空间与时间尺度上的约束表示为形式化Python函数,熟悉我的大伙可能知道,在很多场景下我时不时的都会提及“形式化”,如早期llm应用于数学证明中与形式化语言lean的协作,再到RL+LLM下的形式化探索与利用的潜在价值..这里所采用的Python函数亦为具身智能对时空约束操作与动作任务空间打下了形式化基础,当然在具身智能领域采用函数数值约束计算也很常见,但我想对于未来更复杂的

篇文章于2023年底尝试挖掘并探寻以ChatGPT为代表的LLMs和以AlphaGO/AlphaZero及当下AlphaDev为代表的Alpha系列之间的AR和RL思想的背后底层理论及形式上的统一,同时尝试基于去年OpenAI暴露出的project Q*可能的关于推理过程学习再到系统①(快)思考与系统②(慢)思考的形式化统一的延展性思考,以展望当下面向未来AGI路径可行性...正如前几日AI一姐李

不管是回顾以往,总结当下,又或者是展望未来,决定针对「融合RL与LLM思想,探寻世界模型以迈向AGI」这篇达10万字小作文做一下MARK..一方面是在继上一次终稿发布时所经历的1个多月时间结合新事件和作者理解进行一次内容上的再版更新并同步给读者;一方面是因整篇文章比较冗长,且作者平常更多是利用工作之余的碎片时间在尽量保证内容质量下随思而写,内容表述逻辑性和完整性可能会有一些错误,因此再整体总结并阐

首先,非常感谢很多微信公众号的独立个人和机构运营者,在文章在微信公众号上发布之初在阅读到文章后能够转载分享其中的内容,让更多的AI爱好者能够看到!其中也有很多专业人士提出了相关在技术上、内容形式上的诸多宝贵建议和指正,在此也对来自不同领域读者的鼓励和认可表示感谢!为了方便各位读者阅读,将这一内容合订整理成册,供大伙使用,也非常欢迎我们一起随时探讨沟通:关于 融合RL与LLM思想 · 探寻世界模型迈

本篇文章拟分为「上篇」「中篇」「下篇」,因为文章内容整体比较冗长,也许会给大家造成一定的阅读困扰,但仍希望大家能够阅读下去,内容上尽量采用简单通俗的表述,其中文章囊括了诸如强化学习「RL」、自回归「AR」大语言模型「 LLMs」等技术领域深刻内涵思考,穿插关联了丰富的计算机科学/数学/物理学/哲学/心理学等领域跨学科内容,回顾了人工智能近现代发展历史,并在部分章节中以作者视角回顾总结过去一年中大模

1. 探究以泛GPT为代表的预训练自回归编码模型(即LLM)与泛Alpha系列为代表的RL的本质普遍性及表象差异性,以及为什么要将其两者联系起来?2. 鉴于LLM与RL两者间的差异化能力考量,业内不少的思路尝试将两种方法结合在一起,但结合后要么看着不是很巧妙,要不就是看起来很僵硬,总感觉像是一个过渡性的结合,并且看起来并没有以终为始,也不是原生的思想与方法的融合,因此想要尝试探寻一下两种学习方法是

作者:宋大宝,与大宝同学因那篇《回顾·总结·展望「融合RL与LLM思想,探寻世界模型以迈向AGI」》结识于今年春天,虽我们当时某些思想观念有些出入,也碰撞出了很多火花与共鸣,并持续地相互启发的走到了现在。他是AI领域创业先行者,拥有着令人惊艳的的思想观念,博学多才,被我誉为百科全书式AI探索者,貌(确)似(实)近期在内容输出上有压倒我之势~哈哈,这篇2万字+文章即是他近期的在更大的宏观叙事上的思考

在上一篇笔记「上交大全华班复现o1旅程式学习下的深思考」中,其中对于上交大提出的旅程学习即system2慢思考认知范式下对于“多步骤的隐式到显式空间状态映射下的细粒度联合概率分布建模”的描述隐喻为“社会心理学或社会经济学两种不同的长程动态系统慢演化现象”。因此结合我之前几篇关于模型扩散思想的观点阐释,以及近期来自哈佛等欧美多所名校的学者在机器学习和生物学的融合研究中,所揭示的“扩散模型与进化算法”

这里值得注意的是,图像空间不同于语言空间,图像空间的无约束搜索空间加速了随机搜索向验证器偏见的收敛,类似强化学习中的奖励黑客行为,称为“验证器黑客”。然而,对于“搜索”构噪与迭代去噪的说法,个人持保留态度,因基于图像的扩散与语言符号形式搜索在底层形式化上可能存在差异,也许需谨慎对待并深入探索其潜在联系和差异,其并不能完全将图像生成过程的扩散与符号形式的搜索直接对应起来,它们也许在底层形式化上是相同

虽然一种新的训练范式的成功与否离不开模型结构与算法的创新,当然除了在模型和方法的创新外,也需要更全局的洞察到真实世界中所映射的数据与认知模式的完整流形分布是否与上述“创新”是匹配的。未来,这一路径与未来RL的某种路径也许会更加创新性的耦合到一起,但技术上的挑战和理论上的复杂性可想而知,不过看到这篇论文中对技术方法的尝试以及理论的创新还是让人蛮兴奋的~感兴趣的大伙可以精读一下原论文,或者我们也可以随








