
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文聚焦多模态大型语言模型(LLM)的音乐感知能力评估,核心围绕“模型是真正理解音乐结构还是依赖表面特征”展开研究。通过设计三个核心音乐感知任务(切分音评分、移调检测、和弦质量识别),对Gemini 2.5 Pro、Gemini 2.5 Flash和Qwen2.5-Omni三款主流模型进行基准测试,重点探究了三种变量的影响:输入模态(音频vs MIDI符号)、示例暴露量(零样本vs少样本)、推理策
尽管大型语言模型(LLMs)在遵循人类指令完成各类任务方面取得了成功,但在推理时控制模型生成以遵循严格约束仍是一项长期存在的挑战。本文提出了Ctrl-G,一种神经符号框架,能够对LLM生成进行可处理且自适应的控制,以可靠地遵循逻辑约束。Ctrl-G将任意成熟的LLM与隐马尔可夫模型(HMM)相结合,引导LLM输出遵循以确定性有限自动机表示的逻辑约束。
强化学习(RL)后训练对于大型语言模型(LLM)的对齐与推理能力至关重要,但现有基于策略的方法(如PPO和DPO)难以修正预训练过程中继承的捷径问题。本文提出Q♯Q \sharpQ♯——一种基于价值的KL正则化RL算法,通过最优正则化Q函数引导参考策略。我们提出在聚合在线数据集上利用分布强化学习学习最优Q函数。与先前使用无正则化Q值引导模型的价值导向基线方法不同,我们的方法具有坚实的理论基础,且能
本文提出了一个名为The Matrix的高保真实时世界模拟器,能够生成无限时长、720p分辨率(1280×720像素)的真实场景视频流,并支持第一人称和第三人称视角的实时交互控制。该模拟器的核心目标是弥合虚拟仿真与现实应用之间的差距,解决传统世界模型在视频长度、画质、实时性和领域泛化能力上的局限。我们提出了The Matrix——一个基础性的高保真世界模拟器,能够生成无限时长的720p高保真真实场
大型语言模型(LLMs)性能强劲,但由于内存和计算成本高昂,部署难度较大。尽管剪枝技术可降低这些需求,大多数方法却忽略了运行时观察到的激活稀疏性。本文将激活稀疏性重新诠释为动态结构化权重稀疏性,并提出 DuoGPT——一个统一框架,通过结合非结构化权重剪枝与激活稀疏性,构建双稀疏(spMspV)工作负载。为保证精度,我们通过激活感知校准扩展了最优大脑压缩(OBC)框架,并引入密集模型的输出残差作为
推理能力是人工智能的核心,复杂问题往往需要更深、更长的推理过程来解决。关于人工智能推理的一个关键问题是:模型能否将学到的推理模式外推,以解决需要更长思维链(CoT)的更难任务?在本文中,我们对通过梯度下降在合成数据上训练的Transformer进行了理论分析,涉及多种状态跟踪任务,揭示了长度泛化推理能力如何产生。具体而言,我们证明:(i)对于循环群合成等具有简单代数结构的任务,在短的固定长度链上训
世界模型旨在捕捉环境动态,使智能体能够预测和规划未来状态。在大多数关注场景中,动态高度集中于环境内对象间的交互。这促使研究人员开发基于对象中心表示而非整体表示的世界模型,以更有效地捕捉环境动态并增强组合泛化能力。然而,对象中心世界模型的研究主要集中在视觉复杂度有限的环境(如基础几何图形)中,其在更具挑战性场景中的有效性仍有待探索。本文通过提出 Dyn-O 填补这一空白——Dyn-O 是一种基于对象








