
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
如何在长视频理解中提高效率和减少视觉信息冗余?论文提出了TimeViper,一种混合的Mamba-Transformer模型,通过内部的LLM令牌压缩机制TransV来高效理解长视频。

现有的视频大模型在扩展长视频理解时,事后令牌缩减策略虽降低了 LLM 负担,却导致视觉编码器成为新的延迟瓶颈,如何同时优化两端以实现高效扩展?论文提出了 LiteFrame 高效视频编码器及压缩令牌蒸馏框架,在降低端到端延迟 35% 的同时处理 8 倍帧数并提升准确率。

现有的Agent技能自进化方法在迭代更新时,往往因为缺乏对历史经验的积累和对修改幅度的控制,导致优化过程不稳定且效率低下,如何像深度学习中的梯度下降一样稳定、高效地自动优化离散的技能文档?论文提出了SKILLADAM框架,借鉴Adam优化器的思想,通过引入“优化记忆”和“波动驱动的编辑预算”,实现了更稳定、更少迭代次数且更低成本的Agent技能自进化

如何提高大型推荐系统在计算效率和用户交互中的表现,同时实现动态且个性化的推荐解释?论文提出了RecGPT-V2框架,通过引入代理意图推理和动态解释生成,显著提升了推荐系统的计算效率和用户满意度。

现有的RAG评估基准在评估垂直领域的RAG模型,面临可靠性的挑战。论文提出了一个名为RAGEval的全面评估框架,用于自动生成特定场景下的RAG评估数据集,并引入了新的评估指标来提高评估的准确性和可靠性。

如何在一个动态、长周期且包含复杂交互的真实商业环境中,准确评估大语言模型智能体的持续决策与适应能力?论文提出了E-Commerce Bench,这是首个结合真实电商数据、确定性谈判内核及动态事件的开源长周期商业运营评测基准。

如何系统性地防御从文本生成转向实际操作的智能体AI所面临的注入、数据窃取及工具滥用等运营级威胁?论文提出SingGuard-NSFA框架,包含基于CIA三元组的NSFA风险分类体系、覆盖133种语言的大规模基准测试,以及结合生成式推理与实时分类的双模式护栏模型。

如何在长程智能体任务的后训练中,既保留端到端强化学习的域外泛化能力,又避免其高昂的计算成本,同时克服监督微调导致的性能退化?论文提出了 PivotRL 框架,通过筛选高方差中间状态和利用功能等价奖励,以极低计算成本实现了优于 SFT 的域内精度和卓越的域外保持能力。

如何有效地扩展强化学习(RL)以处理长视频的复杂推理任务?论文提出了一种新的多模态强化学习框架MR-SP,专门针对长视频的推理,提高了模型在处理长时间序列数据时的效率和效果。

现有电子健康记录(EHR)建模方法在处理复杂、定量医疗任务时缺乏结构化数据整合和外部知识注入,且可解释性不足。论文提出了ColaCare框架,通过结合领域专家模型和大语言模型(LLM),增强了EHR建模的可解释性和预测能力。








