logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【TJU】研究生应用统计学课程笔记(5)——第二章 参数估计(2.3 C-R不等式)

本文介绍了C-R不等式(Rao-Cramer不等式)在参数估计中的应用。首先定义了Rao-Cramer正则分布族的五个条件,并通过Poisson分布和正态分布的例子验证其满足这些条件。然后给出了Rao-Cramer不等式的主要结论:对于Rao-Cramer正则分布族,任何无偏估计量的方差存在一个下界(C-R下界)。文章还讨论了该不等式的适用条件和特殊情况,指出均匀分布族不属于正则分布族,因此不等式

文章图片
#c语言#r语言#概率论 +2
结合代码读3DGS&世界模型论文(2)——CVPR 2026 3DGS & 世界模型新工作GaussianDWM论文及代码解读

本文介绍3DGS & 世界模型领域CVPR 2026新工作GaussianDWM。论文提出了一种新型统一驾驶世界模型框架,在同一架构中同时支持场景理解和场景生成。论文通过将三维高斯场景表示与任务感知的混合高斯采样策略相结合,有效弥合了场景理解与场景生成之间的差距,并实现了世界查询信息向大语言模型中的有效注入。大量实验验证了论文方法的有效性,结果表明该方法能够显著提升场景理解能力和场景生成能力。论文

文章图片
#3d#论文阅读#计算机视觉 +2
结合代码读3DGS&世界模型论文(3)——3DGS & 世界模型新工作GaussianDream论文及代码解读

GaussianDream提出前馈式3D高斯世界模型插件,用于机器人操作,解决VLA缺乏3D空间、密集监督和未来预测的问题,训练时重建和预测,推理时只保留前缀,性能SOTA。

文章图片
#3d
大语言模型系统:【CMU 11-868】课程学习笔记01——大模型介绍(Introduction to LLM)

【CMU 11-868】课程面向研究生开设,聚焦“从算法到工程”的大语言模型系统构建全过程。GPU 编程与自动微分:掌握 CUDA kernel 调用、并行编程基础,以及深度学习框架设计原理模型训练与分布式系统:学习高效的训练算法、通信优化(ZeRO、FlashAttention)、分布式训练框架(DDP、GPipe、Megatron-LM)。模型压缩与加速:量化(GPTQ)、稀疏化(MoE)、编

文章图片
#语言模型#学习#人工智能 +1
结合代码读3DGS&世界模型论文(1)——ICCV 2025 3DGS & 世界模型新工作GWM论文及代码解读

本文介绍了ICCV 2025的工作《GWM: Towards Scalable Gaussian World Models for Robotic Manipulation》,提出了一种基于3D高斯表示的新型世界模型Gaussian World Model (GWM)。该模型通过结合3D高斯溅射与扩散Transformer,实现了机器人操作任务中未来场景的准确预测。GWM包含两个核心组件:3D高斯

文章图片
#3d#论文阅读#图像处理 +1
【Video Agent 22】(CVPR 2026)Symphony: A Cognitively-Inspired Multi-Agent System for LVU

本文介绍CVPR 2026智能体长视频理解新工作Symphony。Symphony通过模拟人类认知模式,将任务分解为多个专门化智能体协作完成,包括规划、定位、视觉感知、字幕和反思智能体。Symphony采用反思增强的动态推理框架,通过迭代优化推理过程提升准确性。实验在LVBench等四个数据集上验证了其有效性,性能较现有方法提升5.0%。该方法为长视频理解提供了一种新的认知启发式解决方案。

文章图片
#学习#多模态#语言模型 +2
【Video Agent 09】(Arxiv2601,Meta)Agentic Very Long Video Understanding

本文介绍Meta新作EGAgent。EGAgent是一种基于实体场景图的智能体框架,用于解决超长视频理解任务。该方法通过构建人物、物体和地点之间的时空关系图,结合视觉和音频搜索工具,实现对连续数天视频的多模态推理。实验表明,EGAgent在EgoLifeQA和Video-MME(Long)数据集上分别达到57.5%和74.1%的准确率,显著优于现有方法。该研究为可穿戴设备AI助手的长时记忆和推理能

文章图片
#论文阅读#音视频#计算机视觉 +1
【Video Agent 11】(Arxiv2504)VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding

本文介绍VideoExpert,一种增强型多模态大语言模型(MLLM),用于时间敏感的视频理解任务。现有MLLM在时序定位等任务上表现不佳,主要依赖语言模式而非视觉线索生成时间戳。VideoExpert创新性地集成两个并行专家模块:Temporal Expert处理高帧率压缩特征以捕捉动态变化并实现精确事件定位;Spatial Expert专注于内容细节分析和指令跟随。通过特殊token <

文章图片
#人工智能#机器学习#多模态 +3
【Video Agent 04】(NeurIPS 2025)Deep Video Discovery: Agentic Search with Tool Use for Long-form VU

本文介绍NeurIPS2025提出的Deep Video Discovery(DVD)智能体,用于解决长视频理解中的时空复杂性挑战。该方法将长视频分割为多粒度数据库,并设计三种搜索工具(Global Browse、Clip Search、Frame Inspect),使智能体能自主规划搜索策略。实验表明,DVD在LVBench上达到74.2%的准确率(结合转录后76.0%),显著优于现有方法。该工

文章图片
#论文阅读#音视频#多模态 +1
【Video Agent 13】(Arxiv2604, Meta)Tempo: Small Vision-Language Models are Smart Compressors for LVU

Meta研究团队提出Tempo框架,通过小型视觉语言模型实现长视频的高效压缩和理解。该框架采用查询感知的自适应token分配策略(ATA),动态为关键片段分配密集带宽(每帧16 token),同时将冗余内容压缩为最小时间锚点(每帧0.5 token)。实验显示,6B参数的Tempo在LVBench基准(4101秒视频)上以8K token预算取得52.3分,超越GPT-4o等专有模型。该方法证明意

文章图片
#语言模型#人工智能#自然语言处理 +2
    共 53 条
  • 1
  • 2
  • 3
  • 6
  • 请选择