logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【弱监督时间动作定位】Weakly-Supervised Temporal Action Localization by Inferring Salient Snippet-Feature 论文阅读

弱监督的时序动作定位旨在在未剪辑的视频中同时定位动作区域并识别动作类别,仅使用视频级标签作为监督。伪标签生成是一种解决这一具有挑战性问题的有前途策略,但当前的方法忽略了视频的自然时间结构,这种结构可以提供丰富的信息来辅助生成过程。在本文中,我们提出了一种通过推断显著片段特征的新颖弱监督时序动作定位方法。首先,我们设计了一个显著性推断模块,该模块利用时间相邻片段之间的变化关系来发现显著片段特征,这些

文章图片
#论文阅读#人工智能#深度学习 +1
【视频时刻定位】Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval 论文阅读

视频片段检索(Video Moment Retrieval, VMR)的目标是在未剪辑的视频中根据给定的语言查询检索出相应的时间片段,这通常是通过构建跨模态对齐策略来实现的。然而,现有的策略往往是次优的,因为它们忽略了模态不平衡问题,即视频中固有的语义丰富性远远超过给定的有限长度句子。因此,为了实现更好的对齐,一个自然的想法是增强视频模态以过滤掉与查询无关的语义,同时增强文本模态以捕捉更多与片段相

文章图片
#音视频#论文阅读#深度学习 +2
【弱监督时间动作定位】Weakly-Supervised Video Anomaly Detection with Snippet Anomalous Attention 论文阅读

随着研究人员对包含在未剪辑视频中的异常事件的兴趣日益增加,视频异常检测成为了一个热门研究方向。在各种视频异常检测场景中,弱监督视频异常检测由于在训练阶段缺乏逐帧标签,只能依靠视频级标签作为粗略监督,因此提出了重大挑战。以往的方法试图要么以端到端方式学习判别特征,要么采用两阶段自训练策略生成片段级伪标签。然而,这两种方法都有一定的局限性:前者往往忽略了片段级的信息特征,而后者容易受到噪声的影响。为了

文章图片
#论文阅读#深度学习#音视频
【弱监督语义分割】Self-supervised Image-specific Prototype Exploration for WSSS 论文阅读

弱监督语义分割(WSSS)基于图像级标签的研究因其低标注成本而受到广泛关注。现有方法通常依赖于类激活映射(CAM),该方法通过测量图像像素与分类器权重之间的相关性生成分割结果。然而,分类器往往只关注于判别性区域,而忽略了图像中其他有用的信息,导致生成的定位图不完整。为了解决这一问题,我们提出了一种自监督的图像特定原型探索方法(SIPE),包括图像特定原型探索(IPE)和通用-特定一致性(GSC)损

文章图片
#原型模式#论文阅读#深度学习 +2
【时间动作定位】End-to-end Temporal Action Detection with Transformer 论文阅读

时序动作检测(TAD)旨在确定未剪辑视频中每个动作实例的语义标签和时间区间。这是视频理解中一个基础且具有挑战性的任务。以前的方法使用复杂的流程来解决这个任务。它们通常需要训练多个网络,并涉及手工设计的操作,如非极大值抑制和锚生成,这限制了灵活性并阻碍了端到端学习。在本文中,我们提出了一种基于Transformer的端到端TAD方法,称为TadTR。给定一小组可学习的嵌入(称为动作查询),TadTR

文章图片
#transformer#论文阅读#深度学习 +2
【视频异常检测】PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer

PANDA是一种基于多模态大语言模型的通用视频异常检测系统,通过四大核心能力实现无需训练数据或人工干预的开放场景异常检测:(1)自适应场景感知策略规划,利用检索增强生成机制动态制定检测策略;(2)目标驱动的启发式推理,结合视觉增强工具进行结构化分析;(3)工具增强型自我反思,在不确定时调用专用工具收集额外证据;(4)自我改进的记忆链机制,通过历史经验持续优化性能。实验表明,PANDA在开放场景下展

#人工智能#论文阅读#深度学习 +1
【视频异常检测】PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer

PANDA是一种基于多模态大语言模型的通用视频异常检测系统,通过四大核心能力实现无需训练数据或人工干预的开放场景异常检测:(1)自适应场景感知策略规划,利用检索增强生成机制动态制定检测策略;(2)目标驱动的启发式推理,结合视觉增强工具进行结构化分析;(3)工具增强型自我反思,在不确定时调用专用工具收集额外证据;(4)自我改进的记忆链机制,通过历史经验持续优化性能。实验表明,PANDA在开放场景下展

#人工智能#论文阅读#深度学习 +1
计算机设计大赛(微课教学辅助类)国赛总结(国赛二等奖)

一、前言国赛结束也有几天了,从4月份准备比赛到5月出省赛再到7月低的国赛,跨时大概也有4哥月份了。在此期间也算付出了很多努力,结果对我来说也还算满意,拿了国赛二等奖,对于一等奖也没太大的期待,因为有些队伍做的微课确实非常完美,一等奖还是不敢渴求,二等奖也算是最完美的结果了。最为一名计算机专业的学生,参加这个微课类的比赛还是竞争力比不上师范类的学生的,这里还是强烈建议参加这个比赛的计算机学生参加we

EPSANet:一种基于卷积神经网络的高效金字塔切分注意力模块

在这项工作中,提出了一种新的轻量级和有效的注意力方法,名为金字塔切分注意力(PSA)模块。通过在ResNet的瓶颈层中用PSA模块替换3x 3卷积,得到了一个新模块EPSA。EPSA模块可以作为即插即用组件轻松添加到完善的骨干网络中,并可以显著提高模型性能。因此,在这项工作中,通过堆叠这些ResNet风格的EPSA块,开发了一个简单而高效的主干架构EPSANet。相应地,一个更强的多尺度表示能力,

文章图片
#python#深度学习
fatal: unable to access“xxx.xxx.xxx“ :Failed to connect to github.com port 443:connection timed out

github经常出现问题应该是之前不知道怎么设置了一些乱七八糟的代理。分别执行下面两个命令:取消全局代理:git config --global --unset http.proxygit config --global --unset https.proxy问题解决。参考链接:https://blog.csdn.net/Hodors/article/details/103226958...

#github
    共 56 条
  • 1
  • 2
  • 3
  • 6
  • 请选择