logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Vid-Agent】长视频理解VideoTemp-o3框架

论文核心:让视频大模型学会“先找关键时间段,再放大看这段视频,最后回答问题”的长视频 Agent 模型。它不是简单均匀抽帧看完整视频(以往这样如果漏抽对应帧就会遗漏信息),而是走 localize → clip → answer 流程:localize:temporal grounding,定位视频时间范围crop:从原视频里截取这个时间段的视频 clip,并更密集抽帧给模型看。注意这里不是对视频

文章图片
#多模态
【VLM】视频理解benchmark:Video-MME v1和v2

基准内置12种独立任务题型,覆盖基础视觉→时序动态→高阶综合推理全维度:时序行为、运动模式、多目标跨帧追踪、时序先后推理、事件因果推导、长视频摘要、跨模态信息融合、多语言视频理解、细节定位、空间关系推理、抽象剧情理解、多线索综合问答文章目录note一、Video-MME二、Video MME 12类任务体系三、Video MME关键实验结果Reference一、Video-MME论文:Video-

文章图片
【VLM】视频理解LLaVA-OneVision-2(Codec-stream)

LLaVA-OneVision-2(LLaVA-OV-2) 是 LLaVA-OneVision 系列的下一代开源多模态大模型,定位是一个 8B 级统一视觉语言模型:同一个模型同时处理 图像、长视频、空间定位、时间定位、目标跟踪、操作轨迹理解 等任务。官方项目页强调它是 “fully-open recipe”,模型、数据、训练流程、日志都开放;论文摘要也说它是目前 OneVision 系列里能力最强

文章图片
【VR】视频检索V-Agent: An Interactive Video Search System Using Vision-Language Models

训练一个视频表征模型,用于query文本检索召回视频。文本、视频画面、ASR 文本处于同一个向量空间中的跨模态表征。因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理multi-agent:Routing Agent:判断该聊天还是搜索。Search Agent:调用检索模型召回 Top-10,再调用 LLM 重排。Chat Agent:基于

文章图片
#vr#音视频#多模态
【全模态】音视频理解模型Audio-Visual Flamingo

给出了一套比较完整的 长视频 Omni 模型训练 recipe:AV-Skills 数据 → Short → Long → Timestamp CoT → GRPOAV-Flamingo 是一个面向长视频 Audio-Visual 理解的开源 7B 模型,核心贡献不是新 Backbone,而是 AV-Skills 大规模音视频数据、Short→Long 课程训练,以及带时间戳的 TAVIT CoT

文章图片
#音视频
【VQA】VideoChat3长视频理解模型

VideoChat3 通过 I3D-ViT 早期时空压缩 + 自适应分辨率 + 大规模重标注/合成视频指令数据 + 四阶段训练,在完全开源的前提下,用 4B 参数实现了在通用、长视频、流式视频理解上优于同/更大规模开源模型的性能,并显著提升长视频推理效率和主动流式交互能力。通用长视频多模态大模型,针对现有视频MLLM痛点:普遍将视频拆分为独立图片序列编码,丢失帧间时序运动信息;长视频输入易出现To

文章图片
#音视频#多模态
【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型

Qwen3.8-Omni-Flash1、向 Qwen3.8-Omni-Flash 提出了一项任务:在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力,并交付可用模型。它自主选定 WenetSpeech-Chuan 评测集、固定评测标准并完成基线测试,随后直接听取语音样本,结合识别结果诊断问题,构建针对性的训练数据。在连续 4 轮实验中,Agent 累计构建了 3,413 条训练

文章图片
#音视频
解决error: cannot overwrite multiple values with a single value Use a regexp, --add or --replac

一、问题描述一开始是用git时遇到报错:fatal: unable to access 'https://github.com/modelscope/modelscope-agent.git/': Could not resolve host: socks5显示是和git代理设置有关,因为想着是使用SOCKS5代理,所以可以使用以下命令来设置代理:git config --global http.

文章图片
#git
解决Python in worker has different version 3.10 than that in driver 3.8, PySpark cannot run

上面是因为pyspark的python环境和driver(主节点)的python环境版本不一致导致。注意driver(主节点master)上用的是虚拟环境conda里面的默认python版本,而worker是使用系统python版本。为了python版本一致,设置pyspark的python环境(worker的python版本)和driver的python版本一致。会优先,如果没有设置,则直接使用

文章图片
#python#spark#大数据
【1110】Complete Binary Tree (25分)【完全二叉树】

#include<iostream>#include<stdio.h>#include<stdlib.h>#include<math.h>#include<string.h>#include<algorithm>#include<map>#include<vector>#inclu...

    共 464 条
  • 1
  • 2
  • 3
  • 47
  • 请选择