Awesome-LLMs-for-Video-Understanding - 基于大型语言模型的视频理解研究

Awesome-LLMs-for-Video-Understanding - 基于大型语言模型的视频理解研究

news2026/2/13 4:51:33

Awesome-LLMs-for-Video-Understanding 是基于大型语言模型的视频理解研究

github : https://github.com/yunlong10/Awesome-LLMs-for-Video-Understanding
paper：Video Understanding with Large Language Models: A Survey
https://arxiv.org/pdf/2312.17432

视频理解的发展

为什么我们需要 vid-llms ?

😎 Vid-LLMs：模型

🤖基于llm的视频代理

Title	Model	Date	Code	Venue
Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language	Socratic Models	04/2022	project page	arXiv
Video ChatCaptioner: Towards Enriched Spatiotemporal Descriptions github	Video ChatCaptioner	04/2023	code	arXiv
VLog: Video as a Long Document github	VLog	04/2023	code	-
ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System	ChatVideo	04/2023	project page	arXiv
MM-VID: Advancing Video Understanding with GPT-4V(ision)	MM-VID	10/2023	-	arXiv
MISAR: A Multimodal Instructional System with Augmented Reality github	MISAR	10/2023	project page	ICCV
Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos	Grounding-Prompter	12/2023	-	arXiv
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation	NaVid	02/2024	project page -	RSS
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding	VideoAgent	03/2024	project page	arXiv

👾 Vid-LLM 预训练

标题	模型	日期	代码	聚会地点
从大型语言模型中学习视频表示 github	LaViLa	12/2022	代码	CVPR的
Vid2Seq:密集视频字幕视觉语言模型的大规模预训练	Vid2Seq	02/2023	代码	CVPR的
一个视觉-音频-字幕-文本全模态基础模型和数据集 github	VAST	05/2023	代码	神经IPS
Merlin : 赋予多式联运 LLM 以远见	Merlin	12/2023	-	arXiv的

👀Vid-LLM指令调优

使用连接适配器进行微调

标题	模型	日期	代码	聚会地点
Video- llama : 一个用于视频理解的教学微调视觉语言模型 github	Video-LLaMA	06/2023	代码	arXiv的
VALLEY : 视频助手与大语言模型增强能力 github	VALLEY	06/2023	代码	-
视频聊天技术:通过大视觉和语言模型实现详细的视频理解 github	Video-ChatGPT	06/2023	代码	arXiv的
多模态语言建模与图像、音频、视频和文本集成 github	Macaw-LLM	06/2023	代码	arXiv的
LLMVA-GEBC:用于通用事件边界字幕的带有视频适配器的大型语言模型 github	LLMVA-GEBC	06/2023	代码	CVPR的
Youku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集 github	mPLUG-video	06/2023	代码	arXiv的
MovieChat:从密集令牌到稀疏记忆的长视频理解 github	mPLUG-video	07/2023	代码	arXiv的
大型语言模型是视频问答的时间和因果推理器 github	LLaMA-VQA	10/2023	代码	EMNLP
Video-LLaVA:通过投影前的对齐学习统一的视觉表现 github	Video-LLaVA	11/2023	代码	arXiv的
Chat-UniVi:统一的视觉表示使大型语言模型具有图像和视频理解能力 github	Chat-UniVi	11/2023	代码	arXiv的
LLaMA-VID:在大型语言模型中，一个图像值2个符号 github	LLaMA-VID	11/2023	代码	arXiv的
VISTA-LLAMA:可靠的视频叙述者通过相等距离的视觉标记	VISTA-LLAMA	12/2023	-	arXiv的
视频理解视听 LLM	-	12/2023	-	arXiv的
AutoAD:上下文中的电影描述	AutoAD	06/2023	代码	CVPR的
AutoAD II:续集-谁，什么时候，什么在电影音频描述	AutoAD II	10/2023	-	ICCV
多模态大型语言模型的细粒度视听联合表示 github	FAVOR	10/2023	代码	arXiv的
VideoLLaMA2:推进时空建模和音频理解视频 LLM github	VideoLLaMA2	06/2024	代码	arXiv的

使用插入适配器进行微调

标题	模型	日期	代码	聚会地点
Otter : 具有上下文指令调优的多模态模型 github	Otter	06/2023	代码	arXiv的
VideoLLM : 用大语言模型建模视频序列 github	视频 LLM	05/2023	代码	arXiv的

混合适配器微调

标题	模型	日期	代码	聚会地点
VTimeLLM:授权 LLM 掌握视频时刻 github	VTimeLLM	11/2023	代码	arXiv的
GPT4Video:用于指令跟随理解和安全意识生成的统一多模态大语言模型	GPT4Video	11/2023	-	arXiv的

🦾混合方法

标题	模型	日期	代码	聚会地点
VideoChat:以聊天为中心的视频理解 github	VideoChat	05/2023	代码演示	arXiv的
PG-Video-LLaVA:像素接地大型视频语言模型 github	PG-Video-LLaVA	11/2023	代码	arXiv的
TimeChat:用于长视频理解的时间敏感多模态大型语言模型 github	TimeChat	12/2023	代码	CVPR的
Video-GroundingDINO : 走向开放词汇时空视频接地 github	Video-GroundingDINO	12/2023	代码	arXiv的
一个视频价值4096个代币:用语言描述视频，以零镜头理解它们	Video4096	05/2023		EMNLP

🦾免培训方法

标题	模型	日期	代码	聚会地点
SlowFast-LLaVA : 视频大型语言模型的强大无训练基线	SlowFast-LLaVA	07/2024	-	arXiv的

任务、数据集和基准

认知与预期

名字	纸	日期	链接	聚会地点
Charades	家庭中的好莱坞:众包数据收集以了解活动	2016	链接	ECCV
YouTube8M	YouTube-8M:一个大规模视频分类基准	2016	链接	-
ActivityNet	ActivityNet:人类活动理解的大规模视频基准	2015	链接	CVPR的
Kinetics-GEBC	GEB:通用事件边界标注、基础和检索的基准	2022	链接	ECCV
**Kinetics-400	动力学人类动作视频数据集	2017	链接	-
VidChapters-7M	VidChapters-7M : 视频章节的规模	2023	链接	神经IPS

标题和描述

名字	纸	日期	链接	聚会地点
微软研究视频描述语料库 \| Microsoft Research Video Description Corpus (MSVD)	为释义评估收集高度平行的数据	2011	链接	ACL
微软研究院视频转文本(MSR-VTT)	MSR-VTT:用于桥接视频和语言的大型视频描述数据集	2016	链接	CVPR
Tumblr GIF (GIF)	TGIF:动画GIF描述的新数据集和基准	2016	链接	CVPR
Charades	家庭中的好莱坞:活动理解的众包数据收集	2016	链接	ECCV
Charades-Ego	演员和观察者:第一人称和第三人称视频的联合建模	2018	链接	CVPR
ActivityNet Captions	视频中的密集字幕事件	2017	链接	ICCV
HowTo100m	HowTo100M:通过观看1亿段视频片段来学习文本视频嵌入	2019	链接	ICCV
Movie Audio Descriptions (MAD)	一个可扩展的数据集，用于从电影音频描述的视频的语言基础	2021	链接	CVPR的
YouCook2	基于网络教学视频的程序自动学习	2017	链接	AAAI
MovieNet	MovieNet:电影理解的整体数据集	2020	链接	ECCV
Youku-mPLUG	Youku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集	2023	链接	arXiv
Video Timeline Tags (ViTT)	密集视频字幕的多模态预训练	2020	链接	AACL-IJCNLP
TVSum	TVSum:使用标题总结网络视频	2015	链接	CVPR的
SumMe	从用户视频创建摘要	2014	链接	ECCV
VideoXum	VideoXum:视频的跨模态视觉和纹理摘要	2023	链接	IEEE Trans Multimedia
Multi-Source Video Captioning (MSVC)	VideoLLaMA2:推进时空建模和音频理解视频 LLM	2024	链接	arXiv

接地与回收

名字	纸	日期	链接	聚会地点
Epic-Kitchens-100	重新调整自我中心视野	2021	链接	IJCV
VCR (Visual Commonsense Reasoning)	从识别到认知:视觉常识推理	2019	链接	CVPR的
Ego4D-MQ 和 Ego4D-NLQ	Ego4D:环游世界在3000小时的自我中心视频	2021	链接	CVPR的
Vid-STG	它在哪里:多形式句子的时空视频基础	2020	链接	CVPR的
Charades-STA	TALL:通过语言查询进行时间活动定位	2017	链接	ICCV
DiDeMo	用自然语言定位视频中的瞬间	2017	链接	ICCV

问题回答

名字	纸	日期	链接	聚会地点
MSVD-QA	通过对外观和动作的逐渐细化的注意进行视频问答	2017	链接	ACM Multimedia
MSRVTT-QA	通过对外观和动作的逐渐细化的注意进行视频问答	2017	链接	ACM Multimedia
TGIF-QA	TGIF-QA:面向视觉问答的时空推理	2017	链接	CVPR
ActivityNet-QA	ActivityNet-QA:一个通过问答来理解复杂网络视频的数据集	2019	链接	AAAI
Pororo-QA	DeepStory:视频故事QA由深度嵌入式记忆网络	2017	链接	IJCAI
TVQA	TVQA:本地化，组合视频问答	2018	链接	EMNLP

视频教学调优

预训练数据集

名字	纸	日期	链接	聚会地点
VidChapters-7分钟	视频章节- 7m:视频章节的规模	2023	链接	神经IPS
值为1米	VALOR:视觉-听觉-语言全感知预训练模型和数据集	2023	链接	arXiv的
Youku-mPLUG	Youku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集	2023	链接	arXiv的
InternVid（英语：InternVid）	intervid:用于多模态理解和生成的大规模视频文本数据集	2023	链接	arXiv的
VAST-27M	一个视觉-音频-字幕-文本全模态基础模型和数据集	2023	链接	神经IPS

微调数据集

名字	纸	日期	链接	聚会地点
模仿它	MIMIC-IT:多模态上下文指令调谐	2023	链接	arXiv的
VideoInstruct100K	视频聊天技术:通过大视觉和语言模型实现详细的视频理解	2023	链接	arXiv的
TimeIT公司	TimeChat:用于长视频理解的时间敏感多模态大型语言模型	2023	链接	CVPR的

基于视频的大型语言模型基准

标题	日期	代码	聚会地点
LVBench:一个极长的视频理解基准	06/2024	代码	-
Video-Bench:用于评估基于视频的大型语言模型的综合基准和工具包	11/2023	代码	-
感知测试:多模态视频模型的诊断基准	05/2023	代码	NeurIPS 2023， ICCV 2023 研讨会
Youku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集 github	07/2023	代码	-
FETV:开放域文本到视频生成的细粒度评估基准 github	11/2023	代码	神经IPS 2023
MoVQA:理解长篇电影的通用问答基准	12/2023	代码	-
MVBench:一个全面的多模态视频理解基准	12/2023	代码	-
TempCompass:视频 LLM 真的懂视频吗? github	03/2024	代码	ACL 2024
Video- mme:首个视频分析中多模态 LLM 的综合评估基准 github	06/2024	代码	-
视频幻觉:在大型视频语言模型中评估内在和外在幻觉 github	06/2024	代码	-

2024-08-24（六）

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.coloradmin.cn/o/2072138.html

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈，一经查实，立即删除！

相关文章

五、前后端分离通用权限系统（5）

五、前后端分离通用权限系统（5）

🌻🌻 目录一、前端框架1.1、vue-element-admin1.1.1、Vue 概述1.1.2、Element-ui 概述1.1.3、ES6 概述 1.2、vue-admin-template1.2.1、简介1.2.2、下载1.2.3、安装1.2.4、源码目录结构（了解）1.2.5、改造登录&退出功能1.2.5.…

阅读更多...

跨域解决 | 面试常问问题

跨域解决 | 面试常问问题

跨域解决 | 面试常问问题跨域问题一直是前端开发中不可避免的一部分，它涉及到浏览器的同源策略和安全机制。本文将深入解析跨域问题的本质，并探讨前端和后端的多种解决方案，同时分享一些扩展与高级技巧。最后，我们还将总结跨域解…

阅读更多...

K8S系列——（二）、K8S部署RocketMQ集群

K8S系列——（二）、K8S部署RocketMQ集群

1、环境准备要将RocketMQ部署到K8S上，首先你需要提前准备一个K8S集群环境，如图我已经准备好了一个版本为 v1.28.13 的 K8S 集群（其他版本也没问题）： 角色IPMaster192.168.6.220Node-1192.168.6.221Node-2192.168.6.…

阅读更多...

浏览器不开梯子无法上网，检查代理或防火墙或者找不到服务器ip地址

浏览器不开梯子无法上网，检查代理或防火墙或者找不到服务器ip地址

1、代理没有关闭检查代理是否关闭检查方法1： 在控制面版中找到Internet选项，点击连接栏，在连接栏中选择局域网设置。之后将代理服务器下面的框选中的对勾取消。最终如下检查方法2： 打开设置，找到网络和internet…

阅读更多...

书生浦语大模型实战营：LMDeploy量化部署

书生浦语大模型实战营：LMDeploy量化部署

1.任务： 使用结合W4A16量化与kv cache量化的internlm2_5-1_8b-chat模型封装本地API并与大模型进行一次对话。 2.背景： 1.计算模型需要的权重大小： 1B代表10个亿参数，假如是16位浮点数（f16），也…

阅读更多...

计算机视觉概念科普

计算机视觉概念科普

计算机视觉（Computer Vision, CV）是一门多学科交叉的科学，旨在让计算机具备“看”的能力，即通过图像或视频数据来理解世界。它结合了信号处理、图像处理、模式识别、机器学习等多个领域的技术，让计算机能够执行诸如识别…

阅读更多...

【Python学习手册（第四版）】学习笔记20.2-迭代和解析（二）-迭代解析、迭代方法的计时比较、函数陷阱

【Python学习手册（第四版）】学习笔记20.2-迭代和解析（二）-迭代解析、迭代方法的计时比较、函数陷阱

个人总结难免疏漏，请多包涵。更多内容请查看原文。本文以及学习笔记系列仅用于个人学习、研究交流。本文较简单，主要是概括了解析语法（列表解析、生成器、集合、字典解析），以及对前面的各种迭代进行计时比较&#xf…

阅读更多...

通过python解决原神解密

通过python解决原神解密

最近楼主玩原神世界任务做到稻妻了，在稻妻有很多解密游戏，但是博主最头疼的就是稻妻的石头解密QAQ（如图） 就在昨晚，楼主又碰到了石头解密，瞎打，半天解不出来。于是就想，有没有什么严…

阅读更多...

如何在Windows下使用make编译Makefile

如何在Windows下使用make编译Makefile

最近有小伙伴咨询我去编译运行一个程序。我一开始以为是CMakeLists，结果发现是makefile。什么是Makefile ‌Makefile是一种用于自动化构建和管理程序的工具‌，它定义了项目中文件的依赖关系和构建步骤，帮助程序员自动化编译、链接和打包程序…

阅读更多...

Ps：创建帧动画

Ps：创建帧动画

在 Photoshop 中，帧动画 Frame Animation是一种通过在“时间轴”面板中创建和管理多个帧来实现动画效果的方式。所谓帧动画，也就是传统意义上的逐帧动画，依次播放每个帧而构成的动画形式。每个帧记录了“图层”面板上所有图层的属性状态&…

阅读更多...

QT Mainwindow下指定控件的setMouseTracking(true)和mousemoveevent函数失效-问题解决

QT Mainwindow下指定控件的setMouseTracking(true)和mousemoveevent函数失效-问题解决

目录： 一，问题描述二，解决方法2.1解决依据2.2方法实操三，参考资料一，问题描述 ☀️之前碰到过的一个问题，现在分享出来：想在qt哪里搞个鼠标移动在控件显示的图片上，然后实时显示对…

阅读更多...

[数据集][目标检测]红外场景下车辆和行人检测数据集VOC+YOLO格式19069张4类别

[数据集][目标检测]红外场景下车辆和行人检测数据集VOC+YOLO格式19069张4类别

数据集格式：Pascal VOC格式YOLO格式(不包含分割路径的txt文件，仅仅包含jpg图片以及对应的VOC格式xml文件和yolo格式txt文件) 图片数量(jpg文件个数)：19069 标注数量(xml文件个数)：19069 标注数量(txt文件个数)：19069 标…

阅读更多...

一文带你画PCB板，有手就行

一文带你画PCB板，有手就行

背景最近写Autosar网络唤醒功能，想在实际硬件上验证，但是市面上没有找到板子验证，只能找人帮忙画PCB板。但是这里遇到比较大的问题，1、整个周期会比较长，板子不太可能一次就能完成，中间会出现修改的地方&…

阅读更多...

C#/.NET/.NET Core技术前沿周刊 | 第 1 期（2024年8.12-8.18）

C#/.NET/.NET Core技术前沿周刊 | 第 1 期（2024年8.12-8.18）

前言 C#/.NET/.NET Core技术前沿周刊，你的每周技术指南针！记录、追踪C#/.NET/.NET Core领域、生态的每周最新、最实用的技术文章、社区动态、优质项目和学习资源等。让你时刻站在技术前沿，助力技术成长与视野拓宽。欢迎投稿，推荐…

阅读更多...

【蓝牙协议栈】【BLE】【GATT】精讲GATT Profile架构（图文并茂精华版）

目录 1. 蓝牙BLE通用属性协议（GATT） 2.GATT角色介绍 3.GATT 层级和Profile架构 4. GATT Server架构（重点内容） 5. Characteristic架构（重点内容） 6. (Characteristic Properties)特性属性详解&#x…

阅读更多...

一款免费的目录以及文件对比工具，替代Beyond Compare

一款免费的目录以及文件对比工具，替代Beyond Compare

Beyond Compare是一款功能强大的文件对比工具，但是由于是付费软件，很多没有购买的企业用户无法使用。CCompare就是一款替代Beyond Compare的免费方案，一款来自中国的可替换beycond compare, 免费使用的代码同步对比工具。 CCompare 是一款功…

阅读更多...

【科研绘图】【分条热力图】：附Origin详细画图流程 + 案例分析

【科研绘图】【分条热力图】：附Origin详细画图流程 + 案例分析

目录 No.1 理解分条热力图 No.2 画图流程 1 导入数据，绘制图形 2 设置绘图细节 3 色阶控制 4 设置坐标轴 5 效果图 No.3 案例分析 1 案例一 2 案例二 No.1 理解分条热力图分条热力图，基于数据映射和颜色编码，是在热力图的基础上进…

阅读更多...

聚星文社下载地址

聚星文社下载地址

聚星文社绘唐科技是一个文化传媒公司，以绘制唐朝相关的科技设备和场景为主题。该公司致力于通过插画、动画、游戏等形式，栩栩如生地展现唐朝时期的科技发展和生活场景。聚星文社下载地址https://iimenvrieak.feishu.cn/docx/ZhRNdEWT6oGdCwxdhOPcdds7n…

阅读更多...

unity Standard Assets资源商店无法安装解决方案

unity Standard Assets资源商店无法安装解决方案

Unity游戏开发 “好读书，不求甚解；每有会意，便欣然忘食。” 本文目录： Unity游戏开发 Unity游戏开发unity中国嗨嗨嗨，我来啦。这几天的川渝之旅已经圆满结束了，今天开始正常给大家更新： Unity…

阅读更多...

TiggerRamDisk绕过激活界面，支持最新iOS17.4.1绕过

TiggerRamDisk绕过激活界面，支持最新iOS17.4.1绕过

iOS15等待越狱的日子实在太久了！checkra1n越狱目前还未发布iOS15系统越狱。可很多朋友不小心或者大意已经升级到了最新iOS15系统。一般来说这并没有什么大碍，但如果是绕过激活的设备，或者忘记账户密码而刷机的设备，就会面临无法…

阅读更多...

推荐文章

最新文章