视频
对视频的文本提取答题分为两大类:视频理解,视频总结(先提取文本内容,然后进行总结)
视频分为:
- 有音频的视频:可以直接提取音频;字幕和视频内容是否相关。不相关的话应该以字幕为主?
- 无音频的视频:直接提取视频内容
音频 != 字幕
音频(audio):指视频中的背景声音。 语音(Speech):包含视频中口头内容 音频和语音通常是分开处理的。音频被视为单个实体,语音被转录为文本;语音由专门的语音编码器处理,通常是预训练的语音识别模型(Whisper)。
采用多模态大模型直接进行内容总结:需要prompt调优
探索端到端的视频总结模型
VideoChat: Chat-Centric Video Understanding
视频理解综述
视频理解是一项挑战,它激发了众多创新任务的诞生,以增强模型的视频解释能力。 该领域从视频分类和动作识别等基础任务(将视频分为预定义的类别)发展到包含更复杂的任务。这些任务包括为视频添加详细描述的字幕和回答有关视频内容的问题。后者不仅需要理解视频,还需要用逻辑和常识进行推理。 随着该领域的发展,任务变得越来越复杂和具有挑战性,需要具有接近人类视频解释水平的模型。我们将视频理解的主要任务总结如下: 识别和预测。这些任务与视频理解密切相关,侧重于视频中的时间连续性和进展。 字幕和摘要。这些任务侧重于更细粒度的细节,涉及为每个时刻创建准确而具体的文本描述,并提炼视频的精髓,从而概括其总体主题和关键叙述。它们提供了视频内容的详细和广泛的视角。 基础和检索。将视觉内容与文本上下文无缝链接,属于此类别的任务需要模型识别与提供的文本描述准确对应的特定视频或片段。 问答。这些任务强调模型不仅能够理解视频的视觉和听觉成分,而且还能够整合外部知识和推理能力以提供与上下文相关的答案。
为了使 LLM 能够解释视频内容,主要有两种方法: (i) 利用预先训练的视觉模型从视频中提取文本信息,并将其格式化为 LLM 生成响应的提示。(ii) 将 LLM 与视觉模型相结合,并采用微调或预训练策略,以创建可以处理视频内容的统一模型。
像 GPT-4 这样的高级大型语言模型能够充当控制器,指导视觉模型执行特定任务。在这个框架内,视觉模型主要充当翻译器,将视觉信息转换为语言领域。视觉模型的热门选择包括字幕,它提供整个帧或特定区域的文本描述,而标记模型为视图中的实体提供标签。这些模型通常在广泛的数据集上进行了预先训练,并且易于集成。
然后将这些视觉模型提取的语言信息制定为 LLM 的提示。这使 LLM 能够生成响应或请求其他信息。视觉模型在这个交互过程中起着至关重要的作用,它根据 LLM 的要求提供更详细或更具体的信息。LLM 和视觉模型之间的这种协作创建了一个能够解释和响应复杂视觉输入的动态系统。
在微调方面,主要有两种流行的类别:
Frame-based Encoders。这些编码器独立处理每个视频帧。此类别中的大多数是 CLIP [107] 的变体,因其卓越的性能和多功能性而备受推崇。这些变体主要在块大小和输入分辨率方面有所不同,趋向于使用更高的分辨率进行详细了解以提高性能。
Temporal Encoders。时间编码器,以 TimeSformer [46] 为一个显著的例子,将视频视为有凝聚力的实体,强调内容的时间元素。除了利用预训练模型外,一些努力还致力于从头开始开发基础视频模型,使用对比或监督预训练方法,如第 3.2 节所述。
鉴于这些视频编码器的多样性,它们处理的输入视频的长度可能有很大差异,从仅包含几帧的短片到包含数百帧的长视频。为了有效地管理这种变化,采用了视频建模模块。该模块将帧级特征聚合为一个有凝聚力的视频级特征。这种聚合的复杂性可以从简单的池化方法到更先进的基于内存的技术。
Vid-LLMs: Models
根据LLM在视频理解中的功能,我们把Vid-LLM方法分为几大类:
- LLM-based video agents: Video ChatCaptioner、VLog、、MM-VID
- Vid-LLM pretraining: LaViLa、Vid2Seq、VAST
- Vid-LLM instruction tuning,指令微调:Video-LLaMA、VALLEY、Video-ChatGPT
- hybrid methods(组合了fine-tuning和LLM-based video agents)
未来的挑战
虽然目前的方法通过对大量视频数据进行预训练和微调来提高各种下游任务的有效性,并且LLM的引入可以更好地理解视频中的各种信息,但在面对现实世界中多样化的视频理解任务时仍有许多挑战尚未解决。
细粒度视频理解。细粒度的视频理解仍是一个挑战。无论是在视频的时间理解领域还是视觉基础领域,数据集的缺乏和研究的不足使得视频理解任务很难达到更细的粒度。此外,处理和分析视频数据需要大量的计算资源。细粒度的理解通常意味着分析每个视频帧,这大大增加了计算负荷。此外,视频不仅包含空间信息,还包含时间信息。理解对象如何随时间变化和交互,特别是在细粒度级别,比想象的要复杂得多。更进一步,理解视频内容的更深层次的语义,如情感、隐喻或复杂场景的动态,比仅仅识别对象或动作更困难。LLM和视频的结合为细粒度的视频理解带来了一线希望。LLM使文本能够在各个层面与视频保持一致,部分解决了细粒度视频理解的问题。
长期视频理解。由于长视频包含大量帧,长视频的延长持续时间增加了分析的复杂性,特别是在理解随时间变化的事件和行为方面。因此,识别关键事件并在长视频中保持注意力是困难的。需要有效的机制来检测和突出显示重要部分,特别是在内容丰富或情节复杂的视频中。
多模态视频理解。多模态视频理解需要整合不同类型的数据,如视觉、音频和文本,以便更好地理解视频。对齐这些数据,特别是在空间和时间同步方面,尤为关键。该领域缺乏相关研究,数据集稀缺。此外,构建此类数据集面临挑战,因为确保数据注释的高质量和一致性通常很困难。在方法论方面,提取和利用不同模态的有效特征是实现精确视频理解的关键,但这个过程充满了挑战。
视频理解中的人机交互。视频理解的结果最终服务于人类,因此如何更好地传达人类的需求并理解模型结果也是一个非常重要的问题。 LLM 的出现使得视频理解模型和人类能够更有效地通过文本传达信息。然而,LLM 并没有完全解决交互问题。例如,使用文本来指导模型对视频的理解不能 视频理解中的人机交互。视频理解的结果最终服务于人类,因此如何更好地传达人类的需求并理解模型结果也是一个非常重要的问题。 LLM 的出现使得视频理解模型和人类能够更有效地通过文本传达信息。然而,LLM 并没有完全解决交互问题。例如,使用文本来指导模型对视频的理解无法处理极其细粒度的视频理解;同样,当模型输出文本时,它无法精确描述视频中的复杂内容。此外,由于视频编码器和 LLM 的能力,一些高级信息,如人物情绪和态度,无法得到很好的表示。因此,如何使用其他提示,如点、涂鸦等,来优化人类与视频理解模型的交互值得研究。此外,如何提高视频编码器保留细节的能力也是一个主要问题。
多模态 LLM 中的幻觉。 “幻觉”是指模式产生的响应与相关源材料或输入明显脱节的现象。这可能导致产生与提供的视频不符的、高度错误或不切实际的描述。在使用 LLM 进行视频理解时,造成这种情况的主要原因如下:1. 视觉特征提取不足。2. 视频上下文内容的影响。3. 视觉特征域与语言域之间的域差距。4. LLM 固有的幻觉。因此,为了解决幻觉的影响,可以从提高视频编码器的有效性、增强对长期时空上下文的理解以及视觉潜在空间与语言潜在空间之间的协作中找到解决方案。
Foundation Models for Video Understanding: A Survey
视频基础模型 (ViFM) 旨在学习各种视频理解任务的通用表示。利用大规模数据集和强大的模型,ViFM 通过从视频数据中捕获稳健和通用的特征来实现这一目标。 本调查分析了 200 多个视频基础模型,全面概述了 14 个不同视频任务的基准和评估指标,这些任务分为 3 个主要类别。此外,我们还针对 6 个最常见的视频任务对这些模型的性能进行了深入分析。 我们将 ViFM 分为三类:1) Image-based ViFM,它调整现有的图像模型以用于视频任务;2) Video-based ViFM,它利用特定于视频的编码方法;3) 通用基础模型 (UFM),它在单个框架内结合了多种模态(图像、视频、音频和文本等)。 通过比较各种 ViFM 在不同任务上的表现,本调查提供了有关其优缺点的宝贵见解,指导了未来视频理解的进步。我们的分析令人惊讶地发现,基于图像的基础模型在大多数视频理解任务上的表现始终优于基于视频的模型。此外,利用多种模态的 UFM 在视频任务上表现出色。
Our survey categorizes ViFMs into three groups: i) Image-based ViFMs: Trained solely on image data. ii) Video-based ViFMs: Leveraging video data during training. iii) Universal Foundation Models (UFMs): Combining various modalities (image, video, audio, text) during pretraining.
Different architecture patterns in ViFMs can be broadly categorized as: unimodal and multi-modal. Unimodal ViFMs focus on a single modality (e.g., video) and typically employ generative objectives like mask reconstruction
视频理解的主要任务 视频理解的实现方案
我们适合采用哪种方案来实现,优缺点
通用的解决方案:基于LLM的方案和基于OCR的解决方案,二者之间的区别
chatVideo
ChatVideo 是一个以轨迹为中心的多模态视频理解系统,它将 ChatGPT 与各种视频基础模型 (ViFM) 集成在一起,以标记视频特征、参与用户交互并解决现实世界中与视频相关的问题和场景。 ChatVideo 采用以轨迹为中心的方法,主要通过“轨迹”的基本单元而不是传统的逐帧方法来解释视频数据。 ChatVideo 使用 Whisper 和 Wav2Vec 2.0 处理音频和语音。 总体而言,ChatVideo 执行交互式多模态视频理解,通过无轨迹中心处理实现丰富的视频分析,包括考虑外观、运动和音频方面以及用户驱动的查询交互。
VideoChat
在本文中,我们尝试开发一个端到端的以聊天为中心的视频理解系统,称为 VideoChat。 它通过可学习的神经接口集成了视频基础模型和大型语言模型,在时空推理、事件定位和因果关系推理方面表现出色。 为了指导性地调整这个系统,我们构建了一个以视频为中心的指令数据集,该数据集由数千个与详细描述和对话相关的视频组成。 该数据集强调时空推理并捕捉因果关系,为训练我们以聊天为中心的视频理解系统提供了宝贵的资产。 初步定性实验证明了我们的系统在广泛视频应用中的潜力,它可以作为未来以聊天为中心的视频理解研究的简单原型系统。
We begin by presenting our novel video-centric multimodal dialogue system. We propose an innovative system architecture that combines video foundation models and large language models (LLMs) through a learnable neural interface. By a two-stage lightweight training (with only spatiotemporal and video-language alignment modules) on large-scale video-text datasets and self-built video instruction ones, our method excels in spatiotemporal perception & reasoning, and causal inference, marking the first attempt to create a fully learnable and efficient video understanding system that facilitates effective communication.
we treat an LLM as a universal video task decoder, turning video-related descriptions or embeddings into human-understandable text. This procedure is user-friendly in employing foundation models to address various video applications.
具体来说,对于给定的视频,我们使用 ffmpeg 以低 FPS 从视频中提取关键帧,从而产生 T 视频帧和相关音频。 通过将提取的帧和音频输入到各种模型中,我们获得动作标签、帧摘要、视频标签、综合描述、对象位置坐标、视频叙述、时间戳和其他与片段相关的细节。 然后,我们根据时间合并字幕中的相关内容,并生成带时间戳的视频文本描述。我们将首先概述所采用的视觉模型和提示示意图,然后以对 VideoChat-Text 的分析作为结束。
- VideoChat-Text 和 VideoChat-Embed 都难以管理长时间视频(≥ 1 分钟)。一方面,有效且高效地对长视频的上下文进行建模仍然是一个复杂且持久的研究问题。相反,在努力提供用户友好的交互的同时处理较长的视频时,平衡响应时间、GPU 内存使用率和用户对系统性能的期望变得具有挑战性。
- 我们系统的时间和因果推理能力仍然处于初级阶段。这些限制源于我们指令数据的当前规模及其构造方法,以及整个系统的规模和所采用的模型。
- 解决时间敏感和性能关键型应用程序(例如以自我为中心的任务指令预测和智能监控)中的性能差异是一项持续的挑战。