海域重启礼包码汇总 海域重启最新可用兑换码分享
2026-07-21
2026-07-22 0
视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。面向物理世界的视频智能,难点早已不只是 “看懂一段短片”,而是需要看清细微的动作,处理小时级的长程信息,还能应对持续到来的实时视频流;它不仅要回答 “发生了什么”,还要判断 “证据出现在哪里” 与 “什么时候应该回应”。
与此同时,海量视频帧带来的视觉 token 会随时长快速增长,模型的训练与推理成本也随之攀升。有没有可能用一个高效模型,同时兼顾短视频、长视频和在线视频理解?
近日,南京大学、上海人工智能实验室、南洋理工大学和北京大学的研究团队发布 了 VideoChat3。这是一个面向通用视频理解的 4B 参数多模态大模型。围绕 “全面、高效、开源” 三个目标,研究团队从视觉编码器架构、流式感知机制和训练数据体系三个层面进行系统设计。
实验结果表明,VideoChat3 在时序感知、长视频理解、视频推理、时序定位和在线流式理解等多类任务上取得了具有竞争力的结果,并在长视频推理中显著降低了视觉 token 数量与计算成本。更重要地,VideoChat3 进行了全栈开源(数据、代码、模型权重全部开源),旨在促进视频理解大模型开源生态建设。
论文题目:VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
论文链接:https://arxiv.org/pdf/2607.14935
项目主页:https://mcg-nju.github.io/VideoChat3
代码仓库:https://github.com/MCG-NJU/VideoChat3
模型与数据:https://huggingface.co/collections/MCG-NJU/videochat3

不必时刻 “全神贯注”:让视觉预算随视频流动态分配
离线视频问答通常默认模型已经看完整段视频,但真实的视频流不会等待模型准备完毕。面对驾驶记录、持续监控画面或第一人称记录视频,模型需要一边接收新内容,一边决定是否已经掌握足够证据。若每个时刻都以高分辨率处理,不仅代价高,也没有必要。
VideoChat3 为此设计了自适应帧分辨率机制,并用三个状态组织流式感知过程:
:当前窗口没有与问题相关的证据,模型保持静默并以较低成本继续观察;
:已经出现潜在线索,但证据尚不充分,模型暂不回答,并提高下一个窗口的视觉分辨率;
:证据已经充分,模型生成回答,之后回到低成本监测状态。
这种机制形成了一个由模型状态驱动的闭环:常规片段采用低分辨率预算编码,检测到潜在线索后,下一个窗口提升至高分辨率观察。模型由此可以把更多视觉计算用于真正影响回答的线索片段,而不是对整段视频平均分配资源。
消融实验进一步表明,这一设计的收益并非单纯来自 “使用更多像素”。在 OVO-Timing 上,自适应策略的平均 F1 为 35.5,高于固定低分辨率的 33.5 和固定高分辨率的 30.5;其视觉预算约为始终使用高分辨率方案的 30.2%。这说明,在合适的时刻提高感知精度,比始终维持高分辨率更有效。
三类数据,覆盖短视频、长视频、流视频场景
架构决定模型如何处理视频,数据则决定模型能够学会哪些能力。在社区原有的开源数据以外,VideoChat3 构建并整理了三套全新高质量开源数据资源,助力模型全方面提升细粒度理解,长视频理解和流式视频理解能力。
VideoChat3-Academic2M:把简短标签转写为有证据的回答
VideoChat3-Academic2M 包含约 227 万条来自公开学术数据集的视频描述与问答样本。原始学术数据通常具有明确的任务定义和较可靠的标注,但答案可能只是选项字母、单个短语或简短事实。团队在不改变原始语义标签的前提下,将这些稀疏答案改写为包含可观察证据和时间线索的自然语言回答,并增加一致性验证与错误过滤,以降低改写过程引入无依据细节的风险。
这样既保留了原始标注的语义可靠性,又为模型提供了更充分的视觉证据与时序监督,有助于提升其视频理解、证据定位和回答生成能力。
VideoChat3-LV116K:为长视频建立可核验的事件账本
VideoChat3-LV116K 包含约 11.62 万条长视频数据。长视频的困难并非只是帧数更多,而在于关键证据可能稀疏地分布在数分钟甚至更长时间范围内。为此,团队先过滤低质量、重复或语义贫乏的视频,再结合镜头边界与时长约束进行分段;随后生成并核验片段级描述,最终将带时间戳的局部证据组合为完整视频标注,用于时序定位、长视频问答和摘要等任务。
这一流程相当于先为长视频建立一份可检查的 “事件账本”,再据此构造需要跨片段聚合与推理的训练样本,从而减少直接对整段长视频生成标注时可能产生的遗漏和噪声。
VideoChat3-OL617K:把离线问答改造成 “知道何时回答” 的训练信号
VideoChat3-OL617K 包含 61.72 万条在线流式样本。团队首先定位回答问题所需的关键视觉片段,再通过裁剪片段复核证据是否充分,最后将视频转换为由多个窗口和状态 token 交错组成的因果序列:无关窗口标记为 ,出现线索的窗口标记为 ,证据完整后标记为 并生成答案。
这一设计把传统问答数据的 “看完再答”,转化为 “持续观察、积累证据、适时回答”,为模型学习主动响应提供了明确监督。加入 VideoChat3-OL617K 后,消融实验中的 OVO-Timing 平均 F1 从 4.0 提升至 35.5,同时多项离线视频问答指标基本保持稳定。
四阶段训练:从视觉表征到长视频与流式交互
VideoChat3 采用渐进式的四阶段训练流程:
视频视觉编码器预训练:从图像预训练的 MoonViT 初始化 I3D-ViT,使视觉表示能够被语言模型有效接收;
视频 - 语言对齐:进一步建立紧凑视频 token 与语言空间之间的对应关系;
视频指令微调:在多类图像与视频描述、问答数据上获得通用指令遵循能力;
长视频与流式指令微调:重点学习长程检索、时序定位、证据聚合、状态判断和主动响应。
这一渐进式训练策略使视觉表征、跨模态对齐、通用理解和复杂时序交互能力逐步衔接,降低了不同训练目标同时优化带来的难度。
四个阶段累计使用仅 25M 条训练样本,便在多类视频理解任务上取得了具有竞争力的表现,体现出了高效的数据利用效率
4B 参数模型,在多个维度上表现全面
论文从通用离线视频理解、在线视频理解两个方面进行了系统评测。
在通用离线视频理解评测中,VideoChat3-4B 展现出较为全面的能力,在时序感知、长视频理解、复杂视频推理和时序定位等多个维度均取得了具有竞争力的结果。与同为 4B 规模的开放权重模型 Qwen3-VL-4B 相比,VideoChat3 在 19 个可直接比较的指标中有 18 个实现提升。其在长视频理解与时序定位任务上的优势尤为突出:在 Video-MME 基准上取得 70.1 分;在 TimeLens 的三个评测分项中全面领先同规模开源模型,并超过 GPT-5 等闭源模型。
在线视频理解评测中,VideoChat3 在六项感知与记忆汇总指标中的四项取得最佳结果,体现了模型在流式输入场景下的处理能力,其 ODVBench 得分为 72.3,StreamingBench 指标为 83.0,River 平均得分为 42.8。与此同时,模型还真正做到了主动响应视频内容,在强调响应时机的 OVO-Timing 上,VideoChat3 的平均 F1 达到 35.5,高于带有额外 2B 模块的专用模型 Em-Garde。在 ProactiveVQA 的多个子集上,VideoChat3 相较于 Qwen3-VL-4B 均取得了提升。
从评测结果可以看出,与 Qwen3VL-4B 和 Molmo2-4B 等之前的开源模型相比,VideoChat3 不仅取得了性能上的提升,还真正的将离线通用能力与在线处理能力合二为一,成为视频理解处理的 “多面手”。
长视频越长,前置压缩的价值越明显
I3D-ViT 在视觉编码阶段进行显式时空建模,并且具有更高的视觉 token 压缩比。因此,虽然视觉编码器本身比逐帧编码方案更耗时,但将显著减少交给语言模型的视觉 token。
由于语言模型对长序列的计算成本增长很快,这种 “视觉端多做一些、语言端少处理一些” 的权衡会随着输入视频变长和后续语言模型尺寸的增加而更有优势。
在 NVIDIA H200、Hugging Face Pipeline 和 FlashAttention-2 的测试条件下:
输入 512 帧时,VideoChat3 的总延迟为 3.596 秒,Qwen3-VL 为 3.838 秒;
输入 1024 帧时,两者总延迟分别为 8.099 秒和 12.251 秒;
输入 2048 帧时,VideoChat3 将总延迟从 44.449 秒降至 20.412 秒,将 FLOPs 从 15.150×10¹⁵ 降至 5.738×10¹⁵,并将显存占用从 106.913 GB 降至 80.775 GB。
VideoChat3:全面,高效,开源的视频理解大模型
全面,体现在其对多类视频任务的统一覆盖。VideoChat3 不仅能够识别细粒度动作、理解长视频和定位事件发生区间,还能够持续感知视频流,并判断何时保持静默、何时作出回应。围绕这些能力,团队从模型架构、训练数据和训练策略三个层面进行协同设计,使通用视频理解、长程时序推理与在线主动响应能够在同一模型中兼顾。
高效,是 VideoChat3 在模型设计上的核心目标。I3D-ViT 将时空建模与冗余压缩前移至视觉编码阶段,自适应分辨率机制则根据事件重要性动态调整感知预算,使模型能够以更少的视觉 token 处理长视频与流式输入,在保持理解能力的同时降低计算开销。在模型推理高效之外,VideoChat3 整体的训练过程也体现出了高效的数据利用效率。
开源,则是 VideoChat3 区别于许多视频多模态模型的重要特征。团队全面开放模型权重、代码、数据,为研究者复现、分析和开展后续研究提供了较为完整的基础。
总体而言,VideoChat3 以 4B 参数规模,在效率、能力覆盖与开放性之间取得了良好平衡。当然,面向更强、更可靠的通用视频智能助手,其在复杂时序推理、主动响应精度和真实场景部署效率等方面仍有进一步提升空间。VideoChat3 提供的并非这一问题的最终答案,而是一个高效、全面且可复现的开放起点。