<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Tencent on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/tencent/</link><description>Recent content in Tencent on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Wed, 08 Apr 2026 21:44:44 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/tencent/index.xml" rel="self" type="application/rss+xml"/><item><title>Notes on ARC-Hunyuan-Video-7B</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/</link><pubDate>Tue, 12 Aug 2025 10:57:57 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/</guid><description>&lt;p&gt;腾讯 ARC LAB 提出了 ARC-Hunyuan-Video-7B, 一个针对短视频理解和推理的视频多模态大模型。&lt;/p&gt;
&lt;h2 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h2&gt;&lt;p&gt;作者首先提出了 Structured video comprehension 的概念&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;the ability to decompose a video into its constituent events and narrative elements with temporal precision.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;视频信息包含了 dense visual elements, 比如文字等信息，还有 rich audio streams, 比如音效，音乐，再就是 rapid narrative pacing, 用于强调情感。&lt;/p&gt;
&lt;p&gt;已有的多模态大模型对于视频的细粒度理解和推理能力存在不足。尽管 &lt;a class="link" href="https://maosong.website/p/notes-on-keye-vl/" target="_blank" rel="noopener"
&gt;Keye-VL&lt;/a&gt; 也是一个短视频理解多模态大模型，但是其并没有利用 audio 模态的信息。其他的 audio-visual LLM 虽然可以处理 audio 模态的信息，但是他们主要集中于通用场景的视频，这类视频的特点是：叙述节奏慢，信息密度低。因此，对于叙述节奏快，信息丰富的短视频，这些模型表现就比较差。&lt;/p&gt;
&lt;p&gt;基于以上这些问题，作者提出了 ARC-Hunyuan-Video-7B, 一个基于 Hunyuan-7B vision-language model 的短视频多模态大模型，其主要做了两点改进：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;加入了一个 audio encoder 用于提取 audio 信息，然后对 audio 信息与视觉信息进行同步&lt;/li&gt;
&lt;li&gt;使用了一个 timestamp overlap 机制，将时间戳印在视频的帧上，帮助模型理解事件的时序信息&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;作者还涉及了多阶段的训练策略，来提高模型的表现。最后在测试时，对于一个 1 分钟的视频，模型在 H20 GPU 上进需要 10 秒就可以处理完毕。&lt;/p&gt;
&lt;h2 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h2&gt;&lt;h3 id="architecture"&gt;&lt;a href="#architecture" class="header-anchor"&gt;&lt;/a&gt;Architecture
&lt;/h3&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-architecture.png"
width="682"
height="467"
loading="lazy"
alt="Architecture of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="146"
data-flex-basis="350px"
&gt;&lt;/p&gt;
&lt;p&gt;模型基于 Hunyuan-7B-VLM 开发得到，&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Visual Encoding: 作者将时间戳以 &lt;code&gt;HH:MM:SS&lt;/code&gt; 的形式印在视频的帧上。视频的采样率为 1FPS, 超过 150s 的视频会进行均匀采样降低至 150s. 每一帧会 resize 到 $640\times 640$, 最后每一帧输出 112 token&lt;/li&gt;
&lt;li&gt;Audio Encoding: 使用 Whisper 作为编码器。小于 300s 的视频，会按照 30s 为单位切分为不同的 chunk, 大于 300s 的视频，会分割为 150 个 chunk, 然后每个 chunk 只保留开头 2s 的内容。最后，使用 Whisper 进行特征提取，最后再通过 MLP 与 LLM 的特征空间进行对齐&lt;/li&gt;
&lt;li&gt;Visual-audio Synchronization: 先对 audio token 进行 zero padding 与 Visual token 的个数进行对齐，然后将两者相加&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="training"&gt;&lt;a href="#training" class="header-anchor"&gt;&lt;/a&gt;Training
&lt;/h3&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-training-overall.png"
width="682"
height="467"
loading="lazy"
alt="Training pipeline of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="146"
data-flex-basis="350px"
&gt;&lt;/p&gt;
&lt;h4 id="pre-training"&gt;&lt;a href="#pre-training" class="header-anchor"&gt;&lt;/a&gt;Pre-training
&lt;/h4&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-annotation.png"
width="1362"
height="289"
loading="lazy"
alt="Boostrapped annotation pipeline of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="471"
data-flex-basis="1131px"
&gt;&lt;/p&gt;
&lt;p&gt;作者首先保住了一些数据。具体流程就是，使用 Whisper-v3 来转录带时间戳的音频，然后使用 InternVL-2.5-8B [[InternVL-2.5]] 来生成细粒度的 caption. 作者还使用 CoT prompt 策略，让模型一步步生成时间的描述，创作者的想法以及如何吸引用户的 tag 等。&lt;/p&gt;
&lt;p&gt;预训练数据如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Category&lt;/th&gt;
&lt;th&gt;data&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Video description and summary&lt;/td&gt;
&lt;td&gt;4.5M short-form video&lt;br&gt;0.2M public video&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Image caption and OCR&lt;/td&gt;
&lt;td&gt;4.7M image-text pairs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ASR&lt;/td&gt;
&lt;td&gt;3.2M audio-text pairs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video temporal grounding&lt;/td&gt;
&lt;td&gt;0.5M temporally grounding instances&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video multi-granular caption&lt;/td&gt;
&lt;td&gt;50K high-quality samples&lt;br&gt;80K in-house videos&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;训练包含两个 stage:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Stage 1: 使用 ASR 数据训练模型接受音频输入的能力，为了避免视觉模态能力下降，作者还加入了 Image-text pair data 来训练，缺失的模态用 zero padding 来补齐&lt;/li&gt;
&lt;li&gt;Stage 2: 使用全部数据进行训练，仅训练 MLP 和 LLM&lt;/li&gt;
&lt;/ol&gt;
&lt;h4 id="post-training"&gt;&lt;a href="#post-training" class="header-anchor"&gt;&lt;/a&gt;Post-training
&lt;/h4&gt;&lt;p&gt;作者首先进行了消融实验，探究 human-annotated 数据对模型表现的影响。作者收集了 140 条人类标注的数据，然后基于这些数据进行消融实验：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;直接使用人类标注数据进行 SFT, 模型表现变化不大&lt;/li&gt;
&lt;li&gt;直接使用人类标注数据作为正样本，合成数据作为负样本进行 DPO, 模型表现变化也不大&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;作者分析原因认为，&lt;strong&gt;人类标注数据和合成数据之间存在 distribution shift&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;受 &lt;a class="link" href="https://maosong.website/p/notes-on-deepseek-r1/" target="_blank" rel="noopener"
&gt;DeepSeek-R1&lt;/a&gt; 启发，作者决定使用 GRPO 算法来提高模型的表现，训练任务包含两个：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;multi-dimensional Multi-choide QA: 提高模型的视频理解能力&lt;/li&gt;
&lt;li&gt;Temporal video grounding: 提高模型的时序感知能力&lt;/li&gt;
&lt;/ol&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Stage&lt;/th&gt;
&lt;th&gt;Data&lt;/th&gt;
&lt;th&gt;Module&lt;/th&gt;
&lt;th&gt;Description&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;SFT&lt;/td&gt;
&lt;td&gt;MCQ:&lt;br&gt; - 460K open-ended QA&lt;br&gt; - 70K MCQA&lt;br&gt; - 20K QA&lt;br&gt;Grounding:&lt;br&gt; - 10K academic&lt;br&gt; - 5K real-world&lt;br&gt;General:&lt;br&gt; - 45K description&lt;br&gt; - 12K caption&lt;/td&gt;
&lt;td&gt;MLP+LLM&lt;/td&gt;
&lt;td&gt;提高指令跟随能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cold Start SFT&lt;/td&gt;
&lt;td&gt;- 90K MCQA&lt;br&gt;- 18K temporal grounding&lt;br&gt;- 20K open-ended QA&lt;br&gt;- 15K summarization&lt;br&gt;- 3K chapter-level captioning&lt;/td&gt;
&lt;td&gt;MLP+LLM&lt;/td&gt;
&lt;td&gt;初步激活模型的 reas 能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RL&lt;/td&gt;
&lt;td&gt;- 100K MCQ&lt;br&gt;- 35K temporal grounding&lt;/td&gt;
&lt;td&gt;LLM&lt;/td&gt;
&lt;td&gt;提升模型的 reasoning 能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SFT&lt;/td&gt;
&lt;td&gt;- 25K human-annotated subjective question&lt;br&gt;- 100K MCQ with CoT&lt;br&gt;- 50K temporal grounding with reasoning traces&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;使用人类标注数据进一步提高模型的能力&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="experiments"&gt;&lt;a href="#experiments" class="header-anchor"&gt;&lt;/a&gt;Experiments
&lt;/h2&gt;&lt;p&gt;作者构建了一个评估短视频理解能力的 benchmark: ShortVid-Bench, 评估以下方面：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Temporal Reasoning and Localization&lt;/li&gt;
&lt;li&gt;Affective Intent Classification&lt;/li&gt;
&lt;li&gt;Creator Intent Taxonomy&lt;/li&gt;
&lt;li&gt;Narrative Comprehension&lt;/li&gt;
&lt;li&gt;Humor &amp;amp; Meme Deconstruction&lt;/li&gt;
&lt;li&gt;Creative Innovation Analysis&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;对比的模型包括 Qwen2.5-VL-7B, Qwen2.5-omni-7B 和 Keye-VL-8B&lt;/p&gt;
&lt;p&gt;评估结果如下：&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-performance.png"
width="1367"
height="244"
loading="lazy"
alt="Performance of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="560"
data-flex-basis="1344px"
&gt;&lt;/p&gt;
&lt;h2 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h2&gt;&lt;p&gt;作者提出了 ARC-Hunyuan-Video-7B, 一个针对短视频的视频理解多模态大模型。作者详细介绍了模型的架构，训练数据以及评估。&lt;/p&gt;
&lt;h2 id="references"&gt;&lt;a href="#references" class="header-anchor"&gt;&lt;/a&gt;References
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2507.20939" target="_blank" rel="noopener"
&gt;arxiv&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/TencentARC/ARC-Hunyuan-Video-7B" target="_blank" rel="noopener"
&gt;Github&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>