<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Video on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/video/</link><description>Recent content in Video on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Sun, 12 Apr 2026 17:49:17 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/video/index.xml" rel="self" type="application/rss+xml"/><item><title>物理AI-VLA分享</title><link>https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/</link><pubDate>Sat, 11 Apr 2026 14:36:45 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/</guid><description>&lt;h2 id="agenda"&gt;&lt;a href="#agenda" class="header-anchor"&gt;&lt;/a&gt;Agenda
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;1️⃣ 什么是 VLA？&lt;/li&gt;
&lt;li&gt;2️⃣ VLA 发展：以 π 系列做主线&lt;/li&gt;
&lt;li&gt;3️⃣ VLA模型的设计空间：分享VLANeXt 论文中的思考&lt;/li&gt;
&lt;li&gt;4️⃣ 智驾 vs 具身：共性与讨论&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="什么是-vla视觉-语言-动作模型"&gt;&lt;a href="#%e4%bb%80%e4%b9%88%e6%98%af-vla%e8%a7%86%e8%a7%89-%e8%af%ad%e8%a8%80-%e5%8a%a8%e4%bd%9c%e6%a8%a1%e5%9e%8b" class="header-anchor"&gt;&lt;/a&gt;什么是 VLA（视觉-语言-动作模型）？
&lt;/h2&gt;&lt;p&gt;VLA 代表 Vision-Language-Action（视觉-语言-动作）
VLA 的核心思想是利用多模态大模型（MLLM）的 world knowledge and reasoning capabilities，直接产生机器人的动作输出。&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;输入： 机器人的摄像头图像（Vision）,机器人自身状态(Robot State)和人类的文字指令（Language）。
处理： 基于强大的多模态大模型（MLLM）去理解场景和指令。
输出： 直接生成控制机器人关节或末端执行器的低级动作指令（Action）。
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;VLA 让机器人能够像人类一样，通过观察世界、听从指令，然后直接采取行动，打破了传统机器人需要复杂的手工编码和分层多子系统的限制。&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/vla1.jpg"
width="1810"
height="863"
loading="lazy"
alt="vla model arch"
class="gallery-image"
data-flex-grow="209"
data-flex-basis="503px"
&gt;&lt;/p&gt;
&lt;h2 id="vla的研究进展pi系列-以physical-intelligence-π为主线关注核心组织和人-"&gt;&lt;a href="#vla%e7%9a%84%e7%a0%94%e7%a9%b6%e8%bf%9b%e5%b1%95pi%e7%b3%bb%e5%88%97-%e4%bb%a5physical-intelligence-%cf%80%e4%b8%ba%e4%b8%bb%e7%ba%bf%e5%85%b3%e6%b3%a8%e6%a0%b8%e5%bf%83%e7%bb%84%e7%bb%87%e5%92%8c%e4%ba%ba-" class="header-anchor"&gt;&lt;/a&gt;VLA的研究进展(pi系列)-以Physical Intelligence (π)为主线(关注核心组织和人 ）
&lt;/h2&gt;&lt;h3 id="π系列发展历程和趋势"&gt;&lt;a href="#%cf%80%e7%b3%bb%e5%88%97%e5%8f%91%e5%b1%95%e5%8e%86%e7%a8%8b%e5%92%8c%e8%b6%8b%e5%8a%bf" class="header-anchor"&gt;&lt;/a&gt;π系列发展历程和趋势
&lt;/h3&gt;&lt;p&gt;&lt;a class="link" href="https://www.pi.website/blog" target="_blank" rel="noopener"
&gt;π&lt;/a&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;核心架构与技术特征&lt;/th&gt;
&lt;th&gt;关键突破点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;π₀&lt;br&gt;2024-10&lt;/td&gt;
&lt;td&gt;MoT (Mixture of Transformer) + Flow Matching&lt;/td&gt;
&lt;td&gt;奠定了 VLA 多模态训练的基础，利用连续流匹配生成动作。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FAST&lt;br&gt;2025-01&lt;/td&gt;
&lt;td&gt;Efficient Action Tokenization&lt;/td&gt;
&lt;td&gt;引入离散动作标记，提升了实时的推理速度和执行效率。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π₀.₅&lt;br&gt;2025-04&lt;/td&gt;
&lt;td&gt;两者 action 建模结合&lt;br&gt;混合任务训练&lt;br&gt;层次化 VLM/VLA 架构&lt;/td&gt;
&lt;td&gt;结合连续与离散建模，通过混合任务训练应对复杂、长程任务。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π₀.₆* 及后续&lt;br&gt;2025-11&lt;/td&gt;
&lt;td&gt;RL + Memory + Agentic&lt;/td&gt;
&lt;td&gt;引入强化学习、长期记忆与自主决策能力，向机器人智能体迈进。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="总结physical-intelligence-π-vla的进展"&gt;&lt;a href="#%e6%80%bb%e7%bb%93physical-intelligence-%cf%80-vla%e7%9a%84%e8%bf%9b%e5%b1%95" class="header-anchor"&gt;&lt;/a&gt;总结Physical Intelligence (π) VLA的进展
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;时间&lt;/th&gt;
&lt;th&gt;版本&lt;/th&gt;
&lt;th&gt;核心技术方向&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;π系列第一阶段&lt;/td&gt;
&lt;td&gt;2024-10 ~&lt;/td&gt;
&lt;td&gt;π₀ / π₀-FAST / π₀.₅&lt;/td&gt;
&lt;td&gt;Flow Matching、Efficient Action Tokenization、分层设计 VLM + VLA、混合任务训练&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π系列第二阶段&lt;/td&gt;
&lt;td&gt;2025-11 ~&lt;/td&gt;
&lt;td&gt;π₀.₆* 及后续&lt;/td&gt;
&lt;td&gt;RL、Memory、Agentic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="vla模型的设计空间vlanext"&gt;&lt;a href="#vla%e6%a8%a1%e5%9e%8b%e7%9a%84%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4vlanext" class="header-anchor"&gt;&lt;/a&gt;VLA模型的设计空间（VLANeXT）
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/pdf/2602.18532" target="_blank" rel="noopener"
&gt;VLANeXT&lt;/a&gt;&lt;/p&gt;
&lt;h3 id="设计vla模型需要思考的问题"&gt;&lt;a href="#%e8%ae%be%e8%ae%a1vla%e6%a8%a1%e5%9e%8b%e9%9c%80%e8%a6%81%e6%80%9d%e8%80%83%e7%9a%84%e9%97%ae%e9%a2%98" class="header-anchor"&gt;&lt;/a&gt;设计VLA模型需要思考的问题：
&lt;/h3&gt;&lt;ol&gt;
&lt;li&gt;action怎么生成，VLM直接输出还是额外action expert网络？&lt;/li&gt;
&lt;li&gt;action训练方法，Flow matching，VAE还是DDIM？&lt;/li&gt;
&lt;li&gt;VLM和action expert的怎么连接？&lt;/li&gt;
&lt;li&gt;propriocetion 自身状态输入给VLM还是action expert&lt;/li&gt;
&lt;li&gt;多相机数据怎么输入给VLA，相机标定的内外参信息怎么喂给模型？图像的时序信息怎么处理？&lt;/li&gt;
&lt;li&gt;是否引入额外任务构建更稠密的loss？如预测下一帧图像，还是引入额外输出头？
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/policy.png"
width="720"
height="336"
loading="lazy"
alt="policy"
class="gallery-image"
data-flex-grow="214"
data-flex-basis="514px"
&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="vlanext中探讨的vla设计空间"&gt;&lt;a href="#vlanext%e4%b8%ad%e6%8e%a2%e8%ae%a8%e7%9a%84vla%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4" class="header-anchor"&gt;&lt;/a&gt;VLANEXT中探讨的VLA设计空间
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设计维度&lt;/th&gt;
&lt;th&gt;决策组件 / 变量&lt;/th&gt;
&lt;th&gt;设计选项 (Design Options)&lt;/th&gt;
&lt;th&gt;实验结论摘要 (Ablation Insights)&lt;/th&gt;
&lt;th&gt;最佳配方 (Final Recipe)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;一、基础组件 (Foundational)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;1. 策略模块设计 (Policy Architecture)&lt;/td&gt;
&lt;td&gt;A. 复用文本Token&lt;br&gt;B. 独立策略头（浅层）&lt;br&gt;C. 深度策略网络（MetaQuery）&lt;/td&gt;
&lt;td&gt;浅层或复用架构无法充分解耦感知与动作；MetaQuery 风格能更好处理复杂动作。&lt;/td&gt;
&lt;td&gt;采用深度独立策略模块（16 query tokens + 12层 Transformer）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;2. 动作分块 (Action Chunking)&lt;/td&gt;
&lt;td&gt;A. 单步预测（size=1）&lt;br&gt;B. 多步预测（size=8）&lt;/td&gt;
&lt;td&gt;预测未来多步动作显著提高动作平滑性和任务成功率。&lt;/td&gt;
&lt;td&gt;预测多步动作（Chunk size = 8）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;3. 动作学习目标 (Action Objective)&lt;/td&gt;
&lt;td&gt;A. 离散分类（Binning / VQ-VAE）&lt;br&gt;B. 回归（Regression）&lt;br&gt;C. 扩散 / 流匹配（DDIM / Flow）&lt;/td&gt;
&lt;td&gt;离散化损失空间细节；连续建模（Flow Matching / 回归）表达力更强。&lt;/td&gt;
&lt;td&gt;使用连续动作建模（优先 Flow Matching 或回归）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;4. VLM骨干容量 (VLM Backbone)&lt;/td&gt;
&lt;td&gt;测试 LLaMA, PaliGemma, Qwen3-VL 等&lt;/td&gt;
&lt;td&gt;骨干模型表征能力是基础，容量越大通常性能越好（需平衡资源）。&lt;/td&gt;
&lt;td&gt;视算力选择最优开源骨干（如 Qwen3-VL）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;5. VLM-策略连接 (VLM-Policy Link)&lt;/td&gt;
&lt;td&gt;A. 松散连接（Loose）&lt;br&gt;B. 紧密连接（Tight）&lt;br&gt;C. 软连接（Soft，引入 Query buffer）&lt;/td&gt;
&lt;td&gt;软连接通过可学习 query 提供缓冲，适配性略优于紧密或松散耦合。&lt;/td&gt;
&lt;td&gt;软连接策略（Soft Connection）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;二、感知要素 (Perception)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;6. 时序历史 (Temporal History)&lt;/td&gt;
&lt;td&gt;A. 仅当前帧&lt;br&gt;B. 添加过去帧&lt;/td&gt;
&lt;td&gt;添加过去帧反而降低性能，可能引入冗余或干扰信息。&lt;/td&gt;
&lt;td&gt;避免冗余时序历史输入（专注当前帧）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;7. 相机视角 (Camera Views)&lt;/td&gt;
&lt;td&gt;A. 单视角&lt;br&gt;B. 多视角（第三人称 + 腕部）&lt;/td&gt;
&lt;td&gt;多视角提供更全面空间信息，显著提升空间感知与操作精度。&lt;/td&gt;
&lt;td&gt;多视角输入（第三人称 + 腕部相机）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;8. 本体感觉注入 (Proprioception)&lt;/td&gt;
&lt;td&gt;A. 无本体 state&lt;br&gt;B. VLM端注入&lt;br&gt;C. 策略端注入&lt;br&gt;D. 双端注入&lt;/td&gt;
&lt;td&gt;本体 state 对闭环控制至关重要；VLM端注入效果优于策略端。&lt;/td&gt;
&lt;td&gt;本体 state 条件于 VLM 端注入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;三、动作建模 (Action Modeling)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;9. 世界建模辅助 (World Modeling)&lt;/td&gt;
&lt;td&gt;引入未来帧预测目标（如 Emu3.5）&lt;/td&gt;
&lt;td&gt;性能有提升，但训练成本增加约3倍，性价比低。&lt;/td&gt;
&lt;td&gt;不纳入最终配方&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;10. 时序预测视角 (Time-Series Perspective)&lt;/td&gt;
&lt;td&gt;引入频域损失（DCT）&lt;/td&gt;
&lt;td&gt;将动作视为时序预测问题，引入频域损失可低成本提升动作质量。&lt;/td&gt;
&lt;td&gt;引入频域辅助损失（DCT）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/vlanext.png"
width="701"
height="551"
loading="lazy"
alt="vlanext"
class="gallery-image"
data-flex-grow="127"
data-flex-basis="305px"
&gt;&lt;/p&gt;
&lt;h2 id="应用场景-具身vs智驾"&gt;&lt;a href="#%e5%ba%94%e7%94%a8%e5%9c%ba%e6%99%af-%e5%85%b7%e8%ba%abvs%e6%99%ba%e9%a9%be" class="header-anchor"&gt;&lt;/a&gt;应用场景-具身VS智驾
&lt;/h2&gt;&lt;h3 id="具身和智驾领域vla论文对比技术趋同"&gt;&lt;a href="#%e5%85%b7%e8%ba%ab%e5%92%8c%e6%99%ba%e9%a9%be%e9%a2%86%e5%9f%9fvla%e8%ae%ba%e6%96%87%e5%af%b9%e6%af%94%e6%8a%80%e6%9c%af%e8%b6%8b%e5%90%8c" class="header-anchor"&gt;&lt;/a&gt;具身和智驾领域VLA论文对比&amp;ndash;&amp;gt;技术趋同
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;技术方向&lt;/th&gt;
&lt;th&gt;具身&lt;/th&gt;
&lt;th&gt;智驾&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;action token&lt;/td&gt;
&lt;td&gt;pi0-FAST、RT2、OpenVLA&lt;/td&gt;
&lt;td&gt;AutoVLA&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action expert（flow matching）&lt;/td&gt;
&lt;td&gt;pi0&lt;/td&gt;
&lt;td&gt;DriveMoE&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action 建模两者结合 + 强化学习 RL&lt;/td&gt;
&lt;td&gt;pi0.5、pi0.6*&lt;/td&gt;
&lt;td&gt;Alpamaya&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;辅助 loss（3D 感知 / 世界模型 / 通才模型）&lt;/td&gt;
&lt;td&gt;蚂蚁 LingBot-VLA&lt;/td&gt;
&lt;td&gt;DriveVLA-W0 / EMMA&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="nvidia-alpamaya智驾vla"&gt;&lt;a href="#nvidia-alpamaya%e6%99%ba%e9%a9%bevla" class="header-anchor"&gt;&lt;/a&gt;Nvidia Alpamaya智驾VLA
&lt;/h3&gt;&lt;p&gt;Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail&lt;/p&gt;
&lt;h3 id="从waymo-end-to-end-driving-chanllenges看未来智驾的技术趋势"&gt;&lt;a href="#%e4%bb%8ewaymo-end-to-end-driving-chanllenges%e7%9c%8b%e6%9c%aa%e6%9d%a5%e6%99%ba%e9%a9%be%e7%9a%84%e6%8a%80%e6%9c%af%e8%b6%8b%e5%8a%bf" class="header-anchor"&gt;&lt;/a&gt;从Waymo End-to-End Driving Chanllenges看未来智驾的技术趋势
&lt;/h3&gt;&lt;p&gt;添加图片注释，不超过 140 字（可选）
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios(&lt;a class="link" href="https://arxiv.org/pdf/2510.26125%29-4.4" target="_blank" rel="noopener"
&gt;https://arxiv.org/pdf/2510.26125)-4.4&lt;/a&gt;. Discussion of the Results&lt;/p&gt;
&lt;p&gt;&lt;code&gt;1.MLLM-based Model (VLA)的好处？-&amp;gt;数据不易饱和&lt;/code&gt;&lt;br&gt;
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/q1.png"
width="372"
height="335"
loading="lazy"
alt="q1"
class="gallery-image"
data-flex-grow="111"
data-flex-basis="266px"
&gt;
&lt;code&gt;2.强化学习对E2E驾驶能力的提升？&lt;/code&gt;&lt;br&gt;
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/q3.png"
width="368"
height="257"
loading="lazy"
alt="q3"
class="gallery-image"
data-flex-grow="143"
data-flex-basis="343px"
&gt;&lt;/p&gt;
&lt;h2 id="open-discussion"&gt;&lt;a href="#open-discussion" class="header-anchor"&gt;&lt;/a&gt;open discussion
&lt;/h2&gt;&lt;h3 id="q1-智驾是否需要vla吗-"&gt;&lt;a href="#q1-%e6%99%ba%e9%a9%be%e6%98%af%e5%90%a6%e9%9c%80%e8%a6%81vla%e5%90%97-" class="header-anchor"&gt;&lt;/a&gt;Q1. 智驾是否需要VLA吗 ？
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;a.智驾特殊场景和长尾场景是否需要Language，是否是帮助提升泛化性?&lt;/li&gt;
&lt;li&gt;b.交互能力对于驾驶是否必须?驾驶需要需要遵循人类指令？&lt;/li&gt;
&lt;li&gt;c. 推理CoT对于智驾这类实时性高的场景是否必须？怎么trade-off?
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/buslane.png"
width="720"
height="960"
loading="lazy"
alt="buslane"
class="gallery-image"
data-flex-grow="75"
data-flex-basis="180px"
&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="q2-vla-vs-wam"&gt;&lt;a href="#q2-vla-vs-wam" class="header-anchor"&gt;&lt;/a&gt;Q2. VLA vs WAM？
&lt;/h3&gt;&lt;p&gt;&lt;code&gt;VLA (Vision-Language-Action, 视觉-语言-动作模型)&lt;/code&gt;&lt;br&gt;
瓶颈： VLA 模型通常缺乏对物理世界的深刻理解（没有物理常识）。它只是学到了动作和图像之间的“统计映射”。&lt;/p&gt;
&lt;p&gt;&lt;code&gt;WAM (World Action Model, 世界动作模型)&lt;/code&gt;&lt;br&gt;
核心思想： WAM 是建立在 World Model (世界模型) 之上的动作模型。世界模型的核心能力是“预测未来”。它学习物理世界的运作规律（例如，物体掉落会向下，水杯翻了水会流出）。 当接收到指令和当前视觉时，WAM 不会直接生成动作。它首先利用其世界模型“想象”：如果我采取动作A，世界会变成什么样？采取动作B，世界又会变成什么样？通过在“想象”中模拟未来，WAM 可以选择最能达成目标的动作序列。
WAM 的优势： 具有物理常识，具有“预测”和“规划”能力。&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/pdf/2601.16163" target="_blank" rel="noopener"
&gt;cosmos policy&lt;/a&gt;
添加图片注释，不超过 140 字（可选）
添加图片注释，不超过 140 字（可选）&lt;/p&gt;
&lt;h3 id="q3-vla-是终局吗wam-是终局吗两者怎么融合"&gt;&lt;a href="#q3-vla-%e6%98%af%e7%bb%88%e5%b1%80%e5%90%97wam-%e6%98%af%e7%bb%88%e5%b1%80%e5%90%97%e4%b8%a4%e8%80%85%e6%80%8e%e4%b9%88%e8%9e%8d%e5%90%88" class="header-anchor"&gt;&lt;/a&gt;Q3. VLA 是终局吗？WAM 是终局吗？两者怎么融合？
&lt;/h3&gt;&lt;p&gt;添加图片注释，不超过 140 字（可选）&lt;/p&gt;
&lt;h2 id="总结"&gt;&lt;a href="#%e6%80%bb%e7%bb%93" class="header-anchor"&gt;&lt;/a&gt;总结
&lt;/h2&gt;&lt;h3 id="π-系列vla"&gt;&lt;a href="#%cf%80-%e7%b3%bb%e5%88%97vla" class="header-anchor"&gt;&lt;/a&gt;π 系列VLA：
&lt;/h3&gt;&lt;p&gt;Physical Intelligence 的 π 系列 VLA 模型。π0​，基于VLM+Action Expert架构，Flow matching结合流匹配技术，多步去噪生成aciton; π0.5​,混合任务训练，采用两种action token建模方式，通过层次化 VLM+VLA 架构提高了复杂任务泛化能力；π0.6*及后续​，引入强化学习与记忆，推动VLA模型具有自主规划能力的具身智能体（Agentic AI）演进。&lt;/p&gt;
&lt;h3 id="vlanext-vla-的关键设计空间"&gt;&lt;a href="#vlanext-vla-%e7%9a%84%e5%85%b3%e9%94%ae%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4" class="header-anchor"&gt;&lt;/a&gt;VLANeXT-VLA 的关键“设计空间”：
&lt;/h3&gt;&lt;p&gt;VLA 模型的执行效率源自深度独立的策略网络、多步动作分块、以及频域辅助损失对连续动作建模的优化；最佳配方摒弃了降低性能的历史时序输入，专注于多视角感知和连续动作流预测。&lt;/p&gt;
&lt;h3 id="智驾与具身vla"&gt;&lt;a href="#%e6%99%ba%e9%a9%be%e4%b8%8e%e5%85%b7%e8%ba%abvla" class="header-anchor"&gt;&lt;/a&gt;智驾与具身VLA：
&lt;/h3&gt;&lt;p&gt;两者皆是 Physical AI的应用，模型设计上具有极高的技术重合度。讨论 VLA是否必须？VLA还是WAM两者技术路线？&lt;/p&gt;
&lt;h2 id="更多细节"&gt;&lt;a href="#%e6%9b%b4%e5%a4%9a%e7%bb%86%e8%8a%82" class="header-anchor"&gt;&lt;/a&gt;更多细节
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.pi.website/" target="_blank" rel="noopener"
&gt;Physical Intelligence (π)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/2025605094205309303" target="_blank" rel="noopener"
&gt;VLANeXT分析&lt;/a&gt;)&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/1985783547974398799" target="_blank" rel="noopener"
&gt;Nividia Alpamayo-R1&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/2022348542585390814" target="_blank" rel="noopener"
&gt;理想汽车MindVLA-o1分享&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2510.26125" target="_blank" rel="noopener"
&gt;WOD-E2E&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://waymo.com/open/challenges/2025/e2e-driving/" target="_blank" rel="noopener"
&gt;E2E-Driving Chanllenges&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2601.16163" target="_blank" rel="noopener"
&gt;Cosmos Policy&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on Keye-VL 1.5</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/</link><pubDate>Thu, 11 Sep 2025 11:33:31 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/</guid><description>&lt;p&gt;快手提出了 Keye-VL 1.5, 一个强调 reasoning, video understanding 的 8B 多模态大模型。作者提出了 slow-fast video encoding strategy 来提高模型的视频理解能力，作者通过在预训练和后训练提高了模型的长上下文能力和 reasoning 能力&lt;/p&gt;
&lt;h2 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h2&gt;&lt;p&gt;作者回顾了多模态大模型的进展，然后提到视频理解能力仍然是一个挑战。为了解决这个问题，作者提出了 Keye-VL-1.5, 一个 8B 的视频理解多模态大模型。&lt;/p&gt;
&lt;p&gt;Keye-VL-1.5 主要做了三点改进：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在架构上，使用了 Slow-Fast Video Encoding&lt;/li&gt;
&lt;li&gt;在预训练阶段，使用多个 stage 来提升模型的长上下文能力&lt;/li&gt;
&lt;li&gt;在 post-training 阶段，提高模型的 reasoning 能力和 alignment 表现&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h2&gt;&lt;h3 id="architecture"&gt;&lt;a href="#architecture" class="header-anchor"&gt;&lt;/a&gt;Architecture
&lt;/h3&gt;&lt;p&gt;Keye-VL 1.5 的架构与 &lt;a class="link" href="https://maosong.website/p/notes-on-keye-vl/" target="_blank" rel="noopener"
&gt;Keye-VL&lt;/a&gt; 一致。&lt;/p&gt;
&lt;p&gt;Keye-VL 1.5 主要做出的改进点为针对视频的 encoding 方式&lt;/p&gt;
&lt;p&gt;作者回顾了已有 MLLM 处理视频的方式，比如 &lt;a class="link" href="https://maosong.website/p/notes-on-qwen2.5-vl/" target="_blank" rel="noopener"
&gt;Qwen2.5-VL&lt;/a&gt; 使用 3D convolution 来 merge 相邻的两帧，&lt;a class="link" href="https://maosong.website/p/notes-on-seed1.5-vl/" target="_blank" rel="noopener"
&gt;Seed1.5-VL&lt;/a&gt; 采用了 Dynamic Frame-Resolution Sampling 技巧，来根据 budget 和处理的任务来动态调整采样率 (frame) 和每一帧的图片精度 (resolution)。&lt;/p&gt;
&lt;p&gt;但是这些方法很难进行泛化。因此，作者在本文中就提出了 &lt;strong&gt;SlowFast video encoding stratrgy&lt;/strong&gt;:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Slow Pathway: 空间信息丰富（high resolution），时间信息简略 (low number of frames)&lt;/li&gt;
&lt;li&gt;Fast Pathway: 时间信息丰富（high number of frames），空间信息简略 (low resolution)&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为了区分 slow/fast frames, 作者提出了一个基于 patch similarity 的 metric:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;第一帧始终定义为 slow frame&lt;/li&gt;
&lt;li&gt;接下来的每一帧，如果其和上一帧的相似度超过 $95\%$, 则定义为 fast frame; 反之则定义为 slow frame.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;得到 slow/fast frames 之后，作者将 fast-frame 的 token budget 限制为 slow frame token budget 的 $30\%$ 来平衡时间信息以及空间信息。接下来，作者使用二分搜索来决定 slow frame 的 token budget. 为了区分 slow frame 和 fast frame 的 token, 作者使用了特殊的 token 来进行分离。&lt;/p&gt;
&lt;p&gt;最终的处理结果如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-video-encoding.png"
width="1364"
height="335"
loading="lazy"
alt="SlowFast Video Encoding"
class="gallery-image"
data-flex-grow="407"
data-flex-basis="977px"
&gt;&lt;/p&gt;
&lt;h3 id="pre-training"&gt;&lt;a href="#pre-training" class="header-anchor"&gt;&lt;/a&gt;Pre-training
&lt;/h3&gt;&lt;p&gt;预训练的数据和 Keye-VL 基本一致，我们主要介绍改进的点&lt;/p&gt;
&lt;p&gt;对于 Image caption 数据，作者认为这批数据可能会损害模型的指令跟随和 reasoning 能力，因此作者对数据进行了增广，主要是调整了数据的格式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;QA, 数据格式为 &lt;code&gt;&amp;lt;image, caption, [eos], question, answer&amp;gt;&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;reverse QA, 数据格式为 &lt;code&gt;&amp;lt;image, question, answer, [eos], caption&amp;gt;&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;instruction following: 随机给一批数据作为输入，然后让模型基于特定 image 输出 caption&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;作者还构建了一个 trap question 来提高模型的 robustness 以及 faithfulness.&lt;/p&gt;
&lt;p&gt;OCR 数据在 Keye-VL 的基础上加入了两点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Structured Document and Code Understanding: 基于 markdown 和 HTML 等数据来获取 code OCR 数据&lt;/li&gt;
&lt;li&gt;Instruction Following OCR: 基于特定指令进行 OCR&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;对于 grounding 数据，作者进一步加入了 temporal grounding 数据，作者首先使用 TEMPURA&lt;/p&gt;
&lt;p&gt;来将短视频分割成若干个 video clips. 然后作者使用 SOTA MLLM 来过滤数据，最后作者基于 Gemini2.5 来生成对应的 QA.&lt;/p&gt;
&lt;p&gt;预训练和 Keye-VL 一样，包含 3 个 stage&lt;/p&gt;
&lt;p&gt;前两个 stage，作者将模型的上下文限制为 8K, 使用了 DP 和 Zero-2 来减少内存开销。在 stage 3, 作者将模型的上下文从 8K 扩展到 128K, 对应的 base frequency 从 1M 提升到 8M. 训练数据包括长视频，长文本和大规模图片。作者将优化策略调整为 Zero-1, CP 和 PP 来支持 long-context 的训练。训练时数据分布为 video:images:text=24:50:26.&lt;/p&gt;
&lt;h3 id="post-training"&gt;&lt;a href="#post-training" class="header-anchor"&gt;&lt;/a&gt;Post-training
&lt;/h3&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-post-training-pipeline.png"
width="1360"
height="449"
loading="lazy"
alt="Post-Training Pipeline"
class="gallery-image"
data-flex-grow="302"
data-flex-basis="726px"
&gt;&lt;/p&gt;
&lt;p&gt;SFT 阶段使用了 &lt;strong&gt;7.5M&lt;/strong&gt; 多模态 QA 样本进行训练。&lt;/p&gt;
&lt;p&gt;MPO 阶段的数据相比 Keye-VL 有所减少，包含：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;250K 开源样本&lt;/li&gt;
&lt;li&gt;150K 纯文本数据&lt;/li&gt;
&lt;li&gt;26K 人类标注数据&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;对于 reward model 的训练，作者使用了 SFT 和 RL 两个阶段。SFT 阶段的数据包括 R1-Reward 和 MMPR, 训练之后作者还是用比较短的 good response 来避免产生较长的回答&lt;/p&gt;
&lt;p&gt;在 SFT 和 MPO 阶段之后，作者使用 LongCoT code-start 初步激活模型的 reasoning 能力。&lt;/p&gt;
&lt;p&gt;作者构建了一个 5 部的自动化数据生成 pipeline, 如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-LongCoT-data-generation-pipeline.png"
width="1362"
height="389"
loading="lazy"
alt="LongCoT data generation pipeline"
class="gallery-image"
data-flex-grow="350"
data-flex-basis="840px"
&gt;&lt;/p&gt;
&lt;p&gt;步骤如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Multi-Source Data Collection and Enhancement：收集数据&lt;/li&gt;
&lt;li&gt;Multi-Path Reasoning Generation with Confidence Quantification: 基于 confidence 来挑选数据&lt;/li&gt;
&lt;li&gt;Comprehensive Two-Level Quality Assessment: 基于答案和过程的正确性来提高数据质量&lt;/li&gt;
&lt;li&gt;Human-in-the-Loop Quality Enhancement: 对于中等质量的数据请人类进一步进行标注&lt;/li&gt;
&lt;li&gt;Dynamic Quality Scoring and Data Utilization Strategy: 对数据进行打分，高质量数据进行上采样&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;接下来就是 General RL 过程。&lt;/p&gt;
&lt;p&gt;对于通用的 RLVR 训练，作者使用了 &lt;a class="link" href="https://maosong.website/p/notes-on-gspo/" target="_blank" rel="noopener"
&gt;GSPO&lt;/a&gt; 算法来进行训练。&lt;/p&gt;
&lt;p&gt;在训练过程中，作者采取了 progressive hint sampling 方式，也就是提供不同程度的 hint 来提高模型的训练效率。作者将 hint 分为五个等级：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Level 1 (Concept / Observation)&lt;/li&gt;
&lt;li&gt;Level 2 (Strategy / Method)&lt;/li&gt;
&lt;li&gt;Level 3 (Tools / Formula)&lt;/li&gt;
&lt;li&gt;Level 4 (Steps / Calculation)&lt;/li&gt;
&lt;li&gt;Level 5 (Complete Solution)&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;来提供不同程度的辅助，作者使用 Keye-VL 1.5 来确定最小的 hint level, 然后基于这个 level 提供信息进行 RL 的训练&lt;/p&gt;
&lt;p&gt;为了进一步提高模型的表现，作者采用了一个和 &lt;a class="link" href="https://maosong.website/p/notes-on-seed1.5-vl/" target="_blank" rel="noopener"
&gt;Seed1.5-VL&lt;/a&gt; 一样的迭代式训练策略，即反复进行 SFT 和 RL 来降低训练成本，提高训练效率。&lt;/p&gt;
&lt;p&gt;最后，再通用 RL 阶段之后，作者加入了 alignment RL 的训练来进行对齐，reward 包括三个方面：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;rule-based reward&lt;/li&gt;
&lt;li&gt;generative reward&lt;/li&gt;
&lt;li&gt;model-based reward&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;任务主要包括三个方面：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;instruction following&lt;/li&gt;
&lt;li&gt;format adherence&lt;/li&gt;
&lt;li&gt;preference alignment&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;数据介绍如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;instruction following:25 类硬约束，20 类软约束，数据包括 17K 多模态数据和 23K 纯文本数据，奖励包括 rule-based reward 和 generative reward&lt;/li&gt;
&lt;li&gt;reasoning: 12K 数学和逻辑推理数据&lt;/li&gt;
&lt;li&gt;RAG: 提高模型的搜索能力，作者使用 GSPO 算法进行训练&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="experiments"&gt;&lt;a href="#experiments" class="header-anchor"&gt;&lt;/a&gt;Experiments
&lt;/h2&gt;&lt;p&gt;模型表现如下&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-Performance.png"
width="1366"
height="988"
loading="lazy"
alt="Performance of Keye-VL 1.5"
class="gallery-image"
data-flex-grow="138"
data-flex-basis="331px"
&gt;&lt;/p&gt;
&lt;p&gt;接下来作者进行了消融实验。&lt;/p&gt;
&lt;p&gt;首先是不同训练阶段对模型表现的影响，如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-ablation-training-stage.png"
width="1369"
height="458"
loading="lazy"
alt="Ablation study on training strategy"
class="gallery-image"
data-flex-grow="298"
data-flex-basis="717px"
&gt;&lt;/p&gt;
&lt;p&gt;实验结果显示，提高 SFT 训练数据可以有效提高模型在数学推理，逻辑推理和 OCR 任务上的表现。MPO 可以进一步提高模型的表现，Long CoT cold start 可以有效提高模型的 reasoning 表现。&lt;/p&gt;
&lt;p&gt;作者还探究了 model merging 对模型表现的影响，作者首先基于 base model 和 OCR 数据训练得到 OCR expert, 然后进行 merge, 实验结果如下&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-ablation-model-merging.png"
width="1244"
height="340"
loading="lazy"
alt="Ablation study on model merging"
class="gallery-image"
data-flex-grow="365"
data-flex-basis="878px"
&gt;&lt;/p&gt;
&lt;p&gt;实验结果显示，model merging 可以有效提高模型在 special domain 上的表现，并且还可以维持模型的通用能力&lt;/p&gt;
&lt;p&gt;作者还发现：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;expert model 训练时间过长会影响最终 merge model 的表现&lt;/li&gt;
&lt;li&gt;expert mode 训练的学习率应该要设置比较小&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;接下来，作者探究了 alignment RL 对模型表现的影响，&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-ablation-alignment-RL.png"
width="1385"
height="275"
loading="lazy"
alt="Ablation on alignment RL"
class="gallery-image"
data-flex-grow="503"
data-flex-basis="1208px"
&gt;&lt;/p&gt;
&lt;p&gt;实验结果说明，alignment RL 可以在保持模型 reasoning 能力的同时提高模型的指令跟随能力&lt;/p&gt;
&lt;p&gt;作者还探究了 hint 对模型表现的影响，使用不同 level hint 进行训练对模型表现影响的结果如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-ablation-hint.png"
width="1209"
height="310"
loading="lazy"
alt="Ablation on hint level"
class="gallery-image"
data-flex-grow="390"
data-flex-basis="936px"
&gt;&lt;/p&gt;
&lt;p&gt;实验结果显示，使用 high level 的 hint 可以有效提高模型输出的正确率。&lt;/p&gt;
&lt;p&gt;最后作者探究了 rejection sampling 对模型表现的影响，实验结果如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-keye-vl-1.5/Keye-VL-1-5-ablation-rejection-sampling.png"
width="1384"
height="340"
loading="lazy"
alt="Ablation on rejection sampling"
class="gallery-image"
data-flex-grow="407"
data-flex-basis="976px"
&gt;&lt;/p&gt;
&lt;p&gt;结果发现，通过 rejection sampling，模型的表现有了进一步的提升。因此作者采用了 ST-RL-(RFT-SFT)-(RFT-RL) 的训练方式来进行训练&lt;/p&gt;
&lt;h2 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h2&gt;&lt;p&gt;作者在本文中提出了 Keye-VL1.5, 一个强调 video understanding 和 reasoning 的 MLLM. Keye-VL 1.5 使用了 SlowFast video encoding strategy 来提高模型的效率和视频理解能力。作者详细介绍了模型的数据，训练和评估。&lt;/p&gt;
&lt;h2 id="references"&gt;&lt;a href="#references" class="header-anchor"&gt;&lt;/a&gt;References
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2509.01563" target="_blank" rel="noopener"
&gt;arxiv&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on ARC-Hunyuan-Video-7B</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/</link><pubDate>Tue, 12 Aug 2025 10:57:57 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/</guid><description>&lt;p&gt;腾讯 ARC LAB 提出了 ARC-Hunyuan-Video-7B, 一个针对短视频理解和推理的视频多模态大模型。&lt;/p&gt;
&lt;h2 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h2&gt;&lt;p&gt;作者首先提出了 Structured video comprehension 的概念&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;the ability to decompose a video into its constituent events and narrative elements with temporal precision.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;视频信息包含了 dense visual elements, 比如文字等信息，还有 rich audio streams, 比如音效，音乐，再就是 rapid narrative pacing, 用于强调情感。&lt;/p&gt;
&lt;p&gt;已有的多模态大模型对于视频的细粒度理解和推理能力存在不足。尽管 &lt;a class="link" href="https://maosong.website/p/notes-on-keye-vl/" target="_blank" rel="noopener"
&gt;Keye-VL&lt;/a&gt; 也是一个短视频理解多模态大模型，但是其并没有利用 audio 模态的信息。其他的 audio-visual LLM 虽然可以处理 audio 模态的信息，但是他们主要集中于通用场景的视频，这类视频的特点是：叙述节奏慢，信息密度低。因此，对于叙述节奏快，信息丰富的短视频，这些模型表现就比较差。&lt;/p&gt;
&lt;p&gt;基于以上这些问题，作者提出了 ARC-Hunyuan-Video-7B, 一个基于 Hunyuan-7B vision-language model 的短视频多模态大模型，其主要做了两点改进：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;加入了一个 audio encoder 用于提取 audio 信息，然后对 audio 信息与视觉信息进行同步&lt;/li&gt;
&lt;li&gt;使用了一个 timestamp overlap 机制，将时间戳印在视频的帧上，帮助模型理解事件的时序信息&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;作者还涉及了多阶段的训练策略，来提高模型的表现。最后在测试时，对于一个 1 分钟的视频，模型在 H20 GPU 上进需要 10 秒就可以处理完毕。&lt;/p&gt;
&lt;h2 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h2&gt;&lt;h3 id="architecture"&gt;&lt;a href="#architecture" class="header-anchor"&gt;&lt;/a&gt;Architecture
&lt;/h3&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-architecture.png"
width="682"
height="467"
loading="lazy"
alt="Architecture of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="146"
data-flex-basis="350px"
&gt;&lt;/p&gt;
&lt;p&gt;模型基于 Hunyuan-7B-VLM 开发得到，&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Visual Encoding: 作者将时间戳以 &lt;code&gt;HH:MM:SS&lt;/code&gt; 的形式印在视频的帧上。视频的采样率为 1FPS, 超过 150s 的视频会进行均匀采样降低至 150s. 每一帧会 resize 到 $640\times 640$, 最后每一帧输出 112 token&lt;/li&gt;
&lt;li&gt;Audio Encoding: 使用 Whisper 作为编码器。小于 300s 的视频，会按照 30s 为单位切分为不同的 chunk, 大于 300s 的视频，会分割为 150 个 chunk, 然后每个 chunk 只保留开头 2s 的内容。最后，使用 Whisper 进行特征提取，最后再通过 MLP 与 LLM 的特征空间进行对齐&lt;/li&gt;
&lt;li&gt;Visual-audio Synchronization: 先对 audio token 进行 zero padding 与 Visual token 的个数进行对齐，然后将两者相加&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="training"&gt;&lt;a href="#training" class="header-anchor"&gt;&lt;/a&gt;Training
&lt;/h3&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-training-overall.png"
width="682"
height="467"
loading="lazy"
alt="Training pipeline of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="146"
data-flex-basis="350px"
&gt;&lt;/p&gt;
&lt;h4 id="pre-training"&gt;&lt;a href="#pre-training" class="header-anchor"&gt;&lt;/a&gt;Pre-training
&lt;/h4&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-annotation.png"
width="1362"
height="289"
loading="lazy"
alt="Boostrapped annotation pipeline of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="471"
data-flex-basis="1131px"
&gt;&lt;/p&gt;
&lt;p&gt;作者首先保住了一些数据。具体流程就是，使用 Whisper-v3 来转录带时间戳的音频，然后使用 InternVL-2.5-8B [[InternVL-2.5]] 来生成细粒度的 caption. 作者还使用 CoT prompt 策略，让模型一步步生成时间的描述，创作者的想法以及如何吸引用户的 tag 等。&lt;/p&gt;
&lt;p&gt;预训练数据如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Category&lt;/th&gt;
&lt;th&gt;data&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Video description and summary&lt;/td&gt;
&lt;td&gt;4.5M short-form video&lt;br&gt;0.2M public video&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Image caption and OCR&lt;/td&gt;
&lt;td&gt;4.7M image-text pairs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ASR&lt;/td&gt;
&lt;td&gt;3.2M audio-text pairs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video temporal grounding&lt;/td&gt;
&lt;td&gt;0.5M temporally grounding instances&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video multi-granular caption&lt;/td&gt;
&lt;td&gt;50K high-quality samples&lt;br&gt;80K in-house videos&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;训练包含两个 stage:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Stage 1: 使用 ASR 数据训练模型接受音频输入的能力，为了避免视觉模态能力下降，作者还加入了 Image-text pair data 来训练，缺失的模态用 zero padding 来补齐&lt;/li&gt;
&lt;li&gt;Stage 2: 使用全部数据进行训练，仅训练 MLP 和 LLM&lt;/li&gt;
&lt;/ol&gt;
&lt;h4 id="post-training"&gt;&lt;a href="#post-training" class="header-anchor"&gt;&lt;/a&gt;Post-training
&lt;/h4&gt;&lt;p&gt;作者首先进行了消融实验，探究 human-annotated 数据对模型表现的影响。作者收集了 140 条人类标注的数据，然后基于这些数据进行消融实验：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;直接使用人类标注数据进行 SFT, 模型表现变化不大&lt;/li&gt;
&lt;li&gt;直接使用人类标注数据作为正样本，合成数据作为负样本进行 DPO, 模型表现变化也不大&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;作者分析原因认为，&lt;strong&gt;人类标注数据和合成数据之间存在 distribution shift&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;受 &lt;a class="link" href="https://maosong.website/p/notes-on-deepseek-r1/" target="_blank" rel="noopener"
&gt;DeepSeek-R1&lt;/a&gt; 启发，作者决定使用 GRPO 算法来提高模型的表现，训练任务包含两个：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;multi-dimensional Multi-choide QA: 提高模型的视频理解能力&lt;/li&gt;
&lt;li&gt;Temporal video grounding: 提高模型的时序感知能力&lt;/li&gt;
&lt;/ol&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Stage&lt;/th&gt;
&lt;th&gt;Data&lt;/th&gt;
&lt;th&gt;Module&lt;/th&gt;
&lt;th&gt;Description&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;SFT&lt;/td&gt;
&lt;td&gt;MCQ:&lt;br&gt; - 460K open-ended QA&lt;br&gt; - 70K MCQA&lt;br&gt; - 20K QA&lt;br&gt;Grounding:&lt;br&gt; - 10K academic&lt;br&gt; - 5K real-world&lt;br&gt;General:&lt;br&gt; - 45K description&lt;br&gt; - 12K caption&lt;/td&gt;
&lt;td&gt;MLP+LLM&lt;/td&gt;
&lt;td&gt;提高指令跟随能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cold Start SFT&lt;/td&gt;
&lt;td&gt;- 90K MCQA&lt;br&gt;- 18K temporal grounding&lt;br&gt;- 20K open-ended QA&lt;br&gt;- 15K summarization&lt;br&gt;- 3K chapter-level captioning&lt;/td&gt;
&lt;td&gt;MLP+LLM&lt;/td&gt;
&lt;td&gt;初步激活模型的 reas 能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RL&lt;/td&gt;
&lt;td&gt;- 100K MCQ&lt;br&gt;- 35K temporal grounding&lt;/td&gt;
&lt;td&gt;LLM&lt;/td&gt;
&lt;td&gt;提升模型的 reasoning 能力&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SFT&lt;/td&gt;
&lt;td&gt;- 25K human-annotated subjective question&lt;br&gt;- 100K MCQ with CoT&lt;br&gt;- 50K temporal grounding with reasoning traces&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;使用人类标注数据进一步提高模型的能力&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="experiments"&gt;&lt;a href="#experiments" class="header-anchor"&gt;&lt;/a&gt;Experiments
&lt;/h2&gt;&lt;p&gt;作者构建了一个评估短视频理解能力的 benchmark: ShortVid-Bench, 评估以下方面：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Temporal Reasoning and Localization&lt;/li&gt;
&lt;li&gt;Affective Intent Classification&lt;/li&gt;
&lt;li&gt;Creator Intent Taxonomy&lt;/li&gt;
&lt;li&gt;Narrative Comprehension&lt;/li&gt;
&lt;li&gt;Humor &amp;amp; Meme Deconstruction&lt;/li&gt;
&lt;li&gt;Creative Innovation Analysis&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;对比的模型包括 Qwen2.5-VL-7B, Qwen2.5-omni-7B 和 Keye-VL-8B&lt;/p&gt;
&lt;p&gt;评估结果如下：&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-arc-hunyuan-video-7b/ARC-Hunyuan-Video-performance.png"
width="1367"
height="244"
loading="lazy"
alt="Performance of ARC-Hunyuan-Video-7B"
class="gallery-image"
data-flex-grow="560"
data-flex-basis="1344px"
&gt;&lt;/p&gt;
&lt;h2 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h2&gt;&lt;p&gt;作者提出了 ARC-Hunyuan-Video-7B, 一个针对短视频的视频理解多模态大模型。作者详细介绍了模型的架构，训练数据以及评估。&lt;/p&gt;
&lt;h2 id="references"&gt;&lt;a href="#references" class="header-anchor"&gt;&lt;/a&gt;References
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2507.20939" target="_blank" rel="noopener"
&gt;arxiv&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/TencentARC/ARC-Hunyuan-Video-7B" target="_blank" rel="noopener"
&gt;Github&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on VITA</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/</link><pubDate>Tue, 13 Aug 2024 14:36:45 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/</guid><description>&lt;h1 id="tldr"&gt;&lt;a href="#tldr" class="header-anchor"&gt;&lt;/a&gt;TLDR
&lt;/h1&gt;&lt;p&gt;This paper proposes a Multimodal Large Language Model VITA (Video, Image, Text, Audio).
VITA supports non-awakening interaction and audio interruption for better interactive experience.
VITA aims to be an open-sourced version of GPT-4o.&lt;/p&gt;
&lt;h1 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h1&gt;&lt;p&gt;Features of GPT-4o:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;a unified framework that processes text, vision, and audio signals in an end-to-end manner,&lt;/li&gt;
&lt;li&gt;the capability to enable natural multimodal human-computer interaction.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Similar to Mini-GPT4, this paper tries to proposed an open-sourced version of GPT-4o.&lt;/p&gt;
&lt;h1 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h1&gt;&lt;h2 id="model"&gt;&lt;a href="#model" class="header-anchor"&gt;&lt;/a&gt;Model
&lt;/h2&gt;&lt;p&gt;The architecture of VITA is shown as follows:
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_architecture.png"
width="1282"
height="1069"
loading="lazy"
alt="Architecture of VITA"
class="gallery-image"
data-flex-grow="119"
data-flex-basis="287px"
&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLM: Mixtral $8\times 7$ B&lt;/li&gt;
&lt;li&gt;Visual Encoder: InternViT-300M-448px&lt;/li&gt;
&lt;li&gt;Audio Encoder: Mel Filter Bank block&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;To support audio interruption, the author uses two model at the same time, where the generation model is responsible for handling user queries and the other model monitors the environment. The other models starts to work is there is an audio interruption.&lt;/p&gt;
&lt;h2 id="data"&gt;&lt;a href="#data" class="header-anchor"&gt;&lt;/a&gt;Data
&lt;/h2&gt;&lt;h3 id="multimodal-instruction-tuning"&gt;&lt;a href="#multimodal-instruction-tuning" class="header-anchor"&gt;&lt;/a&gt;multimodal instruction tuning
&lt;/h3&gt;&lt;p&gt;Training data of multimodal instruction tuning is given as follows:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_SFT_data.png"
width="1286"
height="672"
loading="lazy"
alt="Training data of multimodal instruction tuning"
class="gallery-image"
data-flex-grow="191"
data-flex-basis="459px"
&gt;&lt;/p&gt;
&lt;p&gt;Improvements are made:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;The questions are randomly (about half) replaced with their audio versions, using TTS technique such as GPT-SoVITS&lt;/li&gt;
&lt;li&gt;Different system prompts are set to avoid conflicts between different types of data&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;To support human-AI interaction, the noisy audio data are also constructed. Noisy audio samples are generated from existed QA data. These negative sample texts aim to improve the ability of VITA to not respond to non-query-related content.&lt;/p&gt;
&lt;p&gt;To distinguish three types of queries, the author uses three state tokens:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;1&amp;gt;&lt;/code&gt; denotes that the question input is the query audio&lt;/li&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;2&amp;gt;&lt;/code&gt; denotes that the question input is the noisy audio.&lt;/li&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;3&amp;gt;&lt;/code&gt; signifies the question of pure text.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="training-pipeline"&gt;&lt;a href="#training-pipeline" class="header-anchor"&gt;&lt;/a&gt;Training pipeline
&lt;/h2&gt;&lt;p&gt;Training pipeline of VITA consists of three stages:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_training_pipeline.png"
width="1301"
height="852"
loading="lazy"
alt="Training pipeline of VITA"
class="gallery-image"
data-flex-grow="152"
data-flex-basis="366px"
&gt;&lt;/p&gt;
&lt;h3 id="non-awakening-interaction"&gt;&lt;a href="#non-awakening-interaction" class="header-anchor"&gt;&lt;/a&gt;Non-awakening Interaction
&lt;/h3&gt;&lt;p&gt;There are following requirements and solutions:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Real-time Tracking of Environmental Sounds. This paper uses SileroVAD to complete the Voice Activity Detection (VAD) task.&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Filtering out noisy audio. This is done by making use of token &lt;code&gt;&amp;lt;2&amp;gt;&lt;/code&gt;.&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="audio-interrupt-interaction"&gt;&lt;a href="#audio-interrupt-interaction" class="header-anchor"&gt;&lt;/a&gt;Audio Interrupt Interaction
&lt;/h3&gt;&lt;p&gt;There are following requirements and solutions:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Real-time Tracking and Filtering of External Queries. This is done by use another VITA model as stated in Model section.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="evaluation"&gt;&lt;a href="#evaluation" class="header-anchor"&gt;&lt;/a&gt;Evaluation
&lt;/h1&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_evaluation.png"
width="1297"
height="536"
loading="lazy"
alt="Evaluation on image and video understanding"
class="gallery-image"
data-flex-grow="241"
data-flex-basis="580px"
&gt;&lt;/p&gt;
&lt;h1 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h1&gt;&lt;p&gt;The paper points out three limitations of VITA:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Enhancement of Foundational Capabilities.&lt;/li&gt;
&lt;li&gt;Refinement of Noisy Audio Construction.&lt;/li&gt;
&lt;li&gt;Building end-to-end TTS in conjunction with LLM.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.05211" target="_blank" rel="noopener"
&gt;Arxiv paper&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://vita-home.github.io" target="_blank" rel="noopener"
&gt;Github&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>