<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Paper Reading on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/paper-reading/</link><description>Recent content in Paper Reading on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Sun, 12 Apr 2026 17:49:17 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/paper-reading/index.xml" rel="self" type="application/rss+xml"/><item><title>物理AI-VLA分享</title><link>https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/</link><pubDate>Sat, 11 Apr 2026 14:36:45 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/</guid><description>&lt;h2 id="agenda"&gt;&lt;a href="#agenda" class="header-anchor"&gt;&lt;/a&gt;Agenda
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;1️⃣ 什么是 VLA？&lt;/li&gt;
&lt;li&gt;2️⃣ VLA 发展：以 π 系列做主线&lt;/li&gt;
&lt;li&gt;3️⃣ VLA模型的设计空间：分享VLANeXt 论文中的思考&lt;/li&gt;
&lt;li&gt;4️⃣ 智驾 vs 具身：共性与讨论&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="什么是-vla视觉-语言-动作模型"&gt;&lt;a href="#%e4%bb%80%e4%b9%88%e6%98%af-vla%e8%a7%86%e8%a7%89-%e8%af%ad%e8%a8%80-%e5%8a%a8%e4%bd%9c%e6%a8%a1%e5%9e%8b" class="header-anchor"&gt;&lt;/a&gt;什么是 VLA（视觉-语言-动作模型）？
&lt;/h2&gt;&lt;p&gt;VLA 代表 Vision-Language-Action（视觉-语言-动作）
VLA 的核心思想是利用多模态大模型（MLLM）的 world knowledge and reasoning capabilities，直接产生机器人的动作输出。&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;输入： 机器人的摄像头图像（Vision）,机器人自身状态(Robot State)和人类的文字指令（Language）。
处理： 基于强大的多模态大模型（MLLM）去理解场景和指令。
输出： 直接生成控制机器人关节或末端执行器的低级动作指令（Action）。
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;VLA 让机器人能够像人类一样，通过观察世界、听从指令，然后直接采取行动，打破了传统机器人需要复杂的手工编码和分层多子系统的限制。&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/vla1.jpg"
width="1810"
height="863"
loading="lazy"
alt="vla model arch"
class="gallery-image"
data-flex-grow="209"
data-flex-basis="503px"
&gt;&lt;/p&gt;
&lt;h2 id="vla的研究进展pi系列-以physical-intelligence-π为主线关注核心组织和人-"&gt;&lt;a href="#vla%e7%9a%84%e7%a0%94%e7%a9%b6%e8%bf%9b%e5%b1%95pi%e7%b3%bb%e5%88%97-%e4%bb%a5physical-intelligence-%cf%80%e4%b8%ba%e4%b8%bb%e7%ba%bf%e5%85%b3%e6%b3%a8%e6%a0%b8%e5%bf%83%e7%bb%84%e7%bb%87%e5%92%8c%e4%ba%ba-" class="header-anchor"&gt;&lt;/a&gt;VLA的研究进展(pi系列)-以Physical Intelligence (π)为主线(关注核心组织和人 ）
&lt;/h2&gt;&lt;h3 id="π系列发展历程和趋势"&gt;&lt;a href="#%cf%80%e7%b3%bb%e5%88%97%e5%8f%91%e5%b1%95%e5%8e%86%e7%a8%8b%e5%92%8c%e8%b6%8b%e5%8a%bf" class="header-anchor"&gt;&lt;/a&gt;π系列发展历程和趋势
&lt;/h3&gt;&lt;p&gt;&lt;a class="link" href="https://www.pi.website/blog" target="_blank" rel="noopener"
&gt;π&lt;/a&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;核心架构与技术特征&lt;/th&gt;
&lt;th&gt;关键突破点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;π₀&lt;br&gt;2024-10&lt;/td&gt;
&lt;td&gt;MoT (Mixture of Transformer) + Flow Matching&lt;/td&gt;
&lt;td&gt;奠定了 VLA 多模态训练的基础，利用连续流匹配生成动作。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FAST&lt;br&gt;2025-01&lt;/td&gt;
&lt;td&gt;Efficient Action Tokenization&lt;/td&gt;
&lt;td&gt;引入离散动作标记，提升了实时的推理速度和执行效率。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π₀.₅&lt;br&gt;2025-04&lt;/td&gt;
&lt;td&gt;两者 action 建模结合&lt;br&gt;混合任务训练&lt;br&gt;层次化 VLM/VLA 架构&lt;/td&gt;
&lt;td&gt;结合连续与离散建模，通过混合任务训练应对复杂、长程任务。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π₀.₆* 及后续&lt;br&gt;2025-11&lt;/td&gt;
&lt;td&gt;RL + Memory + Agentic&lt;/td&gt;
&lt;td&gt;引入强化学习、长期记忆与自主决策能力，向机器人智能体迈进。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="总结physical-intelligence-π-vla的进展"&gt;&lt;a href="#%e6%80%bb%e7%bb%93physical-intelligence-%cf%80-vla%e7%9a%84%e8%bf%9b%e5%b1%95" class="header-anchor"&gt;&lt;/a&gt;总结Physical Intelligence (π) VLA的进展
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;时间&lt;/th&gt;
&lt;th&gt;版本&lt;/th&gt;
&lt;th&gt;核心技术方向&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;π系列第一阶段&lt;/td&gt;
&lt;td&gt;2024-10 ~&lt;/td&gt;
&lt;td&gt;π₀ / π₀-FAST / π₀.₅&lt;/td&gt;
&lt;td&gt;Flow Matching、Efficient Action Tokenization、分层设计 VLM + VLA、混合任务训练&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π系列第二阶段&lt;/td&gt;
&lt;td&gt;2025-11 ~&lt;/td&gt;
&lt;td&gt;π₀.₆* 及后续&lt;/td&gt;
&lt;td&gt;RL、Memory、Agentic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="vla模型的设计空间vlanext"&gt;&lt;a href="#vla%e6%a8%a1%e5%9e%8b%e7%9a%84%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4vlanext" class="header-anchor"&gt;&lt;/a&gt;VLA模型的设计空间（VLANeXT）
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/pdf/2602.18532" target="_blank" rel="noopener"
&gt;VLANeXT&lt;/a&gt;&lt;/p&gt;
&lt;h3 id="设计vla模型需要思考的问题"&gt;&lt;a href="#%e8%ae%be%e8%ae%a1vla%e6%a8%a1%e5%9e%8b%e9%9c%80%e8%a6%81%e6%80%9d%e8%80%83%e7%9a%84%e9%97%ae%e9%a2%98" class="header-anchor"&gt;&lt;/a&gt;设计VLA模型需要思考的问题：
&lt;/h3&gt;&lt;ol&gt;
&lt;li&gt;action怎么生成，VLM直接输出还是额外action expert网络？&lt;/li&gt;
&lt;li&gt;action训练方法，Flow matching，VAE还是DDIM？&lt;/li&gt;
&lt;li&gt;VLM和action expert的怎么连接？&lt;/li&gt;
&lt;li&gt;propriocetion 自身状态输入给VLM还是action expert&lt;/li&gt;
&lt;li&gt;多相机数据怎么输入给VLA，相机标定的内外参信息怎么喂给模型？图像的时序信息怎么处理？&lt;/li&gt;
&lt;li&gt;是否引入额外任务构建更稠密的loss？如预测下一帧图像，还是引入额外输出头？
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/policy.png"
width="720"
height="336"
loading="lazy"
alt="policy"
class="gallery-image"
data-flex-grow="214"
data-flex-basis="514px"
&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="vlanext中探讨的vla设计空间"&gt;&lt;a href="#vlanext%e4%b8%ad%e6%8e%a2%e8%ae%a8%e7%9a%84vla%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4" class="header-anchor"&gt;&lt;/a&gt;VLANEXT中探讨的VLA设计空间
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设计维度&lt;/th&gt;
&lt;th&gt;决策组件 / 变量&lt;/th&gt;
&lt;th&gt;设计选项 (Design Options)&lt;/th&gt;
&lt;th&gt;实验结论摘要 (Ablation Insights)&lt;/th&gt;
&lt;th&gt;最佳配方 (Final Recipe)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;一、基础组件 (Foundational)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;1. 策略模块设计 (Policy Architecture)&lt;/td&gt;
&lt;td&gt;A. 复用文本Token&lt;br&gt;B. 独立策略头（浅层）&lt;br&gt;C. 深度策略网络（MetaQuery）&lt;/td&gt;
&lt;td&gt;浅层或复用架构无法充分解耦感知与动作；MetaQuery 风格能更好处理复杂动作。&lt;/td&gt;
&lt;td&gt;采用深度独立策略模块（16 query tokens + 12层 Transformer）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;2. 动作分块 (Action Chunking)&lt;/td&gt;
&lt;td&gt;A. 单步预测（size=1）&lt;br&gt;B. 多步预测（size=8）&lt;/td&gt;
&lt;td&gt;预测未来多步动作显著提高动作平滑性和任务成功率。&lt;/td&gt;
&lt;td&gt;预测多步动作（Chunk size = 8）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;3. 动作学习目标 (Action Objective)&lt;/td&gt;
&lt;td&gt;A. 离散分类（Binning / VQ-VAE）&lt;br&gt;B. 回归（Regression）&lt;br&gt;C. 扩散 / 流匹配（DDIM / Flow）&lt;/td&gt;
&lt;td&gt;离散化损失空间细节；连续建模（Flow Matching / 回归）表达力更强。&lt;/td&gt;
&lt;td&gt;使用连续动作建模（优先 Flow Matching 或回归）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;4. VLM骨干容量 (VLM Backbone)&lt;/td&gt;
&lt;td&gt;测试 LLaMA, PaliGemma, Qwen3-VL 等&lt;/td&gt;
&lt;td&gt;骨干模型表征能力是基础，容量越大通常性能越好（需平衡资源）。&lt;/td&gt;
&lt;td&gt;视算力选择最优开源骨干（如 Qwen3-VL）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;5. VLM-策略连接 (VLM-Policy Link)&lt;/td&gt;
&lt;td&gt;A. 松散连接（Loose）&lt;br&gt;B. 紧密连接（Tight）&lt;br&gt;C. 软连接（Soft，引入 Query buffer）&lt;/td&gt;
&lt;td&gt;软连接通过可学习 query 提供缓冲，适配性略优于紧密或松散耦合。&lt;/td&gt;
&lt;td&gt;软连接策略（Soft Connection）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;二、感知要素 (Perception)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;6. 时序历史 (Temporal History)&lt;/td&gt;
&lt;td&gt;A. 仅当前帧&lt;br&gt;B. 添加过去帧&lt;/td&gt;
&lt;td&gt;添加过去帧反而降低性能，可能引入冗余或干扰信息。&lt;/td&gt;
&lt;td&gt;避免冗余时序历史输入（专注当前帧）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;7. 相机视角 (Camera Views)&lt;/td&gt;
&lt;td&gt;A. 单视角&lt;br&gt;B. 多视角（第三人称 + 腕部）&lt;/td&gt;
&lt;td&gt;多视角提供更全面空间信息，显著提升空间感知与操作精度。&lt;/td&gt;
&lt;td&gt;多视角输入（第三人称 + 腕部相机）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;8. 本体感觉注入 (Proprioception)&lt;/td&gt;
&lt;td&gt;A. 无本体 state&lt;br&gt;B. VLM端注入&lt;br&gt;C. 策略端注入&lt;br&gt;D. 双端注入&lt;/td&gt;
&lt;td&gt;本体 state 对闭环控制至关重要；VLM端注入效果优于策略端。&lt;/td&gt;
&lt;td&gt;本体 state 条件于 VLM 端注入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;三、动作建模 (Action Modeling)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;9. 世界建模辅助 (World Modeling)&lt;/td&gt;
&lt;td&gt;引入未来帧预测目标（如 Emu3.5）&lt;/td&gt;
&lt;td&gt;性能有提升，但训练成本增加约3倍，性价比低。&lt;/td&gt;
&lt;td&gt;不纳入最终配方&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;10. 时序预测视角 (Time-Series Perspective)&lt;/td&gt;
&lt;td&gt;引入频域损失（DCT）&lt;/td&gt;
&lt;td&gt;将动作视为时序预测问题，引入频域损失可低成本提升动作质量。&lt;/td&gt;
&lt;td&gt;引入频域辅助损失（DCT）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/vlanext.png"
width="701"
height="551"
loading="lazy"
alt="vlanext"
class="gallery-image"
data-flex-grow="127"
data-flex-basis="305px"
&gt;&lt;/p&gt;
&lt;h2 id="应用场景-具身vs智驾"&gt;&lt;a href="#%e5%ba%94%e7%94%a8%e5%9c%ba%e6%99%af-%e5%85%b7%e8%ba%abvs%e6%99%ba%e9%a9%be" class="header-anchor"&gt;&lt;/a&gt;应用场景-具身VS智驾
&lt;/h2&gt;&lt;h3 id="具身和智驾领域vla论文对比技术趋同"&gt;&lt;a href="#%e5%85%b7%e8%ba%ab%e5%92%8c%e6%99%ba%e9%a9%be%e9%a2%86%e5%9f%9fvla%e8%ae%ba%e6%96%87%e5%af%b9%e6%af%94%e6%8a%80%e6%9c%af%e8%b6%8b%e5%90%8c" class="header-anchor"&gt;&lt;/a&gt;具身和智驾领域VLA论文对比&amp;ndash;&amp;gt;技术趋同
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;技术方向&lt;/th&gt;
&lt;th&gt;具身&lt;/th&gt;
&lt;th&gt;智驾&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;action token&lt;/td&gt;
&lt;td&gt;pi0-FAST、RT2、OpenVLA&lt;/td&gt;
&lt;td&gt;AutoVLA&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action expert（flow matching）&lt;/td&gt;
&lt;td&gt;pi0&lt;/td&gt;
&lt;td&gt;DriveMoE&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action 建模两者结合 + 强化学习 RL&lt;/td&gt;
&lt;td&gt;pi0.5、pi0.6*&lt;/td&gt;
&lt;td&gt;Alpamaya&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;辅助 loss（3D 感知 / 世界模型 / 通才模型）&lt;/td&gt;
&lt;td&gt;蚂蚁 LingBot-VLA&lt;/td&gt;
&lt;td&gt;DriveVLA-W0 / EMMA&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="nvidia-alpamaya智驾vla"&gt;&lt;a href="#nvidia-alpamaya%e6%99%ba%e9%a9%bevla" class="header-anchor"&gt;&lt;/a&gt;Nvidia Alpamaya智驾VLA
&lt;/h3&gt;&lt;p&gt;Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail&lt;/p&gt;
&lt;h3 id="从waymo-end-to-end-driving-chanllenges看未来智驾的技术趋势"&gt;&lt;a href="#%e4%bb%8ewaymo-end-to-end-driving-chanllenges%e7%9c%8b%e6%9c%aa%e6%9d%a5%e6%99%ba%e9%a9%be%e7%9a%84%e6%8a%80%e6%9c%af%e8%b6%8b%e5%8a%bf" class="header-anchor"&gt;&lt;/a&gt;从Waymo End-to-End Driving Chanllenges看未来智驾的技术趋势
&lt;/h3&gt;&lt;p&gt;添加图片注释，不超过 140 字（可选）
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios(&lt;a class="link" href="https://arxiv.org/pdf/2510.26125%29-4.4" target="_blank" rel="noopener"
&gt;https://arxiv.org/pdf/2510.26125)-4.4&lt;/a&gt;. Discussion of the Results&lt;/p&gt;
&lt;p&gt;&lt;code&gt;1.MLLM-based Model (VLA)的好处？-&amp;gt;数据不易饱和&lt;/code&gt;&lt;br&gt;
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/q1.png"
width="372"
height="335"
loading="lazy"
alt="q1"
class="gallery-image"
data-flex-grow="111"
data-flex-basis="266px"
&gt;
&lt;code&gt;2.强化学习对E2E驾驶能力的提升？&lt;/code&gt;&lt;br&gt;
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/q3.png"
width="368"
height="257"
loading="lazy"
alt="q3"
class="gallery-image"
data-flex-grow="143"
data-flex-basis="343px"
&gt;&lt;/p&gt;
&lt;h2 id="open-discussion"&gt;&lt;a href="#open-discussion" class="header-anchor"&gt;&lt;/a&gt;open discussion
&lt;/h2&gt;&lt;h3 id="q1-智驾是否需要vla吗-"&gt;&lt;a href="#q1-%e6%99%ba%e9%a9%be%e6%98%af%e5%90%a6%e9%9c%80%e8%a6%81vla%e5%90%97-" class="header-anchor"&gt;&lt;/a&gt;Q1. 智驾是否需要VLA吗 ？
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;a.智驾特殊场景和长尾场景是否需要Language，是否是帮助提升泛化性?&lt;/li&gt;
&lt;li&gt;b.交互能力对于驾驶是否必须?驾驶需要需要遵循人类指令？&lt;/li&gt;
&lt;li&gt;c. 推理CoT对于智驾这类实时性高的场景是否必须？怎么trade-off?
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/buslane.png"
width="720"
height="960"
loading="lazy"
alt="buslane"
class="gallery-image"
data-flex-grow="75"
data-flex-basis="180px"
&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="q2-vla-vs-wam"&gt;&lt;a href="#q2-vla-vs-wam" class="header-anchor"&gt;&lt;/a&gt;Q2. VLA vs WAM？
&lt;/h3&gt;&lt;p&gt;&lt;code&gt;VLA (Vision-Language-Action, 视觉-语言-动作模型)&lt;/code&gt;&lt;br&gt;
瓶颈： VLA 模型通常缺乏对物理世界的深刻理解（没有物理常识）。它只是学到了动作和图像之间的“统计映射”。&lt;/p&gt;
&lt;p&gt;&lt;code&gt;WAM (World Action Model, 世界动作模型)&lt;/code&gt;&lt;br&gt;
核心思想： WAM 是建立在 World Model (世界模型) 之上的动作模型。世界模型的核心能力是“预测未来”。它学习物理世界的运作规律（例如，物体掉落会向下，水杯翻了水会流出）。 当接收到指令和当前视觉时，WAM 不会直接生成动作。它首先利用其世界模型“想象”：如果我采取动作A，世界会变成什么样？采取动作B，世界又会变成什么样？通过在“想象”中模拟未来，WAM 可以选择最能达成目标的动作序列。
WAM 的优势： 具有物理常识，具有“预测”和“规划”能力。&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/pdf/2601.16163" target="_blank" rel="noopener"
&gt;cosmos policy&lt;/a&gt;
添加图片注释，不超过 140 字（可选）
添加图片注释，不超过 140 字（可选）&lt;/p&gt;
&lt;h3 id="q3-vla-是终局吗wam-是终局吗两者怎么融合"&gt;&lt;a href="#q3-vla-%e6%98%af%e7%bb%88%e5%b1%80%e5%90%97wam-%e6%98%af%e7%bb%88%e5%b1%80%e5%90%97%e4%b8%a4%e8%80%85%e6%80%8e%e4%b9%88%e8%9e%8d%e5%90%88" class="header-anchor"&gt;&lt;/a&gt;Q3. VLA 是终局吗？WAM 是终局吗？两者怎么融合？
&lt;/h3&gt;&lt;p&gt;添加图片注释，不超过 140 字（可选）&lt;/p&gt;
&lt;h2 id="总结"&gt;&lt;a href="#%e6%80%bb%e7%bb%93" class="header-anchor"&gt;&lt;/a&gt;总结
&lt;/h2&gt;&lt;h3 id="π-系列vla"&gt;&lt;a href="#%cf%80-%e7%b3%bb%e5%88%97vla" class="header-anchor"&gt;&lt;/a&gt;π 系列VLA：
&lt;/h3&gt;&lt;p&gt;Physical Intelligence 的 π 系列 VLA 模型。π0​，基于VLM+Action Expert架构，Flow matching结合流匹配技术，多步去噪生成aciton; π0.5​,混合任务训练，采用两种action token建模方式，通过层次化 VLM+VLA 架构提高了复杂任务泛化能力；π0.6*及后续​，引入强化学习与记忆，推动VLA模型具有自主规划能力的具身智能体（Agentic AI）演进。&lt;/p&gt;
&lt;h3 id="vlanext-vla-的关键设计空间"&gt;&lt;a href="#vlanext-vla-%e7%9a%84%e5%85%b3%e9%94%ae%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4" class="header-anchor"&gt;&lt;/a&gt;VLANeXT-VLA 的关键“设计空间”：
&lt;/h3&gt;&lt;p&gt;VLA 模型的执行效率源自深度独立的策略网络、多步动作分块、以及频域辅助损失对连续动作建模的优化；最佳配方摒弃了降低性能的历史时序输入，专注于多视角感知和连续动作流预测。&lt;/p&gt;
&lt;h3 id="智驾与具身vla"&gt;&lt;a href="#%e6%99%ba%e9%a9%be%e4%b8%8e%e5%85%b7%e8%ba%abvla" class="header-anchor"&gt;&lt;/a&gt;智驾与具身VLA：
&lt;/h3&gt;&lt;p&gt;两者皆是 Physical AI的应用，模型设计上具有极高的技术重合度。讨论 VLA是否必须？VLA还是WAM两者技术路线？&lt;/p&gt;
&lt;h2 id="更多细节"&gt;&lt;a href="#%e6%9b%b4%e5%a4%9a%e7%bb%86%e8%8a%82" class="header-anchor"&gt;&lt;/a&gt;更多细节
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.pi.website/" target="_blank" rel="noopener"
&gt;Physical Intelligence (π)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/2025605094205309303" target="_blank" rel="noopener"
&gt;VLANeXT分析&lt;/a&gt;)&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/1985783547974398799" target="_blank" rel="noopener"
&gt;Nividia Alpamayo-R1&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/2022348542585390814" target="_blank" rel="noopener"
&gt;理想汽车MindVLA-o1分享&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2510.26125" target="_blank" rel="noopener"
&gt;WOD-E2E&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://waymo.com/open/challenges/2025/e2e-driving/" target="_blank" rel="noopener"
&gt;E2E-Driving Chanllenges&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2601.16163" target="_blank" rel="noopener"
&gt;Cosmos Policy&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on VITA</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/</link><pubDate>Tue, 13 Aug 2024 14:36:45 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/</guid><description>&lt;h1 id="tldr"&gt;&lt;a href="#tldr" class="header-anchor"&gt;&lt;/a&gt;TLDR
&lt;/h1&gt;&lt;p&gt;This paper proposes a Multimodal Large Language Model VITA (Video, Image, Text, Audio).
VITA supports non-awakening interaction and audio interruption for better interactive experience.
VITA aims to be an open-sourced version of GPT-4o.&lt;/p&gt;
&lt;h1 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h1&gt;&lt;p&gt;Features of GPT-4o:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;a unified framework that processes text, vision, and audio signals in an end-to-end manner,&lt;/li&gt;
&lt;li&gt;the capability to enable natural multimodal human-computer interaction.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Similar to Mini-GPT4, this paper tries to proposed an open-sourced version of GPT-4o.&lt;/p&gt;
&lt;h1 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h1&gt;&lt;h2 id="model"&gt;&lt;a href="#model" class="header-anchor"&gt;&lt;/a&gt;Model
&lt;/h2&gt;&lt;p&gt;The architecture of VITA is shown as follows:
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_architecture.png"
width="1282"
height="1069"
loading="lazy"
alt="Architecture of VITA"
class="gallery-image"
data-flex-grow="119"
data-flex-basis="287px"
&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLM: Mixtral $8\times 7$ B&lt;/li&gt;
&lt;li&gt;Visual Encoder: InternViT-300M-448px&lt;/li&gt;
&lt;li&gt;Audio Encoder: Mel Filter Bank block&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;To support audio interruption, the author uses two model at the same time, where the generation model is responsible for handling user queries and the other model monitors the environment. The other models starts to work is there is an audio interruption.&lt;/p&gt;
&lt;h2 id="data"&gt;&lt;a href="#data" class="header-anchor"&gt;&lt;/a&gt;Data
&lt;/h2&gt;&lt;h3 id="multimodal-instruction-tuning"&gt;&lt;a href="#multimodal-instruction-tuning" class="header-anchor"&gt;&lt;/a&gt;multimodal instruction tuning
&lt;/h3&gt;&lt;p&gt;Training data of multimodal instruction tuning is given as follows:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_SFT_data.png"
width="1286"
height="672"
loading="lazy"
alt="Training data of multimodal instruction tuning"
class="gallery-image"
data-flex-grow="191"
data-flex-basis="459px"
&gt;&lt;/p&gt;
&lt;p&gt;Improvements are made:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;The questions are randomly (about half) replaced with their audio versions, using TTS technique such as GPT-SoVITS&lt;/li&gt;
&lt;li&gt;Different system prompts are set to avoid conflicts between different types of data&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;To support human-AI interaction, the noisy audio data are also constructed. Noisy audio samples are generated from existed QA data. These negative sample texts aim to improve the ability of VITA to not respond to non-query-related content.&lt;/p&gt;
&lt;p&gt;To distinguish three types of queries, the author uses three state tokens:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;1&amp;gt;&lt;/code&gt; denotes that the question input is the query audio&lt;/li&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;2&amp;gt;&lt;/code&gt; denotes that the question input is the noisy audio.&lt;/li&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;3&amp;gt;&lt;/code&gt; signifies the question of pure text.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="training-pipeline"&gt;&lt;a href="#training-pipeline" class="header-anchor"&gt;&lt;/a&gt;Training pipeline
&lt;/h2&gt;&lt;p&gt;Training pipeline of VITA consists of three stages:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_training_pipeline.png"
width="1301"
height="852"
loading="lazy"
alt="Training pipeline of VITA"
class="gallery-image"
data-flex-grow="152"
data-flex-basis="366px"
&gt;&lt;/p&gt;
&lt;h3 id="non-awakening-interaction"&gt;&lt;a href="#non-awakening-interaction" class="header-anchor"&gt;&lt;/a&gt;Non-awakening Interaction
&lt;/h3&gt;&lt;p&gt;There are following requirements and solutions:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Real-time Tracking of Environmental Sounds. This paper uses SileroVAD to complete the Voice Activity Detection (VAD) task.&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Filtering out noisy audio. This is done by making use of token &lt;code&gt;&amp;lt;2&amp;gt;&lt;/code&gt;.&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="audio-interrupt-interaction"&gt;&lt;a href="#audio-interrupt-interaction" class="header-anchor"&gt;&lt;/a&gt;Audio Interrupt Interaction
&lt;/h3&gt;&lt;p&gt;There are following requirements and solutions:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Real-time Tracking and Filtering of External Queries. This is done by use another VITA model as stated in Model section.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="evaluation"&gt;&lt;a href="#evaluation" class="header-anchor"&gt;&lt;/a&gt;Evaluation
&lt;/h1&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_evaluation.png"
width="1297"
height="536"
loading="lazy"
alt="Evaluation on image and video understanding"
class="gallery-image"
data-flex-grow="241"
data-flex-basis="580px"
&gt;&lt;/p&gt;
&lt;h1 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h1&gt;&lt;p&gt;The paper points out three limitations of VITA:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Enhancement of Foundational Capabilities.&lt;/li&gt;
&lt;li&gt;Refinement of Noisy Audio Construction.&lt;/li&gt;
&lt;li&gt;Building end-to-end TTS in conjunction with LLM.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.05211" target="_blank" rel="noopener"
&gt;Arxiv paper&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://vita-home.github.io" target="_blank" rel="noopener"
&gt;Github&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>MiniGPT-4-Enhancing Vision-Language Understanding with Advanced Large Language Models</title><link>https://jiangyigithub.github.io/ai.github.io/p/minigpt-4-enhancing-vision-language-understanding-with-advanced-large-language-models/</link><pubDate>Thu, 02 May 2024 13:13:12 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/minigpt-4-enhancing-vision-language-understanding-with-advanced-large-language-models/</guid><description>&lt;h1 id="tldr"&gt;&lt;a href="#tldr" class="header-anchor"&gt;&lt;/a&gt;TLDR
&lt;/h1&gt;&lt;p&gt;This paper proposed an open-sourced, GPT-4 liked multimodal language model (MLLM), mini-GPT4, aiming to provide inspiration of how to build an MLLM.&lt;/p&gt;
&lt;h1 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h1&gt;&lt;p&gt;GPT-4 has exhibited remarkable vision language abilities, however, due to it is not open sourced, it is hard to explore the construction and how the GPT-4 is trained.&lt;/p&gt;
&lt;p&gt;To solve this problem, this paper builds mini-GPT4, which utilizes an advanced LLM, Vicuna and BLIP-2, to build an open sourced MLLM. The result show that mini-GPT4 possesses numerous capabilities similar to those demostrated by GPT-4.&lt;/p&gt;
&lt;h1 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h1&gt;&lt;p&gt;The architecture of mini-GPT4 is shown as follows:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/minigpt-4-enhancing-vision-language-understanding-with-advanced-large-language-models/mini-gpt4-architecture.png"
width="907"
height="600"
loading="lazy"
alt="mini-GPT4 architecture"
class="gallery-image"
data-flex-grow="151"
data-flex-basis="362px"
&gt;&lt;/p&gt;
&lt;p&gt;mini-GPT4 consists of three parts:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Vision Encoder same as used in BLIP-2, which is built upon a ViT backbone and a Q-former network.&lt;/li&gt;
&lt;li&gt;A single projection layer, which aligns the encoded visual features with the Vicuna language model.&lt;/li&gt;
&lt;li&gt;Language decoder: Vicuna.&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="training"&gt;&lt;a href="#training" class="header-anchor"&gt;&lt;/a&gt;Training
&lt;/h2&gt;&lt;p&gt;mini-GPT4 only trains the linear projection layer, this includes two stages:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;First pre-training stage: in this stage, the language decoder and vision encoder are remain frozen, only the linear projection layer is trained. The training dataset contains Conceptual Caption, SBU and LAION. The problem is that the output may be incoherent like repetitive words or sentences.&lt;/li&gt;
&lt;li&gt;Fine-tune dataset generation: the pre-trained mini-GPT4 is used to generate image-text pair as fine-tune data, to improve the text quality, the generated text is polished with the help of ChatGPT. Finally, the dataset is manually refined.&lt;/li&gt;
&lt;li&gt;Second-stage fine-tuning: Fine-tune the mini-GPT-4 with the high quality fine-tune data.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/Vision-CAIR/MiniGPT-4/tree/main" target="_blank" rel="noopener"
&gt;Github&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://openreview.net/forum?id=1tZbq88f27" target="_blank" rel="noopener"
&gt;Paper&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://minigpt-4.github.io/" target="_blank" rel="noopener"
&gt;Homepage&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>