<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Audio on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/audio/</link><description>Recent content in Audio on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Sun, 12 Apr 2026 17:49:17 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/audio/index.xml" rel="self" type="application/rss+xml"/><item><title>物理AI-VLA分享</title><link>https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/</link><pubDate>Sat, 11 Apr 2026 14:36:45 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/</guid><description>&lt;h2 id="agenda"&gt;&lt;a href="#agenda" class="header-anchor"&gt;&lt;/a&gt;Agenda
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;1️⃣ 什么是 VLA？&lt;/li&gt;
&lt;li&gt;2️⃣ VLA 发展：以 π 系列做主线&lt;/li&gt;
&lt;li&gt;3️⃣ VLA模型的设计空间：分享VLANeXt 论文中的思考&lt;/li&gt;
&lt;li&gt;4️⃣ 智驾 vs 具身：共性与讨论&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="什么是-vla视觉-语言-动作模型"&gt;&lt;a href="#%e4%bb%80%e4%b9%88%e6%98%af-vla%e8%a7%86%e8%a7%89-%e8%af%ad%e8%a8%80-%e5%8a%a8%e4%bd%9c%e6%a8%a1%e5%9e%8b" class="header-anchor"&gt;&lt;/a&gt;什么是 VLA（视觉-语言-动作模型）？
&lt;/h2&gt;&lt;p&gt;VLA 代表 Vision-Language-Action（视觉-语言-动作）
VLA 的核心思想是利用多模态大模型（MLLM）的 world knowledge and reasoning capabilities，直接产生机器人的动作输出。&lt;/p&gt;
&lt;pre&gt;&lt;code&gt;输入： 机器人的摄像头图像（Vision）,机器人自身状态(Robot State)和人类的文字指令（Language）。
处理： 基于强大的多模态大模型（MLLM）去理解场景和指令。
输出： 直接生成控制机器人关节或末端执行器的低级动作指令（Action）。
&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;VLA 让机器人能够像人类一样，通过观察世界、听从指令，然后直接采取行动，打破了传统机器人需要复杂的手工编码和分层多子系统的限制。&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/vla1.jpg"
width="1810"
height="863"
loading="lazy"
alt="vla model arch"
class="gallery-image"
data-flex-grow="209"
data-flex-basis="503px"
&gt;&lt;/p&gt;
&lt;h2 id="vla的研究进展pi系列-以physical-intelligence-π为主线关注核心组织和人-"&gt;&lt;a href="#vla%e7%9a%84%e7%a0%94%e7%a9%b6%e8%bf%9b%e5%b1%95pi%e7%b3%bb%e5%88%97-%e4%bb%a5physical-intelligence-%cf%80%e4%b8%ba%e4%b8%bb%e7%ba%bf%e5%85%b3%e6%b3%a8%e6%a0%b8%e5%bf%83%e7%bb%84%e7%bb%87%e5%92%8c%e4%ba%ba-" class="header-anchor"&gt;&lt;/a&gt;VLA的研究进展(pi系列)-以Physical Intelligence (π)为主线(关注核心组织和人 ）
&lt;/h2&gt;&lt;h3 id="π系列发展历程和趋势"&gt;&lt;a href="#%cf%80%e7%b3%bb%e5%88%97%e5%8f%91%e5%b1%95%e5%8e%86%e7%a8%8b%e5%92%8c%e8%b6%8b%e5%8a%bf" class="header-anchor"&gt;&lt;/a&gt;π系列发展历程和趋势
&lt;/h3&gt;&lt;p&gt;&lt;a class="link" href="https://www.pi.website/blog" target="_blank" rel="noopener"
&gt;π&lt;/a&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;核心架构与技术特征&lt;/th&gt;
&lt;th&gt;关键突破点&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;π₀&lt;br&gt;2024-10&lt;/td&gt;
&lt;td&gt;MoT (Mixture of Transformer) + Flow Matching&lt;/td&gt;
&lt;td&gt;奠定了 VLA 多模态训练的基础，利用连续流匹配生成动作。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FAST&lt;br&gt;2025-01&lt;/td&gt;
&lt;td&gt;Efficient Action Tokenization&lt;/td&gt;
&lt;td&gt;引入离散动作标记，提升了实时的推理速度和执行效率。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π₀.₅&lt;br&gt;2025-04&lt;/td&gt;
&lt;td&gt;两者 action 建模结合&lt;br&gt;混合任务训练&lt;br&gt;层次化 VLM/VLA 架构&lt;/td&gt;
&lt;td&gt;结合连续与离散建模，通过混合任务训练应对复杂、长程任务。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π₀.₆* 及后续&lt;br&gt;2025-11&lt;/td&gt;
&lt;td&gt;RL + Memory + Agentic&lt;/td&gt;
&lt;td&gt;引入强化学习、长期记忆与自主决策能力，向机器人智能体迈进。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="总结physical-intelligence-π-vla的进展"&gt;&lt;a href="#%e6%80%bb%e7%bb%93physical-intelligence-%cf%80-vla%e7%9a%84%e8%bf%9b%e5%b1%95" class="header-anchor"&gt;&lt;/a&gt;总结Physical Intelligence (π) VLA的进展
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;阶段&lt;/th&gt;
&lt;th&gt;时间&lt;/th&gt;
&lt;th&gt;版本&lt;/th&gt;
&lt;th&gt;核心技术方向&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;π系列第一阶段&lt;/td&gt;
&lt;td&gt;2024-10 ~&lt;/td&gt;
&lt;td&gt;π₀ / π₀-FAST / π₀.₅&lt;/td&gt;
&lt;td&gt;Flow Matching、Efficient Action Tokenization、分层设计 VLM + VLA、混合任务训练&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;π系列第二阶段&lt;/td&gt;
&lt;td&gt;2025-11 ~&lt;/td&gt;
&lt;td&gt;π₀.₆* 及后续&lt;/td&gt;
&lt;td&gt;RL、Memory、Agentic&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="vla模型的设计空间vlanext"&gt;&lt;a href="#vla%e6%a8%a1%e5%9e%8b%e7%9a%84%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4vlanext" class="header-anchor"&gt;&lt;/a&gt;VLA模型的设计空间（VLANeXT）
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/pdf/2602.18532" target="_blank" rel="noopener"
&gt;VLANeXT&lt;/a&gt;&lt;/p&gt;
&lt;h3 id="设计vla模型需要思考的问题"&gt;&lt;a href="#%e8%ae%be%e8%ae%a1vla%e6%a8%a1%e5%9e%8b%e9%9c%80%e8%a6%81%e6%80%9d%e8%80%83%e7%9a%84%e9%97%ae%e9%a2%98" class="header-anchor"&gt;&lt;/a&gt;设计VLA模型需要思考的问题：
&lt;/h3&gt;&lt;ol&gt;
&lt;li&gt;action怎么生成，VLM直接输出还是额外action expert网络？&lt;/li&gt;
&lt;li&gt;action训练方法，Flow matching，VAE还是DDIM？&lt;/li&gt;
&lt;li&gt;VLM和action expert的怎么连接？&lt;/li&gt;
&lt;li&gt;propriocetion 自身状态输入给VLM还是action expert&lt;/li&gt;
&lt;li&gt;多相机数据怎么输入给VLA，相机标定的内外参信息怎么喂给模型？图像的时序信息怎么处理？&lt;/li&gt;
&lt;li&gt;是否引入额外任务构建更稠密的loss？如预测下一帧图像，还是引入额外输出头？
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/policy.png"
width="720"
height="336"
loading="lazy"
alt="policy"
class="gallery-image"
data-flex-grow="214"
data-flex-basis="514px"
&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="vlanext中探讨的vla设计空间"&gt;&lt;a href="#vlanext%e4%b8%ad%e6%8e%a2%e8%ae%a8%e7%9a%84vla%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4" class="header-anchor"&gt;&lt;/a&gt;VLANEXT中探讨的VLA设计空间
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设计维度&lt;/th&gt;
&lt;th&gt;决策组件 / 变量&lt;/th&gt;
&lt;th&gt;设计选项 (Design Options)&lt;/th&gt;
&lt;th&gt;实验结论摘要 (Ablation Insights)&lt;/th&gt;
&lt;th&gt;最佳配方 (Final Recipe)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;一、基础组件 (Foundational)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;1. 策略模块设计 (Policy Architecture)&lt;/td&gt;
&lt;td&gt;A. 复用文本Token&lt;br&gt;B. 独立策略头（浅层）&lt;br&gt;C. 深度策略网络（MetaQuery）&lt;/td&gt;
&lt;td&gt;浅层或复用架构无法充分解耦感知与动作；MetaQuery 风格能更好处理复杂动作。&lt;/td&gt;
&lt;td&gt;采用深度独立策略模块（16 query tokens + 12层 Transformer）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;2. 动作分块 (Action Chunking)&lt;/td&gt;
&lt;td&gt;A. 单步预测（size=1）&lt;br&gt;B. 多步预测（size=8）&lt;/td&gt;
&lt;td&gt;预测未来多步动作显著提高动作平滑性和任务成功率。&lt;/td&gt;
&lt;td&gt;预测多步动作（Chunk size = 8）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;3. 动作学习目标 (Action Objective)&lt;/td&gt;
&lt;td&gt;A. 离散分类（Binning / VQ-VAE）&lt;br&gt;B. 回归（Regression）&lt;br&gt;C. 扩散 / 流匹配（DDIM / Flow）&lt;/td&gt;
&lt;td&gt;离散化损失空间细节；连续建模（Flow Matching / 回归）表达力更强。&lt;/td&gt;
&lt;td&gt;使用连续动作建模（优先 Flow Matching 或回归）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;4. VLM骨干容量 (VLM Backbone)&lt;/td&gt;
&lt;td&gt;测试 LLaMA, PaliGemma, Qwen3-VL 等&lt;/td&gt;
&lt;td&gt;骨干模型表征能力是基础，容量越大通常性能越好（需平衡资源）。&lt;/td&gt;
&lt;td&gt;视算力选择最优开源骨干（如 Qwen3-VL）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;5. VLM-策略连接 (VLM-Policy Link)&lt;/td&gt;
&lt;td&gt;A. 松散连接（Loose）&lt;br&gt;B. 紧密连接（Tight）&lt;br&gt;C. 软连接（Soft，引入 Query buffer）&lt;/td&gt;
&lt;td&gt;软连接通过可学习 query 提供缓冲，适配性略优于紧密或松散耦合。&lt;/td&gt;
&lt;td&gt;软连接策略（Soft Connection）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;二、感知要素 (Perception)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;6. 时序历史 (Temporal History)&lt;/td&gt;
&lt;td&gt;A. 仅当前帧&lt;br&gt;B. 添加过去帧&lt;/td&gt;
&lt;td&gt;添加过去帧反而降低性能，可能引入冗余或干扰信息。&lt;/td&gt;
&lt;td&gt;避免冗余时序历史输入（专注当前帧）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;7. 相机视角 (Camera Views)&lt;/td&gt;
&lt;td&gt;A. 单视角&lt;br&gt;B. 多视角（第三人称 + 腕部）&lt;/td&gt;
&lt;td&gt;多视角提供更全面空间信息，显著提升空间感知与操作精度。&lt;/td&gt;
&lt;td&gt;多视角输入（第三人称 + 腕部相机）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;8. 本体感觉注入 (Proprioception)&lt;/td&gt;
&lt;td&gt;A. 无本体 state&lt;br&gt;B. VLM端注入&lt;br&gt;C. 策略端注入&lt;br&gt;D. 双端注入&lt;/td&gt;
&lt;td&gt;本体 state 对闭环控制至关重要；VLM端注入效果优于策略端。&lt;/td&gt;
&lt;td&gt;本体 state 条件于 VLM 端注入&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;三、动作建模 (Action Modeling)&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;9. 世界建模辅助 (World Modeling)&lt;/td&gt;
&lt;td&gt;引入未来帧预测目标（如 Emu3.5）&lt;/td&gt;
&lt;td&gt;性能有提升，但训练成本增加约3倍，性价比低。&lt;/td&gt;
&lt;td&gt;不纳入最终配方&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;10. 时序预测视角 (Time-Series Perspective)&lt;/td&gt;
&lt;td&gt;引入频域损失（DCT）&lt;/td&gt;
&lt;td&gt;将动作视为时序预测问题，引入频域损失可低成本提升动作质量。&lt;/td&gt;
&lt;td&gt;引入频域辅助损失（DCT）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/vlanext.png"
width="701"
height="551"
loading="lazy"
alt="vlanext"
class="gallery-image"
data-flex-grow="127"
data-flex-basis="305px"
&gt;&lt;/p&gt;
&lt;h2 id="应用场景-具身vs智驾"&gt;&lt;a href="#%e5%ba%94%e7%94%a8%e5%9c%ba%e6%99%af-%e5%85%b7%e8%ba%abvs%e6%99%ba%e9%a9%be" class="header-anchor"&gt;&lt;/a&gt;应用场景-具身VS智驾
&lt;/h2&gt;&lt;h3 id="具身和智驾领域vla论文对比技术趋同"&gt;&lt;a href="#%e5%85%b7%e8%ba%ab%e5%92%8c%e6%99%ba%e9%a9%be%e9%a2%86%e5%9f%9fvla%e8%ae%ba%e6%96%87%e5%af%b9%e6%af%94%e6%8a%80%e6%9c%af%e8%b6%8b%e5%90%8c" class="header-anchor"&gt;&lt;/a&gt;具身和智驾领域VLA论文对比&amp;ndash;&amp;gt;技术趋同
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;技术方向&lt;/th&gt;
&lt;th&gt;具身&lt;/th&gt;
&lt;th&gt;智驾&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;action token&lt;/td&gt;
&lt;td&gt;pi0-FAST、RT2、OpenVLA&lt;/td&gt;
&lt;td&gt;AutoVLA&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action expert（flow matching）&lt;/td&gt;
&lt;td&gt;pi0&lt;/td&gt;
&lt;td&gt;DriveMoE&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;action 建模两者结合 + 强化学习 RL&lt;/td&gt;
&lt;td&gt;pi0.5、pi0.6*&lt;/td&gt;
&lt;td&gt;Alpamaya&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;辅助 loss（3D 感知 / 世界模型 / 通才模型）&lt;/td&gt;
&lt;td&gt;蚂蚁 LingBot-VLA&lt;/td&gt;
&lt;td&gt;DriveVLA-W0 / EMMA&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="nvidia-alpamaya智驾vla"&gt;&lt;a href="#nvidia-alpamaya%e6%99%ba%e9%a9%bevla" class="header-anchor"&gt;&lt;/a&gt;Nvidia Alpamaya智驾VLA
&lt;/h3&gt;&lt;p&gt;Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail&lt;/p&gt;
&lt;h3 id="从waymo-end-to-end-driving-chanllenges看未来智驾的技术趋势"&gt;&lt;a href="#%e4%bb%8ewaymo-end-to-end-driving-chanllenges%e7%9c%8b%e6%9c%aa%e6%9d%a5%e6%99%ba%e9%a9%be%e7%9a%84%e6%8a%80%e6%9c%af%e8%b6%8b%e5%8a%bf" class="header-anchor"&gt;&lt;/a&gt;从Waymo End-to-End Driving Chanllenges看未来智驾的技术趋势
&lt;/h3&gt;&lt;p&gt;添加图片注释，不超过 140 字（可选）
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios(&lt;a class="link" href="https://arxiv.org/pdf/2510.26125%29-4.4" target="_blank" rel="noopener"
&gt;https://arxiv.org/pdf/2510.26125)-4.4&lt;/a&gt;. Discussion of the Results&lt;/p&gt;
&lt;p&gt;&lt;code&gt;1.MLLM-based Model (VLA)的好处？-&amp;gt;数据不易饱和&lt;/code&gt;&lt;br&gt;
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/q1.png"
width="372"
height="335"
loading="lazy"
alt="q1"
class="gallery-image"
data-flex-grow="111"
data-flex-basis="266px"
&gt;
&lt;code&gt;2.强化学习对E2E驾驶能力的提升？&lt;/code&gt;&lt;br&gt;
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/q3.png"
width="368"
height="257"
loading="lazy"
alt="q3"
class="gallery-image"
data-flex-grow="143"
data-flex-basis="343px"
&gt;&lt;/p&gt;
&lt;h2 id="open-discussion"&gt;&lt;a href="#open-discussion" class="header-anchor"&gt;&lt;/a&gt;open discussion
&lt;/h2&gt;&lt;h3 id="q1-智驾是否需要vla吗-"&gt;&lt;a href="#q1-%e6%99%ba%e9%a9%be%e6%98%af%e5%90%a6%e9%9c%80%e8%a6%81vla%e5%90%97-" class="header-anchor"&gt;&lt;/a&gt;Q1. 智驾是否需要VLA吗 ？
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;a.智驾特殊场景和长尾场景是否需要Language，是否是帮助提升泛化性?&lt;/li&gt;
&lt;li&gt;b.交互能力对于驾驶是否必须?驾驶需要需要遵循人类指令？&lt;/li&gt;
&lt;li&gt;c. 推理CoT对于智驾这类实时性高的场景是否必须？怎么trade-off?
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/%E7%89%A9%E7%90%86ai-vla%E5%88%86%E4%BA%AB/buslane.png"
width="720"
height="960"
loading="lazy"
alt="buslane"
class="gallery-image"
data-flex-grow="75"
data-flex-basis="180px"
&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="q2-vla-vs-wam"&gt;&lt;a href="#q2-vla-vs-wam" class="header-anchor"&gt;&lt;/a&gt;Q2. VLA vs WAM？
&lt;/h3&gt;&lt;p&gt;&lt;code&gt;VLA (Vision-Language-Action, 视觉-语言-动作模型)&lt;/code&gt;&lt;br&gt;
瓶颈： VLA 模型通常缺乏对物理世界的深刻理解（没有物理常识）。它只是学到了动作和图像之间的“统计映射”。&lt;/p&gt;
&lt;p&gt;&lt;code&gt;WAM (World Action Model, 世界动作模型)&lt;/code&gt;&lt;br&gt;
核心思想： WAM 是建立在 World Model (世界模型) 之上的动作模型。世界模型的核心能力是“预测未来”。它学习物理世界的运作规律（例如，物体掉落会向下，水杯翻了水会流出）。 当接收到指令和当前视觉时，WAM 不会直接生成动作。它首先利用其世界模型“想象”：如果我采取动作A，世界会变成什么样？采取动作B，世界又会变成什么样？通过在“想象”中模拟未来，WAM 可以选择最能达成目标的动作序列。
WAM 的优势： 具有物理常识，具有“预测”和“规划”能力。&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/pdf/2601.16163" target="_blank" rel="noopener"
&gt;cosmos policy&lt;/a&gt;
添加图片注释，不超过 140 字（可选）
添加图片注释，不超过 140 字（可选）&lt;/p&gt;
&lt;h3 id="q3-vla-是终局吗wam-是终局吗两者怎么融合"&gt;&lt;a href="#q3-vla-%e6%98%af%e7%bb%88%e5%b1%80%e5%90%97wam-%e6%98%af%e7%bb%88%e5%b1%80%e5%90%97%e4%b8%a4%e8%80%85%e6%80%8e%e4%b9%88%e8%9e%8d%e5%90%88" class="header-anchor"&gt;&lt;/a&gt;Q3. VLA 是终局吗？WAM 是终局吗？两者怎么融合？
&lt;/h3&gt;&lt;p&gt;添加图片注释，不超过 140 字（可选）&lt;/p&gt;
&lt;h2 id="总结"&gt;&lt;a href="#%e6%80%bb%e7%bb%93" class="header-anchor"&gt;&lt;/a&gt;总结
&lt;/h2&gt;&lt;h3 id="π-系列vla"&gt;&lt;a href="#%cf%80-%e7%b3%bb%e5%88%97vla" class="header-anchor"&gt;&lt;/a&gt;π 系列VLA：
&lt;/h3&gt;&lt;p&gt;Physical Intelligence 的 π 系列 VLA 模型。π0​，基于VLM+Action Expert架构，Flow matching结合流匹配技术，多步去噪生成aciton; π0.5​,混合任务训练，采用两种action token建模方式，通过层次化 VLM+VLA 架构提高了复杂任务泛化能力；π0.6*及后续​，引入强化学习与记忆，推动VLA模型具有自主规划能力的具身智能体（Agentic AI）演进。&lt;/p&gt;
&lt;h3 id="vlanext-vla-的关键设计空间"&gt;&lt;a href="#vlanext-vla-%e7%9a%84%e5%85%b3%e9%94%ae%e8%ae%be%e8%ae%a1%e7%a9%ba%e9%97%b4" class="header-anchor"&gt;&lt;/a&gt;VLANeXT-VLA 的关键“设计空间”：
&lt;/h3&gt;&lt;p&gt;VLA 模型的执行效率源自深度独立的策略网络、多步动作分块、以及频域辅助损失对连续动作建模的优化；最佳配方摒弃了降低性能的历史时序输入，专注于多视角感知和连续动作流预测。&lt;/p&gt;
&lt;h3 id="智驾与具身vla"&gt;&lt;a href="#%e6%99%ba%e9%a9%be%e4%b8%8e%e5%85%b7%e8%ba%abvla" class="header-anchor"&gt;&lt;/a&gt;智驾与具身VLA：
&lt;/h3&gt;&lt;p&gt;两者皆是 Physical AI的应用，模型设计上具有极高的技术重合度。讨论 VLA是否必须？VLA还是WAM两者技术路线？&lt;/p&gt;
&lt;h2 id="更多细节"&gt;&lt;a href="#%e6%9b%b4%e5%a4%9a%e7%bb%86%e8%8a%82" class="header-anchor"&gt;&lt;/a&gt;更多细节
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.pi.website/" target="_blank" rel="noopener"
&gt;Physical Intelligence (π)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/2025605094205309303" target="_blank" rel="noopener"
&gt;VLANeXT分析&lt;/a&gt;)&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/1985783547974398799" target="_blank" rel="noopener"
&gt;Nividia Alpamayo-R1&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://zhuanlan.zhihu.com/p/2022348542585390814" target="_blank" rel="noopener"
&gt;理想汽车MindVLA-o1分享&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2510.26125" target="_blank" rel="noopener"
&gt;WOD-E2E&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://waymo.com/open/challenges/2025/e2e-driving/" target="_blank" rel="noopener"
&gt;E2E-Driving Chanllenges&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2601.16163" target="_blank" rel="noopener"
&gt;Cosmos Policy&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on Qwen2.5 omni</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/</link><pubDate>Tue, 01 Apr 2025 10:29:00 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/</guid><description>&lt;h1 id="介绍"&gt;&lt;a href="#%e4%bb%8b%e7%bb%8d" class="header-anchor"&gt;&lt;/a&gt;介绍
&lt;/h1&gt;&lt;p&gt;2025年3月26号，Qwen团队发布了Qwen2.5 omni，Qwen2.5 omni是一个多模态模型，支持文本、音频、视频、图像等多个模态的输入，支持文本，音频的输出。
作者提出了TMRoPE来对齐不同的模态，然后还是用了Thinker-Talker的架构来同时生成文本和音频。
Thinker是一个大语言模型，Talker是一个dual-track自回归模型，Talker基于Thinker的hideen states来生成audio token，最后通过一个sliding-window DiT来解码audio token&lt;/p&gt;
&lt;p&gt;现有omni-model存在的问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;缺乏一个系统的，联合训练多个不同模态的方法&lt;/li&gt;
&lt;li&gt;需要处理不同模态输出时互相干扰的问题&lt;/li&gt;
&lt;li&gt;不能实时理解或者流式输出多模态信息&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Qwen2.5 omni的解决方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;使用TMRoPE来对齐不同的模态。作者将audio以及video frame按照时间顺序组织成一个交替的架构，然后使用TMRoPE来对齐&lt;/li&gt;
&lt;li&gt;使用Thinker-Talker的架构来同时生成文本和音频。Thinker负责文本输出，Talker负责音频的流式输出。&lt;/li&gt;
&lt;li&gt;在multimodal encoder中使用Block-wise streaming处理技巧来实现实时理解；在输出时，实现了一个dual-track自回归架构来生成audio token，以及一个DiT模型来解码audio token&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Qwen2.5 omni的贡献：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;提出了Qwen2.5-omni,可以实时理解多模态信息，并流式输出文本和音频&lt;/li&gt;
&lt;li&gt;提出了TMRoPE，一个可以对齐不同模态的RoPE算法&lt;/li&gt;
&lt;li&gt;提出了Thinker-Talker的架构，来完成实时理解和音频输出&lt;/li&gt;
&lt;li&gt;在多个benchmark上取得了SOTA&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="架构"&gt;&lt;a href="#%e6%9e%b6%e6%9e%84" class="header-anchor"&gt;&lt;/a&gt;架构
&lt;/h1&gt;&lt;h2 id="总览"&gt;&lt;a href="#%e6%80%bb%e8%a7%88" class="header-anchor"&gt;&lt;/a&gt;总览
&lt;/h2&gt;&lt;p&gt;Qwen2.5-omni的架构如下图所示
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/architecture.png"
width="1346"
height="1110"
loading="lazy"
alt="architecture of Qwen2.5-omni"
class="gallery-image"
data-flex-grow="121"
data-flex-basis="291px"
&gt;&lt;/p&gt;
&lt;p&gt;其中Talker类似于人的嘴，负责基于脑中的信息来生成对话；Thinker类似于人的大脑，负责理解输入的信息，并生成对话的上下文。&lt;/p&gt;
&lt;h2 id="输入"&gt;&lt;a href="#%e8%be%93%e5%85%a5" class="header-anchor"&gt;&lt;/a&gt;输入
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;text: Qwen的tokenizer&lt;/li&gt;
&lt;li&gt;audio： Qwen2-Audio的tokenizer&lt;/li&gt;
&lt;li&gt;vision： Qwen2.5-VL的vision tokenizer&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;视频以及TMRoPE。 对于视频来说，Qwen2.5-omni采取了和Qwen2.5-VL一样的MRoPE算法。只是这里的temporal ID对应40ms&lt;/p&gt;
&lt;p&gt;音频：对于音频来说，Qwen2.5-omni也是以40ms进行采样然后encoding。&lt;/p&gt;
&lt;p&gt;视频+音频：对于视频+音频来说，Qwen2.5-omni将视频和音频的token进行交替的排列，来保证时间上信息一致&lt;/p&gt;
&lt;h2 id="输出"&gt;&lt;a href="#%e8%be%93%e5%87%ba" class="header-anchor"&gt;&lt;/a&gt;输出
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Text：text由Thinker直接输出，这和LLM的输出方式是一样的。&lt;/li&gt;
&lt;li&gt;Speech：Qwen2.5-omni首先构建了&lt;code&gt;qwen-tts-tokenizer&lt;/code&gt;，一个speech codec，用于表示speech的关键信息。
然后基于这些关键信息，Talker通过自回归的方式生成audio tokens以及text tokens。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="流式输出"&gt;&lt;a href="#%e6%b5%81%e5%bc%8f%e8%be%93%e5%87%ba" class="header-anchor"&gt;&lt;/a&gt;流式输出
&lt;/h2&gt;&lt;p&gt;对于流式输出来说，现在的模型存在latency，具体影响因素如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;处理多模态输入的延迟&lt;/li&gt;
&lt;li&gt;TTFT （time to first token）&lt;/li&gt;
&lt;li&gt;将第一段speech token解码为audio的时间&lt;/li&gt;
&lt;li&gt;模型架构导致的latency，如模型参数等&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为了解决这个问题，Qwen2.5-omni采取了以下措施：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Support prefilling. 作者修改了audio以及vision encoder来在temporal dimension上支持block-wise attention.
具体来讲，audio encoder只关注2秒内的信息，而vision encoder和Qwen2.5-VL一样，使用了一个MLP patch merger来压缩视觉token&lt;/li&gt;
&lt;li&gt;Streaming Codec generation. 为了提高流式输出的效率，作者还是用了基于Flow-Matching的DiT，输出的code收线使用Flow-Matching转化为一个mel-spectrogram.
然后再通过一个BigVGAN来重建得到对应的waveform. 作者在这里修改了DiT的attention，将其receptive field 限制为4个block，包括lookback of 2 blocks以及lookahead of 1 block.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/DiT-sliding-window.png"
width="410"
height="433"
loading="lazy"
alt="Sliding Window DiT"
class="gallery-image"
data-flex-grow="94"
data-flex-basis="227px"
&gt;&lt;/p&gt;
&lt;h1 id="pre-training"&gt;&lt;a href="#pre-training" class="header-anchor"&gt;&lt;/a&gt;Pre Training
&lt;/h1&gt;&lt;p&gt;模型参数初始化：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLM： 从Qwen2.5进行初始化&lt;/li&gt;
&lt;li&gt;vision encoder：从Qwen2.5-VL的vision encoder进行初始化&lt;/li&gt;
&lt;li&gt;audio encoder：从Whisper-large-v3进行初始化&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Pretraining和Qwen2.5-VL的训练过程类似，分成了3个stage：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;冻结LLM的参数，仅训练vision encoder和audio encoder， 该阶段使用了audio-text以及image-text pairs来进行训练。 数据：image-text, video-text, video-audio, audio-text以及text corpus，
跟Qwen2-Audio类似，作者将hierarchical tags用自然语言prompt进行替换&lt;/li&gt;
&lt;li&gt;训练所有参数，使用更多的多模态数据进行训练。数据包括800B token的image和Video相关数据，300B token的audio数据，100B token的video-audio相关数据。&lt;/li&gt;
&lt;li&gt;将模型的上下文扩展到32K。前两个阶段的上下文长度为8192，本阶段使用了long video data等数据来将模型的上下文扩展到32K。&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="post-training"&gt;&lt;a href="#post-training" class="header-anchor"&gt;&lt;/a&gt;Post Training
&lt;/h1&gt;&lt;h2 id="thinker"&gt;&lt;a href="#thinker" class="header-anchor"&gt;&lt;/a&gt;Thinker
&lt;/h2&gt;&lt;p&gt;数据格式为ChatML，数据类型包括pure text-based dialogue data, visual-modality conversation data, audio-modality conversation data and mix-modality conversation data.&lt;/p&gt;
&lt;h2 id="talker"&gt;&lt;a href="#talker" class="header-anchor"&gt;&lt;/a&gt;Talker
&lt;/h2&gt;&lt;p&gt;包括三个阶段&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;ICL training: 训练Talker学习context continuation&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://maosong.website/p/notes-on-dpo/" target="_blank" rel="noopener"
&gt;DPO&lt;/a&gt; training: 提升speech generation的stability&lt;/li&gt;
&lt;li&gt;multi-speaker instruction fine-tuning: 提升模型的naturalness和controllability&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="evaluation"&gt;&lt;a href="#evaluation" class="header-anchor"&gt;&lt;/a&gt;Evaluation
&lt;/h1&gt;&lt;p&gt;Qwen2.5-omni在两类benchmark上进行来的评测，分别时多模态理解（X-&amp;gt;text）以及音频生成(X-&amp;gt; Speech)&lt;/p&gt;
&lt;p&gt;我们这里主要关注一下speech understanding以及speech generation的benchmark.&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/audio-to-text-performance.png"
width="1093"
height="1125"
loading="lazy"
alt="Audio-to-Text Performance"
class="gallery-image"
data-flex-grow="97"
data-flex-basis="233px"
&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/zero-shot-speech-generation.png"
width="904"
height="685"
loading="lazy"
alt="Speech Generation Performance"
class="gallery-image"
data-flex-grow="131"
data-flex-basis="316px"
&gt;&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen2.5-omni/single-speaker-speech-generation.png"
width="864"
height="513"
loading="lazy"
alt="single speaker speech generation"
class="gallery-image"
data-flex-grow="168"
data-flex-basis="404px"
&gt;&lt;/p&gt;
&lt;h1 id="总结"&gt;&lt;a href="#%e6%80%bb%e7%bb%93" class="header-anchor"&gt;&lt;/a&gt;总结
&lt;/h1&gt;&lt;p&gt;Qwen2.5-omni相当于是结合了Qwen2.5-VL以及Mini-omni，跟mini-omni2的输入输出是类似的。不同的点在于，Qwen2.5-omni使用了Thinker-Talker的架构，然后还使用了TMRoPE来对齐不同的模态。总的来说，感觉模型还是更偏重于audio的理解与生成。&lt;/p&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2503.20215" target="_blank" rel="noopener"
&gt;Qwen2.5-omni&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2408.16725" target="_blank" rel="noopener"
&gt;Mini-omni&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/pdf/2410.11190" target="_blank" rel="noopener"
&gt;Mini-omni2&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on VITA</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/</link><pubDate>Tue, 13 Aug 2024 14:36:45 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/</guid><description>&lt;h1 id="tldr"&gt;&lt;a href="#tldr" class="header-anchor"&gt;&lt;/a&gt;TLDR
&lt;/h1&gt;&lt;p&gt;This paper proposes a Multimodal Large Language Model VITA (Video, Image, Text, Audio).
VITA supports non-awakening interaction and audio interruption for better interactive experience.
VITA aims to be an open-sourced version of GPT-4o.&lt;/p&gt;
&lt;h1 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h1&gt;&lt;p&gt;Features of GPT-4o:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;a unified framework that processes text, vision, and audio signals in an end-to-end manner,&lt;/li&gt;
&lt;li&gt;the capability to enable natural multimodal human-computer interaction.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Similar to Mini-GPT4, this paper tries to proposed an open-sourced version of GPT-4o.&lt;/p&gt;
&lt;h1 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h1&gt;&lt;h2 id="model"&gt;&lt;a href="#model" class="header-anchor"&gt;&lt;/a&gt;Model
&lt;/h2&gt;&lt;p&gt;The architecture of VITA is shown as follows:
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_architecture.png"
width="1282"
height="1069"
loading="lazy"
alt="Architecture of VITA"
class="gallery-image"
data-flex-grow="119"
data-flex-basis="287px"
&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLM: Mixtral $8\times 7$ B&lt;/li&gt;
&lt;li&gt;Visual Encoder: InternViT-300M-448px&lt;/li&gt;
&lt;li&gt;Audio Encoder: Mel Filter Bank block&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;To support audio interruption, the author uses two model at the same time, where the generation model is responsible for handling user queries and the other model monitors the environment. The other models starts to work is there is an audio interruption.&lt;/p&gt;
&lt;h2 id="data"&gt;&lt;a href="#data" class="header-anchor"&gt;&lt;/a&gt;Data
&lt;/h2&gt;&lt;h3 id="multimodal-instruction-tuning"&gt;&lt;a href="#multimodal-instruction-tuning" class="header-anchor"&gt;&lt;/a&gt;multimodal instruction tuning
&lt;/h3&gt;&lt;p&gt;Training data of multimodal instruction tuning is given as follows:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_SFT_data.png"
width="1286"
height="672"
loading="lazy"
alt="Training data of multimodal instruction tuning"
class="gallery-image"
data-flex-grow="191"
data-flex-basis="459px"
&gt;&lt;/p&gt;
&lt;p&gt;Improvements are made:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;The questions are randomly (about half) replaced with their audio versions, using TTS technique such as GPT-SoVITS&lt;/li&gt;
&lt;li&gt;Different system prompts are set to avoid conflicts between different types of data&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;To support human-AI interaction, the noisy audio data are also constructed. Noisy audio samples are generated from existed QA data. These negative sample texts aim to improve the ability of VITA to not respond to non-query-related content.&lt;/p&gt;
&lt;p&gt;To distinguish three types of queries, the author uses three state tokens:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;1&amp;gt;&lt;/code&gt; denotes that the question input is the query audio&lt;/li&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;2&amp;gt;&lt;/code&gt; denotes that the question input is the noisy audio.&lt;/li&gt;
&lt;li&gt;Token &lt;code&gt;&amp;lt;3&amp;gt;&lt;/code&gt; signifies the question of pure text.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="training-pipeline"&gt;&lt;a href="#training-pipeline" class="header-anchor"&gt;&lt;/a&gt;Training pipeline
&lt;/h2&gt;&lt;p&gt;Training pipeline of VITA consists of three stages:&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_training_pipeline.png"
width="1301"
height="852"
loading="lazy"
alt="Training pipeline of VITA"
class="gallery-image"
data-flex-grow="152"
data-flex-basis="366px"
&gt;&lt;/p&gt;
&lt;h3 id="non-awakening-interaction"&gt;&lt;a href="#non-awakening-interaction" class="header-anchor"&gt;&lt;/a&gt;Non-awakening Interaction
&lt;/h3&gt;&lt;p&gt;There are following requirements and solutions:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Real-time Tracking of Environmental Sounds. This paper uses SileroVAD to complete the Voice Activity Detection (VAD) task.&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Filtering out noisy audio. This is done by making use of token &lt;code&gt;&amp;lt;2&amp;gt;&lt;/code&gt;.&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="audio-interrupt-interaction"&gt;&lt;a href="#audio-interrupt-interaction" class="header-anchor"&gt;&lt;/a&gt;Audio Interrupt Interaction
&lt;/h3&gt;&lt;p&gt;There are following requirements and solutions:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Real-time Tracking and Filtering of External Queries. This is done by use another VITA model as stated in Model section.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="evaluation"&gt;&lt;a href="#evaluation" class="header-anchor"&gt;&lt;/a&gt;Evaluation
&lt;/h1&gt;&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-vita/VITA_evaluation.png"
width="1297"
height="536"
loading="lazy"
alt="Evaluation on image and video understanding"
class="gallery-image"
data-flex-grow="241"
data-flex-basis="580px"
&gt;&lt;/p&gt;
&lt;h1 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h1&gt;&lt;p&gt;The paper points out three limitations of VITA:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Enhancement of Foundational Capabilities.&lt;/li&gt;
&lt;li&gt;Refinement of Noisy Audio Construction.&lt;/li&gt;
&lt;li&gt;Building end-to-end TTS in conjunction with LLM.&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.05211" target="_blank" rel="noopener"
&gt;Arxiv paper&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://vita-home.github.io" target="_blank" rel="noopener"
&gt;Github&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>