<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Data Selection on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/data-selection/</link><description>Recent content in Data Selection on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Wed, 08 Apr 2026 21:44:44 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/data-selection/index.xml" rel="self" type="application/rss+xml"/><item><title>Data mixture in MLLM</title><link>https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/</link><pubDate>Fri, 25 Apr 2025 10:25:48 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/</guid><description>&lt;h1 id="介绍"&gt;&lt;a href="#%e4%bb%8b%e7%bb%8d" class="header-anchor"&gt;&lt;/a&gt;介绍
&lt;/h1&gt;&lt;p&gt;简单总结一下已有的介绍了训练数据配比的多模态大模型，方便后续使用。
根据之前看的一些论文进行总结，如有缺漏，欢迎批评指正。&lt;/p&gt;
&lt;h1 id="相关工作"&gt;&lt;a href="#%e7%9b%b8%e5%85%b3%e5%b7%a5%e4%bd%9c" class="header-anchor"&gt;&lt;/a&gt;相关工作
&lt;/h1&gt;&lt;h2 id="llava"&gt;&lt;a href="#llava" class="header-anchor"&gt;&lt;/a&gt;LLaVA
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2310.03744" target="_blank" rel="noopener"
&gt;LLaVA 1.5&lt;/a&gt; SFT数据配比如下：&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/llava_v1_5_sft_mixture.png"
width="693"
height="569"
loading="lazy"
alt="LLaVA 1.5 SFT data mixture"
class="gallery-image"
data-flex-grow="121"
data-flex-basis="292px"
&gt;&lt;/p&gt;
&lt;h2 id="llava-onevision"&gt;&lt;a href="#llava-onevision" class="header-anchor"&gt;&lt;/a&gt;LLaVA-OneVision
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.03326" target="_blank" rel="noopener"
&gt;LLaVA OneVision&lt;/a&gt; 的数据集统计在表16里，这里总结一下数据配比(总量为3.15M)&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;Category&lt;/th&gt;
&lt;th style="text-align: right"&gt;Ratio&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;general vqa&lt;/td&gt;
&lt;td style="text-align: right"&gt;36.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Doc/Chart/Screen&lt;/td&gt;
&lt;td style="text-align: right"&gt;20.6&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Math/Reasoning&lt;/td&gt;
&lt;td style="text-align: right"&gt;20.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;general OCR&lt;/td&gt;
&lt;td style="text-align: right"&gt;8.9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;text only&lt;/td&gt;
&lt;td style="text-align: right"&gt;14.3&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="apollo"&gt;&lt;a href="#apollo" class="header-anchor"&gt;&lt;/a&gt;Apollo
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2412.10360" target="_blank" rel="noopener"
&gt;Apollo&lt;/a&gt; 是Meta发布的一个视频理解多模态大模型，其数据集没有开源，论文中给出了其训练数据配比
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/apollo.png"
width="1389"
height="589"
loading="lazy"
alt="apollo data mixture"
class="gallery-image"
data-flex-grow="235"
data-flex-basis="565px"
&gt;&lt;/p&gt;
&lt;h2 id="cambiran-1"&gt;&lt;a href="#cambiran-1" class="header-anchor"&gt;&lt;/a&gt;Cambiran-1
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2406.16860" target="_blank" rel="noopener"
&gt;Cambiran-1&lt;/a&gt; 是纽约大学提出了一个多模态大模型系列，论文发表在了 NeurIPS 2024(Oral) 上，作者给出了 Cambrain-10M 和 Cambrain-7M 两个数据集，Cambrain-7M 的数据分布如下&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/cambrain-7M.png"
width="1294"
height="513"
loading="lazy"
alt="Cambrain-7M"
class="gallery-image"
data-flex-grow="252"
data-flex-basis="605px"
&gt;&lt;/p&gt;
&lt;h2 id="idefics"&gt;&lt;a href="#idefics" class="header-anchor"&gt;&lt;/a&gt;Idefics
&lt;/h2&gt;&lt;p&gt;Idefics系列(1/2/3)是huggingface提出的视觉多模态大模型系列，在 &lt;a class="link" href="https://arxiv.org/abs/2405.02246" target="_blank" rel="noopener"
&gt;Idefics2&lt;/a&gt; 中，作者构建了The Cauldron数据集，其数据配比在表14里面。总结如下：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;Category&lt;/th&gt;
&lt;th style="text-align: right"&gt;Ratio&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;general vqa&lt;/td&gt;
&lt;td style="text-align: right"&gt;11.02&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;captioning&lt;/td&gt;
&lt;td style="text-align: right"&gt;5.14&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;OCR&lt;/td&gt;
&lt;td style="text-align: right"&gt;17.47&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;chart/figures&lt;/td&gt;
&lt;td style="text-align: right"&gt;14.05&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;table&lt;/td&gt;
&lt;td style="text-align: right"&gt;11.3&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;reasoning&lt;/td&gt;
&lt;td style="text-align: right"&gt;10.32&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;textbook&lt;/td&gt;
&lt;td style="text-align: right"&gt;1.58&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;difference&lt;/td&gt;
&lt;td style="text-align: right"&gt;2.38&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;screenshot2code&lt;/td&gt;
&lt;td style="text-align: right"&gt;0.31&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;text only&lt;/td&gt;
&lt;td style="text-align: right"&gt;26.41&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;在 &lt;a class="link" href="http://arxiv.org/abs/2408.12637" target="_blank" rel="noopener"
&gt;Idefics3&lt;/a&gt; 中，作者基于The Cauldron进行了扩展，最终数据集的比例如下：&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/mixture_the_cauldron.png"
width="3430"
height="886"
loading="lazy"
alt="data mixture of SmolVLM blog"
class="gallery-image"
data-flex-grow="387"
data-flex-basis="929px"
&gt;&lt;/p&gt;
&lt;h2 id="molmo"&gt;&lt;a href="#molmo" class="header-anchor"&gt;&lt;/a&gt;Molmo
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2409.17146" target="_blank" rel="noopener"
&gt;Molmo&lt;/a&gt; 是Allen AI发布的一个多模态大模型，其SFT数据配比如下&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/molmo_sft_data_mixture.png"
width="693"
height="785"
loading="lazy"
alt="SFT data mixture of Molmo"
class="gallery-image"
data-flex-grow="88"
data-flex-basis="211px"
&gt;&lt;/p&gt;
&lt;h2 id="eagle-225"&gt;&lt;a href="#eagle-225" class="header-anchor"&gt;&lt;/a&gt;Eagle 2/2.5
&lt;/h2&gt;&lt;p&gt;Eagle (1/2/2.5) 是NVLab提出了系列多模态大模型，&lt;a class="link" href="http://arxiv.org/abs/2501.14818" target="_blank" rel="noopener"
&gt;Eagle 2&lt;/a&gt; 给出了 stage 1.5 和 stage 2的数据配比&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/eagle2_data_mixture.png"
width="693"
height="400"
loading="lazy"
alt="Eagle 2 data mixture"
class="gallery-image"
data-flex-grow="173"
data-flex-basis="415px"
&gt;&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2504.15271" target="_blank" rel="noopener"
&gt;Eagle 2.5&lt;/a&gt; 在 Eagle 2的基础上加入了一些 long context 数据，其数据列表在表11里&lt;/p&gt;
&lt;h2 id="smolvlm"&gt;&lt;a href="#smolvlm" class="header-anchor"&gt;&lt;/a&gt;SmolVLM
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2504.05299" target="_blank" rel="noopener"
&gt;SmolVLM&lt;/a&gt; 是huggingface开发的一款轻量化视觉多模态大模型，论文中的数据配比如下：&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/smol_vlm_data_mixture.png"
width="1382"
height="560"
loading="lazy"
alt="data mixture of SmolVLM paper"
class="gallery-image"
data-flex-grow="246"
data-flex-basis="592px"
&gt;&lt;/p&gt;
&lt;h2 id="mm115"&gt;&lt;a href="#mm115" class="header-anchor"&gt;&lt;/a&gt;MM1/1.5
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2403.09611" target="_blank" rel="noopener"
&gt;MM1&lt;/a&gt; 通过实验确定了训练数据的配比：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;Category&lt;/th&gt;
&lt;th style="text-align: right"&gt;Ratio&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;interleaved image-text&lt;/td&gt;
&lt;td style="text-align: right"&gt;45&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;imagetext&lt;/td&gt;
&lt;td style="text-align: right"&gt;45&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;text only&lt;/td&gt;
&lt;td style="text-align: right"&gt;10&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2409.20566" target="_blank" rel="noopener"
&gt;MM1.5&lt;/a&gt; 的SFT数据配比如下：
&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/data-mixture-in-mllm/MM1_5_data_mixture.png"
width="1183"
height="845"
loading="lazy"
alt="MM1.5 SFT data mixture"
class="gallery-image"
data-flex-grow="140"
data-flex-basis="336px"
&gt;&lt;/p&gt;
&lt;h2 id="internvl"&gt;&lt;a href="#internvl" class="header-anchor"&gt;&lt;/a&gt;InternVL
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2412.05271" target="_blank" rel="noopener"
&gt;InternVL2.5&lt;/a&gt; 在论文里总结了其使用的pretraining数据和SFT数据，但是没有具体的数据配比，请参考论文的表4和表5&lt;/p&gt;
&lt;p&gt;SFT数据配比&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;Category&lt;/th&gt;
&lt;th style="text-align: left"&gt;Ratio&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;single-image&lt;/td&gt;
&lt;td style="text-align: left"&gt;45.92%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;multi-image&lt;/td&gt;
&lt;td style="text-align: left"&gt;9.37%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;video&lt;/td&gt;
&lt;td style="text-align: left"&gt;39.79%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;pure-text&lt;/td&gt;
&lt;td style="text-align: left"&gt;4.92%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="minicpm-v"&gt;&lt;a href="#minicpm-v" class="header-anchor"&gt;&lt;/a&gt;MiniCPM V
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.01800" target="_blank" rel="noopener"
&gt;MiniCPM V&lt;/a&gt; 是 OpenBMB发布的轻量化多模态大模型，其在表1和表2列出了ptraining和SFT数据的具体量级和类别。&lt;/p&gt;
&lt;h2 id="flash-vl"&gt;&lt;a href="#flash-vl" class="header-anchor"&gt;&lt;/a&gt;Flash-VL
&lt;/h2&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th style="text-align: left"&gt;Category&lt;/th&gt;
&lt;th style="text-align: right"&gt;Ratio&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Special Enhancement&lt;/td&gt;
&lt;td style="text-align: right"&gt;4%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Text&lt;/td&gt;
&lt;td style="text-align: right"&gt;21%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Caption&lt;/td&gt;
&lt;td style="text-align: right"&gt;4%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Chart&lt;/td&gt;
&lt;td style="text-align: right"&gt;16%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Math&lt;/td&gt;
&lt;td style="text-align: right"&gt;11%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;OCR&lt;/td&gt;
&lt;td style="text-align: right"&gt;3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;Code&lt;/td&gt;
&lt;td style="text-align: right"&gt;8%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style="text-align: left"&gt;General&lt;/td&gt;
&lt;td style="text-align: right"&gt;33%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;具体数据参见&lt;a class="link" href="http://arxiv.org/abs/2505.09498" target="_blank" rel="noopener"
&gt;原论文&lt;/a&gt;&lt;/p&gt;
&lt;h1 id="参考文献"&gt;&lt;a href="#%e5%8f%82%e8%80%83%e6%96%87%e7%8c%ae" class="header-anchor"&gt;&lt;/a&gt;参考文献
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2310.03744" target="_blank" rel="noopener"
&gt;LLaVA 1.5&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.03326" target="_blank" rel="noopener"
&gt;LLaVA OneVision&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2412.10360" target="_blank" rel="noopener"
&gt;Apollo&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2406.16860" target="_blank" rel="noopener"
&gt;Cambiran-1&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/2405.02246" target="_blank" rel="noopener"
&gt;Idefics2&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.12637" target="_blank" rel="noopener"
&gt;Idefics3&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2409.17146" target="_blank" rel="noopener"
&gt;Molmo&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2501.14818" target="_blank" rel="noopener"
&gt;Eagle 2&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2504.15271" target="_blank" rel="noopener"
&gt;Eagle 2.5&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2504.05299" target="_blank" rel="noopener"
&gt;SmolVLM&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2403.09611" target="_blank" rel="noopener"
&gt;MM1&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2409.20566" target="_blank" rel="noopener"
&gt;MM1.5&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2412.05271" target="_blank" rel="noopener"
&gt;InternVL2.5&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="http://arxiv.org/abs/2408.01800" target="_blank" rel="noopener"
&gt;MiniCPM V&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>