<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Llama on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/llama/</link><description>Recent content in Llama on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Wed, 08 Apr 2026 21:44:44 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/llama/index.xml" rel="self" type="application/rss+xml"/><item><title>Notes on LLaMA4 blog</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-llama4-blog/</link><pubDate>Wed, 30 Apr 2025 10:44:19 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-llama4-blog/</guid><description>&lt;h1 id="介绍"&gt;&lt;a href="#%e4%bb%8b%e7%bb%8d" class="header-anchor"&gt;&lt;/a&gt;介绍
&lt;/h1&gt;&lt;p&gt;Meta在2025年4月10号发布了LLaMA4系列，包含三个模型：Llama 4 Scout, Llama 4 Maverick 以及Llama 4 Behemoth, 三个模型都基于MoE架构，且支持多模态&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Layers&lt;/th&gt;
&lt;th&gt;Heads (Q / KV)&lt;/th&gt;
&lt;th&gt;Context Length&lt;/th&gt;
&lt;th&gt;#Parameters (activated/total)&lt;/th&gt;
&lt;th&gt;#Experts (activated/total)&lt;/th&gt;
&lt;th&gt;#Tokens&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;LLaMA 4 Behemoth&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;288B / 2T&lt;/td&gt;
&lt;td&gt;(1 shared + 1 routed) / 16&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LLaMA 4 Maverick&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;td&gt;40/8&lt;/td&gt;
&lt;td&gt;1M&lt;/td&gt;
&lt;td&gt;17B / 109B&lt;/td&gt;
&lt;td&gt;(1 shared + 1 routed) / 128&lt;/td&gt;
&lt;td&gt;~22T&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LLaMA 4 Scout&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;td&gt;40/8&lt;/td&gt;
&lt;td&gt;10M&lt;/td&gt;
&lt;td&gt;17B / 400B&lt;/td&gt;
&lt;td&gt;(1 shared + 1 routed) / 16&lt;/td&gt;
&lt;td&gt;~40T&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;训练数据截止到2024年8月。LLaMa4支持200多种语言，其中100多种语言的训练token数超过了1B&lt;/p&gt;
&lt;h1 id="亮点"&gt;&lt;a href="#%e4%ba%ae%e7%82%b9" class="header-anchor"&gt;&lt;/a&gt;亮点
&lt;/h1&gt;&lt;ol&gt;
&lt;li&gt;原生多模态
LLaMA 4是一个原生多模态架构&lt;/li&gt;
&lt;li&gt;超长上下文
LLaMA 4的上下文超过了1M&lt;/li&gt;
&lt;li&gt;iRoPE
通过交替dense和MoE MLP来提高整体推理效率&lt;/li&gt;
&lt;li&gt;基于MetaCLIP的vision encoder&lt;/li&gt;
&lt;li&gt;MetaP
使用MetaP来调整超参数&lt;/li&gt;
&lt;li&gt;FP8精度训练&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="pre-training"&gt;&lt;a href="#pre-training" class="header-anchor"&gt;&lt;/a&gt;Pre-training
&lt;/h1&gt;&lt;p&gt;LLaMA 4 仍然是一个基于transformer的架构，但是引入了MoE，其示意图如下所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-llama4-blog/architecture.png"
width="1920"
height="1308"
loading="lazy"
alt="architecture of LLaMA 4"
class="gallery-image"
data-flex-grow="146"
data-flex-basis="352px"
&gt;&lt;/p&gt;
&lt;p&gt;MoE架构中包含1个shared expert以及1个routed expert. 并且，与其他LLM不同，LLaMA 4使用了一个交替MLP个MoE的架构，即iRoPE，即特定的transformer layer是MoE架构，其余的是MLP架构，其&lt;a class="link" href="https://github.com/huggingface/transformers/blob/5f8d17268ced2ca5f51b0216782356b16be0d6f4/src/transformers/models/llama4/modeling_llama4.py#L380" target="_blank" rel="noopener"
&gt;核心代码&lt;/a&gt;如下：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;is_moe_layer&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;layer_idx&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;moe_layers&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;is_moe_layer&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="c1"&gt;# the 128E model interleaves dense / sparse&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;feed_forward&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;Llama4TextMoe&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;else&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;feed_forward&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;Llama4TextMLP&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;intermediate_size&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;intermediate_size_mlp&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;early fusion. LLaMA 4称其一个原生多模态大模型，但是其架构仍然是 Vision Encoder-MLP-LLM 的形式，其不同点在于patch embedding没有使用convolution, 而是使用 &lt;code&gt;nn.Unfold&lt;/code&gt;直接进行展平，然后使用一个线性层与vision encoder进行对齐。&lt;a class="link" href="https://github.com/huggingface/transformers/blob/5f8d17268ced2ca5f51b0216782356b16be0d6f4/src/transformers/models/llama4/modeling_llama4.py#L1409" target="_blank" rel="noopener"
&gt;代码&lt;/a&gt;如下&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;span class="lnt"&gt;12
&lt;/span&gt;&lt;span class="lnt"&gt;13
&lt;/span&gt;&lt;span class="lnt"&gt;14
&lt;/span&gt;&lt;span class="lnt"&gt;15
&lt;/span&gt;&lt;span class="lnt"&gt;16
&lt;/span&gt;&lt;span class="lnt"&gt;17
&lt;/span&gt;&lt;span class="lnt"&gt;18
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;class&lt;/span&gt; &lt;span class="nc"&gt;Llama4UnfoldConvolution&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;nn&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;Module&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="fm"&gt;__init__&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nb"&gt;super&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="fm"&gt;__init__&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;kernel_size&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;patch_size&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nb"&gt;isinstance&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;int&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;kernel_size&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;unfold&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;torch&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;nn&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;Unfold&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;stride&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;patch_size&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;linear&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;nn&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;Linear&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;num_channels&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="n"&gt;kernel_size&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;config&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;hidden_size&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;bias&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;forward&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;hidden_states&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;torch&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;Tensor&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;-&amp;gt;&lt;/span&gt; &lt;span class="n"&gt;torch&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;Tensor&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;hidden_states&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;unfold&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;hidden_states&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;hidden_states&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;hidden_states&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;permute&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;2&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;hidden_states&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="bp"&gt;self&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;linear&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;hidden_states&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;hidden_states&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;其他训练优化技巧如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;MetaP：用于选择超参数&lt;/li&gt;
&lt;li&gt;FP8 precision：与 &lt;a class="link" href="https://maosong.website/p/notes-on-deepseek-v3/" target="_blank" rel="noopener"
&gt;DeepSeek-V3&lt;/a&gt; 一样，使用FP8精度进行训练&lt;/li&gt;
&lt;li&gt;mid-training：在预训练阶段之后，额外增加了一个训练阶段，来提高模型的长上下文等关键能力&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="post-training"&gt;&lt;a href="#post-training" class="header-anchor"&gt;&lt;/a&gt;Post-training
&lt;/h1&gt;&lt;p&gt;post-training包括三个阶段：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;SFT&lt;/li&gt;
&lt;li&gt;online RL&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://maosong.website/p/notes-on-dpo/" target="_blank" rel="noopener"
&gt;DPO&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;作者发现SFT和DPO会限制模型的探索能力，特别是在math, coding等domain。为了解决这个问题，作者使用LlaMA对问题进行难度分级，然后移除了50%的简单数据。&lt;/p&gt;
&lt;p&gt;在online RL阶段，作者设计了一个continuous online RL策略，让模型在训练和筛选问题两种模式之间进行切换，以平衡效率和准确率。&lt;/p&gt;
&lt;p&gt;DPO的目的是为了提升模型输出的质量&lt;/p&gt;
&lt;h1 id="评测"&gt;&lt;a href="#%e8%af%84%e6%b5%8b" class="header-anchor"&gt;&lt;/a&gt;评测
&lt;/h1&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;benchmark&lt;/th&gt;
&lt;th&gt;LLaMA 4 Maverick&lt;/th&gt;
&lt;th&gt;LLaMA 4 Maverick&lt;/th&gt;
&lt;th&gt;LLaMA 4 Scout&lt;/th&gt;
&lt;th&gt;Gemeni 2.0 Flash&lt;/th&gt;
&lt;th&gt;GPT-4o&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;MMMU&lt;/td&gt;
&lt;td&gt;76.1&lt;/td&gt;
&lt;td&gt;73.4&lt;/td&gt;
&lt;td&gt;69.4&lt;/td&gt;
&lt;td&gt;71.7&lt;/td&gt;
&lt;td&gt;69.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Math Vista&lt;/td&gt;
&lt;td&gt;73.7&lt;/td&gt;
&lt;td&gt;70.7&lt;/td&gt;
&lt;td&gt;73.1&lt;/td&gt;
&lt;td&gt;63.8&lt;/td&gt;
&lt;td&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ChartQA&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;90.0&lt;/td&gt;
&lt;td&gt;88.8&lt;/td&gt;
&lt;td&gt;88.3&lt;/td&gt;
&lt;td&gt;85.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DocVQA&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;94.4&lt;/td&gt;
&lt;td&gt;94.4&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;92.8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LiveCodeBench&lt;/td&gt;
&lt;td&gt;49.4&lt;/td&gt;
&lt;td&gt;43.4&lt;/td&gt;
&lt;td&gt;32.8&lt;/td&gt;
&lt;td&gt;34.5&lt;/td&gt;
&lt;td&gt;32.3&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MMLU Pro&lt;/td&gt;
&lt;td&gt;82.2&lt;/td&gt;
&lt;td&gt;80.5&lt;/td&gt;
&lt;td&gt;74.3&lt;/td&gt;
&lt;td&gt;77.6&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPQA Diamond&lt;/td&gt;
&lt;td&gt;73.7&lt;/td&gt;
&lt;td&gt;69.8&lt;/td&gt;
&lt;td&gt;57.2&lt;/td&gt;
&lt;td&gt;60.1&lt;/td&gt;
&lt;td&gt;53.6&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1 id="结论"&gt;&lt;a href="#%e7%bb%93%e8%ae%ba" class="header-anchor"&gt;&lt;/a&gt;结论
&lt;/h1&gt;&lt;p&gt;LLaMA 4 采用了MoE架构，是一个原生的多模态大模型系列。在架构上，与DeepSeek-MoE, aria和OLMoE不同，LLaMA4并没有增加expert granularity，&lt;a class="link" href="https://maosong.website/p/notes-on-olmoe/" target="_blank" rel="noopener"
&gt;OLMoE&lt;/a&gt;分析认为，增加granularity可以提高模型的flexibility，
下面总结了一下相关模型的参数&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Layers&lt;/th&gt;
&lt;th&gt;Heads (Q / KV)&lt;/th&gt;
&lt;th&gt;Context Length&lt;/th&gt;
&lt;th&gt;#Parameters (activated/total)&lt;/th&gt;
&lt;th&gt;#Experts (activated/total)&lt;/th&gt;
&lt;th&gt;#Tokens&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;DeepSeek-MoE(144.6B)&lt;/td&gt;
&lt;td&gt;62&lt;/td&gt;
&lt;td&gt;32/32&lt;/td&gt;
&lt;td&gt;2048&lt;/td&gt;
&lt;td&gt;22.2B/144.6B&lt;/td&gt;
&lt;td&gt;(1 shared + 7 routed)/64&lt;/td&gt;
&lt;td&gt;245B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSeek-V3&lt;/td&gt;
&lt;td&gt;61&lt;/td&gt;
&lt;td&gt;128(MLA)&lt;/td&gt;
&lt;td&gt;128K&lt;/td&gt;
&lt;td&gt;37B/671B&lt;/td&gt;
&lt;td&gt;(1 shared + 8 routed)/257&lt;/td&gt;
&lt;td&gt;14.8T&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Aria&lt;/td&gt;
&lt;td&gt;28&lt;/td&gt;
&lt;td&gt;20/20&lt;/td&gt;
&lt;td&gt;64K&lt;/td&gt;
&lt;td&gt;3.5B/24.9B&lt;/td&gt;
&lt;td&gt;(2 shared+ 6 routed)/66&lt;/td&gt;
&lt;td&gt;6.4T(text)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OLMoE&lt;/td&gt;
&lt;td&gt;16&lt;/td&gt;
&lt;td&gt;16/16&lt;/td&gt;
&lt;td&gt;4096&lt;/td&gt;
&lt;td&gt;1.3B/6.9B&lt;/td&gt;
&lt;td&gt;8/64&lt;/td&gt;
&lt;td&gt;5T&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LLaMA 4 Maverick&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;td&gt;40/8&lt;/td&gt;
&lt;td&gt;1M&lt;/td&gt;
&lt;td&gt;17B / 109B&lt;/td&gt;
&lt;td&gt;(1 shared + 1 routed) / 128&lt;/td&gt;
&lt;td&gt;~22T&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LLaMA 4 Scout&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;td&gt;40/8&lt;/td&gt;
&lt;td&gt;10M&lt;/td&gt;
&lt;td&gt;17B / 400B&lt;/td&gt;
&lt;td&gt;(1 shared + 1 routed) / 16&lt;/td&gt;
&lt;td&gt;~40T&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md" target="_blank" rel="noopener"
&gt;LLaMA 4 Model Card&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://ai.meta.com/blog/llama-4-multimodal-intelligence/" target="_blank" rel="noopener"
&gt;LLaMA 4 Blog&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notes on Llama3</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-llama3/</link><pubDate>Mon, 22 Apr 2024 16:22:19 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-llama3/</guid><description>&lt;p&gt;Meta released Llama3 at April 18, which is evaluated on several benchmarks and achieves the SOTA on open-sourced LLMs.&lt;/p&gt;
&lt;h1 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h1&gt;&lt;h2 id="instruct-model-performance"&gt;&lt;a href="#instruct-model-performance" class="header-anchor"&gt;&lt;/a&gt;Instruct model performance
&lt;/h2&gt;&lt;p&gt;The performance of Llama3 8B compared with Gemma and Mistral:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Llama3 8B&lt;/th&gt;
&lt;th&gt;Gemma 7B - It&lt;/th&gt;
&lt;th&gt;Mistral &amp;amp;B Instruct&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;MMLU&lt;/em&gt; (5 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68.4&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;53.3&lt;/td&gt;
&lt;td&gt;58.4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;GPQA&lt;/em&gt; (0 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;34.2&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;21.4&lt;/td&gt;
&lt;td&gt;26.3&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;HumanEval&lt;/em&gt; (0 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;62.2&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;30.5&lt;/td&gt;
&lt;td&gt;36.6&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;GSM-8K&lt;/em&gt; (8 shot, CoT)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;79.6&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;30.6&lt;/td&gt;
&lt;td&gt;39.9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;MATH&lt;/em&gt; (4 shot, CoT)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;30.0&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;12.2&lt;/td&gt;
&lt;td&gt;11.0&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;performance of Llama3 70B compared with Gemini Pro 1.5 and Claude Sonnet:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Llama3 70B&lt;/th&gt;
&lt;th&gt;Gemini Pro 1.5 (Published)&lt;/th&gt;
&lt;th&gt;Claude 3 Sonnet (Published)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;MMLU&lt;/em&gt; (5 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;82.0&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;81.9&lt;/td&gt;
&lt;td&gt;79.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;GPQA&lt;/em&gt; (0 shot)&lt;/td&gt;
&lt;td&gt;39.5&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;41.5&lt;/strong&gt; (CoT)&lt;/td&gt;
&lt;td&gt;38.5 (CoT)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;HumanEval&lt;/em&gt; (0 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;81.7&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;71.9&lt;/td&gt;
&lt;td&gt;73.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;GSM-8K&lt;/em&gt; (8 shot, CoT)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;93.0&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;91.7 (11 shot)&lt;/td&gt;
&lt;td&gt;92.3 (0 shot)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;MATH&lt;/em&gt; (4 shot, CoT)&lt;/td&gt;
&lt;td&gt;50.4&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;58.5&lt;/strong&gt; (Minerva prompt)&lt;/td&gt;
&lt;td&gt;40.5&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="pre-trained-model-performance"&gt;&lt;a href="#pre-trained-model-performance" class="header-anchor"&gt;&lt;/a&gt;Pre-trained model performance
&lt;/h2&gt;&lt;p&gt;The performance of Llama3 8B compared with Gemma and Mistral:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Llama3 8B&lt;/th&gt;
&lt;th&gt;Gemma 7B (Published)&lt;/th&gt;
&lt;th&gt;Gemma 7B (Measured)&lt;/th&gt;
&lt;th&gt;Mistral 7B (Published)&lt;/th&gt;
&lt;th&gt;Mistral 7B (Measured)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;MMLU&lt;/em&gt; (5 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;66.6&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;64.3&lt;/td&gt;
&lt;td&gt;64.4&lt;/td&gt;
&lt;td&gt;62.5&lt;/td&gt;
&lt;td&gt;63.9&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;AGIEval English&lt;/em&gt; (3-5 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;45.9&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;41.7&lt;/td&gt;
&lt;td&gt;44.9&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;44.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;BIG-Bench Hard&lt;/em&gt; (3 shot, CoT)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;61.1&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;55.1&lt;/td&gt;
&lt;td&gt;59.0&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;56.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;ARC-Challenge&lt;/em&gt; (25 shot)&lt;/td&gt;
&lt;td&gt;78.6&lt;/td&gt;
&lt;td&gt;53.2(0 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;79.1&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;78.1&lt;/td&gt;
&lt;td&gt;78.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;DROP&lt;/em&gt; (3 shot, F1)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;58.4&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;56.3&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;54.4&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;performance of Llama3 70B compared with Gemini Pro 1.5 and Claude Sonnet:&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Llama3 70B&lt;/th&gt;
&lt;th&gt;Gemini Pro 1.0 (Published)&lt;/th&gt;
&lt;th&gt;Mixtral 8 $\times$ 22B (Measured)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;MMLU&lt;/em&gt; (5-shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;79.5&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;71.8&lt;/td&gt;
&lt;td&gt;77.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;AGIEval English&lt;/em&gt; (3-5 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;63.0&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;61.2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;BIG-Bench Hard&lt;/em&gt; (3 shot, CoT)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;81.3&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;75.0&lt;/td&gt;
&lt;td&gt;79.2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;ARC-Challenge&lt;/em&gt; (25 shot)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;93.0&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;90.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;em&gt;DROP&lt;/em&gt; (3 shot, F1)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;79.7&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;74.1 (variable shot)&lt;/td&gt;
&lt;td&gt;77.6&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1 id="model-architecture"&gt;&lt;a href="#model-architecture" class="header-anchor"&gt;&lt;/a&gt;Model Architecture
&lt;/h1&gt;&lt;p&gt;Several improvements are made on Llama3 compared to llama2:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Llama3 uses a tokenizer with a vocabulary of 128K tokens.&lt;/li&gt;
&lt;li&gt;Llama3 adopts &lt;a class="link" href="https://maosong.website/p/notes-on-gqa/" target="_blank" rel="noopener"
&gt;grouped query attention (GQA)&lt;/a&gt; across both the 8B and 70B sizes.&lt;/li&gt;
&lt;li&gt;Llama3 uses to context window of size 8192 tokens&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="traning"&gt;&lt;a href="#traning" class="header-anchor"&gt;&lt;/a&gt;Traning
&lt;/h1&gt;&lt;p&gt;Llama3 uses 15T tokens for pre-training. Compares to Llama2, it is seven times larger and includes four times more code.&lt;/p&gt;
&lt;p&gt;5% data of the training dataset are non-English to support multi-lingual use cases.&lt;/p&gt;
&lt;p&gt;Data processing includes:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Heuristic filters&lt;/li&gt;
&lt;li&gt;NSFW filters&lt;/li&gt;
&lt;li&gt;Semantic deduplication approaches&lt;/li&gt;
&lt;li&gt;Text classifiers to predict data quality. Llama2 is used to generate training data for the text classifiers.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Data mixing strategy is explored to improve the performance of Llama3.&lt;/p&gt;
&lt;h1 id="scaling-up-pretraining"&gt;&lt;a href="#scaling-up-pretraining" class="header-anchor"&gt;&lt;/a&gt;Scaling up pretraining
&lt;/h1&gt;&lt;p&gt;Llama3 developed a series of scaling laws for downstream benchmark evaluations.&lt;/p&gt;
&lt;p&gt;Scaling laws help:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Select an optimal data mix and to make informed decisions on how to best use training compute.&lt;/li&gt;
&lt;li&gt;Scaling laws allow Llama3 to predict the performance of the largest models on key tasks without training the models.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;The authors finds our that the performance of the model continues to improve log-linearly as the training tokens increase. It is seen that Larger models can match the performance of these smaller models with less training compute, but smaller models are generally preferred because they are much more efficient during inference.&lt;/p&gt;
&lt;p&gt;The authors combine three types of parallelization:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Data parallelization&lt;/li&gt;
&lt;li&gt;Model parallelization&lt;/li&gt;
&lt;li&gt;Pipeline parallelization&lt;/li&gt;
&lt;/ol&gt;
&lt;h1 id="instruction-fine-tuning"&gt;&lt;a href="#instruction-fine-tuning" class="header-anchor"&gt;&lt;/a&gt;Instruction fine-tuning
&lt;/h1&gt;&lt;p&gt;The fine-tuning of Llama3 contains:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Supervised fine-tuning&lt;/li&gt;
&lt;li&gt;Rejection sampling&lt;/li&gt;
&lt;li&gt;Proximal Policy Optimization&lt;/li&gt;
&lt;li&gt;Direct Preference Optimization&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Learning from perference rankings via PPO and &lt;a class="link" href="https://maosong.website/p/notes-on-dpo/" target="_blank" rel="noopener"
&gt;DPO&lt;/a&gt; also greatly improved the performance of LLma3 on reasoning and coding tasks. Since perference ranking helps the model to select answer when it is in a dilemma.&lt;/p&gt;
&lt;h1 id="reference"&gt;&lt;a href="#reference" class="header-anchor"&gt;&lt;/a&gt;Reference
&lt;/h1&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://ai.meta.com/blog/meta-llama-3/" target="_blank" rel="noopener"
&gt;Llam3 blog&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/meta-llama/llama3/blob/main/eval_details.md" target="_blank" rel="noopener"
&gt;Evaluation details&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://github.com/meta-llama/llama3/blob/main/MODEL_CARD.md" target="_blank" rel="noopener"
&gt;Model Card&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>