<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Linear Attention on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/linear-attention/</link><description>Recent content in Linear Attention on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Wed, 08 Apr 2026 21:44:44 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/linear-attention/index.xml" rel="self" type="application/rss+xml"/><item><title>Notes on Qwen3-Next</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen3-next/</link><pubDate>Fri, 23 Jan 2026 10:29:56 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen3-next/</guid><description>&lt;h2 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h2&gt;&lt;p&gt;当前大语言模型在性能与效率上面临双重挑战：纯 Softmax 注意力计算成本高，而纯线性注意力则性能不足。Qwen3-Next 尝试通过&lt;strong&gt;混合注意力机制&lt;/strong&gt;解决这一矛盾，同时结合 MoE 架构与多项训练优化策略，实现在保持高性能的同时大幅提升训练与推理效率。&lt;/p&gt;
&lt;p&gt;Qwen3-Next 包含三个模型：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Qwen3-Next-80B-A3B-Base&lt;/li&gt;
&lt;li&gt;Qwen3-Next-80B-A3B-Instruct&lt;/li&gt;
&lt;li&gt;Qwen3-Next-80B-A3B-Thinking&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="method"&gt;&lt;a href="#method" class="header-anchor"&gt;&lt;/a&gt;Method
&lt;/h2&gt;&lt;h3 id="architecture"&gt;&lt;a href="#architecture" class="header-anchor"&gt;&lt;/a&gt;Architecture
&lt;/h3&gt;&lt;p&gt;模型架构如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen3-next/Qwen3-Next-architecture.png"
width="2204"
height="2348"
loading="lazy"
alt="architecture of Qwen3-Next"
class="gallery-image"
data-flex-grow="93"
data-flex-basis="225px"
&gt;&lt;/p&gt;
&lt;h3 id="hybrid-attention"&gt;&lt;a href="#hybrid-attention" class="header-anchor"&gt;&lt;/a&gt;Hybrid Attention
&lt;/h3&gt;&lt;p&gt;作者首先总结了 linear attention 和 softmax attention 各自的优缺点。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;pros&lt;/th&gt;
&lt;th&gt;cons&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;linear attention&lt;/td&gt;
&lt;td&gt;fast&lt;/td&gt;
&lt;td&gt;low performance&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;softmax attention&lt;/td&gt;
&lt;td&gt;slow&lt;/td&gt;
&lt;td&gt;high performance&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;因此，作者的动机就是是结合 linear attention 与 softmax attention, 在局部利用 linear attention 的高效性来提高训练和推理效率，在关键部分使用 softmax attention 来提高模型的能力。 这种混合注意力机制之前也有很多模型采用，比如 &lt;a class="link" href="https://maosong.website/p/notes-on-minimax-01/" target="_blank" rel="noopener"
&gt;MiniMax-01&lt;/a&gt; 等。最终 Qwen3-Next 使用了 Gated DeltaNet+Gated Attention 的混合注意力机制，模型的 transformer layers 按照 4 个为一组，前三层使用 Gated DeltaNet, 第四层使用 Gated Attention.&lt;/p&gt;
&lt;p&gt;下面是一些细节：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Gated DeltaNet 相比于 &lt;a class="link" href="https://maosong.website/p/notes-on-rnope-swa/" target="_blank" rel="noopener"
&gt;SWA&lt;/a&gt; 和 Mamba2, 其 in-context learning 能力更强&lt;/li&gt;
&lt;li&gt;对于 softmax attention:
&lt;ol&gt;
&lt;li&gt;使用了 &lt;a class="link" href="https://maosong.website/p/notes-on-gated-attention/" target="_blank" rel="noopener"
&gt;Gated Attention&lt;/a&gt; 提出的 gating 机制来解决 massive activation 和 attention sink 问题&lt;/li&gt;
&lt;li&gt;将 attention head 的 dimension 从 128 提高到 256&lt;/li&gt;
&lt;li&gt;使用了和 &lt;a class="link" href="https://maosong.website/p/notes-on-deepseek-v3/" target="_blank" rel="noopener"
&gt;DeepSeek-V3&lt;/a&gt; 类似的 partial RoPE 机制，仅对前 $25\%$ 的元素进行旋转&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="moe"&gt;&lt;a href="#moe" class="header-anchor"&gt;&lt;/a&gt;MoE
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;1 个共享专家，512 个路由专家，其中激活专家个数为 10 个。&lt;/li&gt;
&lt;li&gt;对于 MoE router 的参数，作者还进行了 normalization 来保证每个专家被选择的概率相同。&lt;/li&gt;
&lt;li&gt;与 &lt;a class="link" href="https://maosong.website/p/notes-on-qwen3/" target="_blank" rel="noopener"
&gt;Qwen3&lt;/a&gt; 一致，Qwen3-Next 也是用了 &lt;a class="link" href="https://maosong.website/p/notes-on-global-batch-load-balancing/" target="_blank" rel="noopener"
&gt;Global-batch load balancing&lt;/a&gt; 策略，在保持激活专家数不变的情况下，通过提高总专家个数来降低训练损失。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="normalization-and-training"&gt;&lt;a href="#normalization-and-training" class="header-anchor"&gt;&lt;/a&gt;Normalization and Training
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;使用 Gemma 提出的 Zero-Centered RMSNorm 以及 weight decay 来避免过大的权重出现&lt;/li&gt;
&lt;li&gt;为了提高数据使用效率，作者还使用了 MTP 策略来提高训练效率，模型表现以及 Speculative decoding 的接受率。&lt;/li&gt;
&lt;li&gt;预训练时，Qwen3-Next 使用了&lt;strong&gt;15T&lt;/strong&gt; token 进行训练，训练时间相比于 Qwen3-30B-A3B 有了大幅度的提升&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="experiments"&gt;&lt;a href="#experiments" class="header-anchor"&gt;&lt;/a&gt;Experiments
&lt;/h2&gt;&lt;h3 id="efficiency"&gt;&lt;a href="#efficiency" class="header-anchor"&gt;&lt;/a&gt;Efficiency
&lt;/h3&gt;&lt;p&gt;下图是 Qwen3-Next 与 Qwen3-32B 模型的训练效率对比&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen3-next/Qwen3-Next-pre-training-efficiency.png"
width="2860"
height="1114"
loading="lazy"
alt="Pre-training efficiency of Qwen3-Next"
class="gallery-image"
data-flex-grow="256"
data-flex-basis="616px"
&gt;&lt;/p&gt;
&lt;p&gt;从结果可以看出，相比于 Qwen3-32B, Qwen3-Next 只用了 $9.3\%$ 的算力就达到了更强的表现。&lt;/p&gt;
&lt;p&gt;并且，在 inference 阶段，由于使用了 linear attention, Qwen3-Next 的效率也更高，下面是 Qwen3-Next 相比于 Qwen3-32B 的效率提升&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;4K&lt;/th&gt;
&lt;th&gt;32K&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Prefilling&lt;/td&gt;
&lt;td&gt;$7\times$&lt;/td&gt;
&lt;td&gt;$10\times$&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decoding&lt;/td&gt;
&lt;td&gt;$4\times$&lt;/td&gt;
&lt;td&gt;$10\times$&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="performance"&gt;&lt;a href="#performance" class="header-anchor"&gt;&lt;/a&gt;Performance
&lt;/h3&gt;&lt;p&gt;下面是 Qwen3-Next-Base 的表现&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-qwen3-next/Qwen3-Next-base-performance.png"
width="1288"
height="844"
loading="lazy"
alt="Performance of Qwen3-Next-Base"
class="gallery-image"
data-flex-grow="152"
data-flex-basis="366px"
&gt;&lt;/p&gt;
&lt;p&gt;可以看到，Qwen3-Next-Base 在多个 Benchmark 上的表现仅次于 Qwen3-235B-A22B&lt;/p&gt;
&lt;p&gt;Qwen3-Next-Instruct 的表现如下表所示&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;Qwen3-Next-80B-A3B-Instruct&lt;/th&gt;
&lt;th&gt;Qwen3-235B-A22B-Instruct-2507&lt;/th&gt;
&lt;th&gt;Qwen3-32B Non-thinking&lt;/th&gt;
&lt;th&gt;Qwen3-30B-A3B-Instruct-2507&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;SuperGPQA&lt;/td&gt;
&lt;td&gt;58.8&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;62.6&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;43.2&lt;/td&gt;
&lt;td&gt;53.4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;AIME25&lt;/td&gt;
&lt;td&gt;69.5&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;70.3&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;20.2&lt;/td&gt;
&lt;td&gt;61.3&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LiveCodeBench v6&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;56.6&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;51.8&lt;/td&gt;
&lt;td&gt;29.1&lt;/td&gt;
&lt;td&gt;43.2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Arena-Hard v2&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;82.7&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;79.2&lt;/td&gt;
&lt;td&gt;34.1&lt;/td&gt;
&lt;td&gt;69.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LiveBench&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;75.8&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;75.4&lt;/td&gt;
&lt;td&gt;59.8&lt;/td&gt;
&lt;td&gt;69.0&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3-Next-Instruct 的长文本表现（RULER Benchmark）如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Avg.&lt;/th&gt;
&lt;th&gt;4K&lt;/th&gt;
&lt;th&gt;8K&lt;/th&gt;
&lt;th&gt;16K&lt;/th&gt;
&lt;th&gt;32K&lt;/th&gt;
&lt;th&gt;64K&lt;/th&gt;
&lt;th&gt;96k&lt;/th&gt;
&lt;th&gt;128K&lt;/th&gt;
&lt;th&gt;192k&lt;/th&gt;
&lt;th&gt;256k&lt;/th&gt;
&lt;th&gt;384k&lt;/th&gt;
&lt;th&gt;512k&lt;/th&gt;
&lt;th&gt;640k&lt;/th&gt;
&lt;th&gt;768k&lt;/th&gt;
&lt;th&gt;896k&lt;/th&gt;
&lt;th&gt;1M&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Qwen3-30B-A3B-Instruct-2507&lt;/td&gt;
&lt;td&gt;86.8&lt;/td&gt;
&lt;td&gt;98.0&lt;/td&gt;
&lt;td&gt;96.7&lt;/td&gt;
&lt;td&gt;96.9&lt;/td&gt;
&lt;td&gt;97.2&lt;/td&gt;
&lt;td&gt;93.4&lt;/td&gt;
&lt;td&gt;91.0&lt;/td&gt;
&lt;td&gt;89.1&lt;/td&gt;
&lt;td&gt;89.8&lt;/td&gt;
&lt;td&gt;82.5&lt;/td&gt;
&lt;td&gt;83.6&lt;/td&gt;
&lt;td&gt;78.4&lt;/td&gt;
&lt;td&gt;79.7&lt;/td&gt;
&lt;td&gt;77.6&lt;/td&gt;
&lt;td&gt;75.7&lt;/td&gt;
&lt;td&gt;72.8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Qwen3-235B-A22B-Instruct-2507&lt;/td&gt;
&lt;td&gt;92.5&lt;/td&gt;
&lt;td&gt;98.5&lt;/td&gt;
&lt;td&gt;97.6&lt;/td&gt;
&lt;td&gt;96.9&lt;/td&gt;
&lt;td&gt;97.3&lt;/td&gt;
&lt;td&gt;95.8&lt;/td&gt;
&lt;td&gt;94.9&lt;/td&gt;
&lt;td&gt;93.9&lt;/td&gt;
&lt;td&gt;94.5&lt;/td&gt;
&lt;td&gt;91.0&lt;/td&gt;
&lt;td&gt;92.2&lt;/td&gt;
&lt;td&gt;90.9&lt;/td&gt;
&lt;td&gt;87.8&lt;/td&gt;
&lt;td&gt;84.8&lt;/td&gt;
&lt;td&gt;86.5&lt;/td&gt;
&lt;td&gt;84.5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Qwen3-Next-80B-A3B-Instruct&lt;/td&gt;
&lt;td&gt;91.8&lt;/td&gt;
&lt;td&gt;98.5&lt;/td&gt;
&lt;td&gt;99.0&lt;/td&gt;
&lt;td&gt;98.0&lt;/td&gt;
&lt;td&gt;98.7&lt;/td&gt;
&lt;td&gt;97.6&lt;/td&gt;
&lt;td&gt;95.0&lt;/td&gt;
&lt;td&gt;96.0&lt;/td&gt;
&lt;td&gt;94.0&lt;/td&gt;
&lt;td&gt;93.5&lt;/td&gt;
&lt;td&gt;91.7&lt;/td&gt;
&lt;td&gt;86.9&lt;/td&gt;
&lt;td&gt;85.5&lt;/td&gt;
&lt;td&gt;81.7&lt;/td&gt;
&lt;td&gt;80.3&lt;/td&gt;
&lt;td&gt;80.3&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;可以看到， Qwen3-Next-Instruct 在 1M 长度范围内保持稳定性能，整体平均得分 91.8，接近 Qwen3-235B（92.5）。&lt;/p&gt;
&lt;p&gt;Qwen3-Next-Thinking 的表现如下表所示&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;strong&gt;Benchmark&lt;/strong&gt;&lt;/th&gt;
&lt;th&gt;&lt;strong&gt;Qwen3-Next-80B-A3B-Thinking&lt;/strong&gt;&lt;/th&gt;
&lt;th&gt;&lt;strong&gt;Gemini-2.5-Flash Thinking&lt;/strong&gt;&lt;/th&gt;
&lt;th&gt;&lt;strong&gt;Qwen3-32B Thinking&lt;/strong&gt;&lt;/th&gt;
&lt;th&gt;&lt;strong&gt;Qwen3-30B-A3B-Thinking2507&lt;/strong&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;SuperGPQA&lt;/td&gt;
&lt;td&gt;60.8&lt;/td&gt;
&lt;td&gt;57.8&lt;/td&gt;
&lt;td&gt;54.1&lt;/td&gt;
&lt;td&gt;56.8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;AIME25&lt;/td&gt;
&lt;td&gt;87.8&lt;/td&gt;
&lt;td&gt;72.0&lt;/td&gt;
&lt;td&gt;72.9&lt;/td&gt;
&lt;td&gt;85.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LiveCodeBench v6&lt;/td&gt;
&lt;td&gt;68.7&lt;/td&gt;
&lt;td&gt;61.2&lt;/td&gt;
&lt;td&gt;60.6&lt;/td&gt;
&lt;td&gt;66.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Arena-Hard v2&lt;/td&gt;
&lt;td&gt;62.3&lt;/td&gt;
&lt;td&gt;56.7&lt;/td&gt;
&lt;td&gt;48.4&lt;/td&gt;
&lt;td&gt;56.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LiveBench&lt;/td&gt;
&lt;td&gt;76.6&lt;/td&gt;
&lt;td&gt;74.3&lt;/td&gt;
&lt;td&gt;74.9&lt;/td&gt;
&lt;td&gt;76.8&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;可以看到，Qwen3-Next-Thinking 的表现在除了 Livebench 之外的三个 Benchmark 均达到了 SOTA&lt;/p&gt;
&lt;h2 id="conclusion"&gt;&lt;a href="#conclusion" class="header-anchor"&gt;&lt;/a&gt;Conclusion
&lt;/h2&gt;&lt;p&gt;Qwen3-Next 通过&lt;strong&gt;混合注意力架构&lt;/strong&gt;与&lt;strong&gt;精细化 MoE 设计&lt;/strong&gt;，在训练与推理效率上实现突破性提升。其仅以较小计算代价达到接近超大模型性能的表现，为下一代高效大语言模型的设计提供了重要参考。&lt;/p&gt;
&lt;h2 id="references"&gt;&lt;a href="#references" class="header-anchor"&gt;&lt;/a&gt;References
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://qwen.ai/blog?id=4074cca80393150c248e508aa62983f9cb7d27cd&amp;amp;from=research.latest-advancements-list" target="_blank" rel="noopener"
&gt;Qwen3-Next: Towards Ultimate Training &amp;amp; Inference Efficiency&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>