<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GPU on Jiang Yi(姜祎)'s Homepage</title><link>https://jiangyigithub.github.io/ai.github.io/tags/gpu/</link><description>Recent content in GPU on Jiang Yi(姜祎)'s Homepage</description><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Wed, 08 Apr 2026 21:44:44 +0800</lastBuildDate><atom:link href="https://jiangyigithub.github.io/ai.github.io/tags/gpu/index.xml" rel="self" type="application/rss+xml"/><item><title>Notes on roofline model</title><link>https://jiangyigithub.github.io/ai.github.io/p/notes-on-roofline-model/</link><pubDate>Thu, 26 Feb 2026 17:23:40 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/notes-on-roofline-model/</guid><description>&lt;h2 id="introduction"&gt;&lt;a href="#introduction" class="header-anchor"&gt;&lt;/a&gt;Introduction
&lt;/h2&gt;&lt;p&gt;当我们在硬件上运行算法时，我们的算法效率取决于三个因素：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;计算机的计算效率，也就是每秒可执行的操作数 (OPs/s)&lt;/li&gt;
&lt;li&gt;数据移动效率，也就是每秒可传输的 bytes (bytes/s)&lt;/li&gt;
&lt;li&gt;需要的内存空间 (bytes)&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;通过分析这三个因素，我们可以给出一个计算的上下界&lt;/p&gt;
&lt;h2 id="arithmetic-intensity"&gt;&lt;a href="#arithmetic-intensity" class="header-anchor"&gt;&lt;/a&gt;Arithmetic Intensity
&lt;/h2&gt;&lt;p&gt;首先，我们要回答的第一个问题是，运行时间意味着什么？为什么实际运行时间比理想时间要更多？&lt;/p&gt;
&lt;p&gt;容易知道，实际的运行时间由三部分组成&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Computation&lt;/strong&gt; 首先，运行时间与我们的算法和 GPU 设备相关，在深度学习中，我们的算法通常由 FLOPs 决定，GPU 决定了算法的运行时间：&lt;/p&gt;
$$
T_{\mathrm{math}} =\frac{\text{Computation FLOPs}}{\text{Accelerator FLOPs/s}}
$$&lt;p&gt;&lt;strong&gt;Communication within a chip&lt;/strong&gt; 其次，运行时间还受加载数据的速度的影响，在执行计算之前，我们需要先把数据从 HBM 加载到对应的 core 上，因此，加载数据的速度也会影响最终运行时间。我们将加载数据的速度称之为 &lt;strong&gt;HBM bandwidth&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Communication between chips&lt;/strong&gt; 最后，当我们在多个 GPU 上运行模型时，我们还需要在 GPU 之间进行通信，相关的通信手段如下表所示 (intra node 代表同一台服务器，inter node 代表不同服务器)，我们将 GPU 的通信速度称之为 &lt;strong&gt;Network bandwidth&lt;/strong&gt;.&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Method&lt;/th&gt;
&lt;th&gt;Data Path&lt;/th&gt;
&lt;th&gt;BandWith&lt;/th&gt;
&lt;th&gt;Use cases&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Intra Node&lt;/td&gt;
&lt;td&gt;NVLink&lt;/td&gt;
&lt;td&gt;Direct GPU-to-GPU&lt;/td&gt;
&lt;td&gt;1.8 Tb/s (B200)&lt;/td&gt;
&lt;td&gt;TP&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;NVSwith&lt;/td&gt;
&lt;td&gt;all-to-all&lt;/td&gt;
&lt;td&gt;900 GB/s-1.8T b/s&lt;/td&gt;
&lt;td&gt;full mesh sync in DGX&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;GPUDirect P2P&lt;/td&gt;
&lt;td&gt;Direct over PCIe Bus&lt;/td&gt;
&lt;td&gt;32-128 GB/s&lt;/td&gt;
&lt;td&gt;small clusters withou NVLink&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;Shared Memory&lt;/td&gt;
&lt;td&gt;GPU -&amp;gt; CPU RAM -&amp;gt; GPU&lt;/td&gt;
&lt;td&gt;20-50 GB/s&lt;/td&gt;
&lt;td&gt;Fallback when P2P is disabled&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inter Node&lt;/td&gt;
&lt;td&gt;InfiniBand&lt;/td&gt;
&lt;td&gt;GPU -&amp;gt; NIC -&amp;gt; IB Switch&lt;/td&gt;
&lt;td&gt;200-400 Gbps&lt;/td&gt;
&lt;td&gt;Large scale LLM training&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;GPU Direct RDMA&lt;/td&gt;
&lt;td&gt;GPU -&amp;gt; NIC -&amp;gt; Network&lt;/td&gt;
&lt;td&gt;Same as NIC speed&lt;/td&gt;
&lt;td&gt;Bypassing CPU for network sync&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;RoCE (v2)&lt;/td&gt;
&lt;td&gt;RAME over Ethernet&lt;/td&gt;
&lt;td&gt;100-400 Gbps&lt;/td&gt;
&lt;td&gt;Cost-effective Ethernet clusters&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;/td&gt;
&lt;td&gt;TCP/IP sockets&lt;/td&gt;
&lt;td&gt;GPU -&amp;gt; CPU -&amp;gt; Kernel -&amp;gt; Net&lt;/td&gt;
&lt;td&gt;&amp;lt; 100 Gbps&lt;/td&gt;
&lt;td&gt;Standard networking&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;我们将 GPU 的通信 (intra-node 和 inter-node) 效率定义如下&lt;/p&gt;
$$
T_{\mathrm{comm}} =\frac{\text{Communication Bytes}}{\text{Network/Memory Bandwith Bytes/s}}
$$&lt;p&gt;通常来说，我们可以通过计算 - 通信重叠来降低整体的运行时间，比如说 &lt;a class="link" href="DeepSeek-V3.md" &gt;DeepSeek-V3&lt;/a&gt; 等模型提出的优化方法, 此时理论上的最小运行时间就是 $T_{\mathrm{math}}$ 和 $T_{\mathrm{comm}}$ 之间的最大值。另一方面，如果我们不做任何优化，则理论上最大运行时间就是 $T_{\mathrm{math}}$ 和 $T_{\mathrm{comm}}$ 之和。我们定义对应的 bound 如下&lt;/p&gt;
$$
\begin{aligned}
T_{lower} &amp;= \max(T_{\mathrm{math}} ,T_{\mathrm{comm}} )\\
T_{upper} &amp;= T_{\mathrm{math}}+T_{\mathrm{comm}}
\end{aligned}
$$&lt;p&gt;注意到&lt;/p&gt;
$$
T_{upper} = T_{\mathrm{math}}+T_{\mathrm{comm}} \leq 2\max(T_{\mathrm{math}} ,T_{\mathrm{comm}} )= 2T_{lower}
$$&lt;p&gt;也就是&lt;strong&gt;最大运行时间最多为最小运行时间的两倍&lt;/strong&gt;。因此，我们一般直接优化 $T_{lower}$.&lt;/p&gt;
&lt;p&gt;如果我们假设我们可以完全达到计算 - 通信重叠，则：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;当 $T_{\mathrm{math}}&gt;T_{\mathrm{comm}}$ 时, 我们完全利用了 GPU 的资源，因为此时运行时间受硬件的计算效率约束，我们将其称之为 &lt;strong&gt;compute bound&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;当 $T_{\mathrm{comm}}&gt; T_{\mathrm{math}}$ 时, 此时运行时间受硬件的通信效率影响，GPU 的（计算）利用率不完全，我们将其称为 &lt;strong&gt;communication bound&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为了评估一个算法时 compute bound 还是 communication bound, 我们可以使用 arithmetic intensity 来进行评估。我们先分析 single GPU 的情况，再分析 multi GPU 的情况&lt;/p&gt;
&lt;h2 id="single-gpu"&gt;&lt;a href="#single-gpu" class="header-anchor"&gt;&lt;/a&gt;Single GPU
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;Arithmetic Intensity&lt;/strong&gt;
一个算法的 arithmetic intensity 定义为算法通信所需要的 FLOPs 和所需要的 bytes 之比：&lt;/p&gt;
$$
\text{Arithmetic Intensity} = \frac{\text{Computation FLOPs}}{\text{Communication Bytes}}
$$&lt;p&gt;arithmetic intensity 衡量了一个算法的 &lt;em&gt;FLOPs per bytes&lt;/em&gt;, 当 arithmetic intensity 比较高时，说明 $T_{\mathrm{math}}&gt;T_{\mathrm{comm}}$, 此时 GPU 的利用效率较高，反之则说明 GPU 出现了空置的情况。这两种情况的交叉点由 GPU 的 &lt;strong&gt;Peak arithmetic intensity&lt;/strong&gt; 决定：&lt;/p&gt;
$$
\begin{aligned}
T_{\mathrm{math}}=T_{\mathrm{comm}} &amp;\Leftrightarrow \frac{\text{Computation FLOPs}}{\text{Accelerator FLOPs/s}} = \frac{\text{Communication Bytes}}{\text{Bandwith Bytes/s}}\\
&amp;\Leftrightarrow \frac{\text{Computation FLOPs}}{\text{Communication Bytes}} = \frac{\text{Accelerator FLOPs/s}}{\text{Bandwith Bytes/s}}\\
&amp;\Leftrightarrow \text{Intensity}(\text{Computation}) = \text{Intensity}(\text{GPU})
\end{aligned}
$$&lt;p&gt;这里 $\text{Intensity}(\text{GPU})$ 就是 GPU 达到 peak FLOPs 时对应的 arithmetic intensity.&lt;/p&gt;
&lt;p&gt;不同 GPU Tensor Core 对应的 intensity 如下所示&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;GPU&lt;/th&gt;
&lt;th&gt;Generation&lt;/th&gt;
&lt;th&gt;bandwidth&lt;/th&gt;
&lt;th&gt;peak BF16 Tensor Core&lt;/th&gt;
&lt;th&gt;intensity&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;V100&lt;/td&gt;
&lt;td&gt;Volta&lt;/td&gt;
&lt;td&gt;300 GB/s&lt;/td&gt;
&lt;td&gt;125 TFLOPs/s&lt;/td&gt;
&lt;td&gt;427&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;A100&lt;/td&gt;
&lt;td&gt;Amper&lt;/td&gt;
&lt;td&gt;1,935 GB/s&lt;/td&gt;
&lt;td&gt;156 TFLOPs/s&lt;/td&gt;
&lt;td&gt;83&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;H100&lt;/td&gt;
&lt;td&gt;Hopper&lt;/td&gt;
&lt;td&gt;3.35TB/s&lt;/td&gt;
&lt;td&gt;495 TFLOPs/s&lt;/td&gt;
&lt;td&gt;147&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;H200&lt;/td&gt;
&lt;td&gt;Hopper&lt;/td&gt;
&lt;td&gt;4.8TB/s&lt;/td&gt;
&lt;td&gt;495 TFLOPs/s&lt;/td&gt;
&lt;td&gt;147&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;B200&lt;/td&gt;
&lt;td&gt;Blackwell&lt;/td&gt;
&lt;td&gt;576 TB/s&lt;/td&gt;
&lt;td&gt;2250 TFLOPs/s&lt;/td&gt;
&lt;td&gt;3.9&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Example&lt;/strong&gt;
假设我们使用 BF16 精度计算两个长度为 $N$ 的向量的内积，计算时的流程如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从 HBM 中加载两个向量，通信量为 $2*2N$&lt;/li&gt;
&lt;li&gt;计算两个向量内积，需要 $N$ 次乘法和 $N-1$ 次加法&lt;/li&gt;
&lt;li&gt;将结果写回 HBM, 通信量为 $2$.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;从而内积的 intensity 为&lt;/p&gt;
$$
\text{Intensity}(\text{dot product}) = \frac{\text{Total FLOPs}}{\text{Total Bytes}} = \frac{N+N-1}{2N+2N+2} = \frac{2N-1}{4N+2}\to \frac12
$$&lt;p&gt;也就是说，内积的 arithmetic intensity 最大为 $1/2$, 说明这是一个 memory-bound operation.&lt;/p&gt;
&lt;p&gt;接下来，我们可以对 communication-bound 和 compute-bound 进行可视化，如下图所示&lt;/p&gt;
&lt;p&gt;&lt;img src="https://jiangyigithub.github.io/ai.github.io/p/notes-on-roofline-model/GPU-roofline-model.png"
width="1400"
height="1167"
loading="lazy"
alt="Roofline model visualization for two algorithms (sourced from ‘How to Scale Your Model’)"
class="gallery-image"
data-flex-grow="119"
data-flex-basis="287px"
&gt;&lt;/p&gt;
&lt;p&gt;这里我们展示了两个算法 Algo 1 和 Algo 2 的 arithmetic intensity, 当 intensity 较小（小于硬件的 intensity）是，算法为 communication bound, 随着 intensity 增加，算法逐渐由 communication bound 过渡到 compute bound. 上面这个模型被称为 &lt;em&gt;Roofline model&lt;/em&gt;, 其展示了算法计算效率与硬件之间的关系。&lt;/p&gt;
&lt;p&gt;为了提高算法计算效率，我们可以通过提升算法的 arithmetic intensity 或者提高 memory bandwith.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Example&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;接下来我们来看一下矩阵计算的 intensity, 我们仍然假设在 BF16 精度下进行计算，假设输入矩阵为 $X\in\mathbb{R}^{b\times d}$ 以及 $Y\in\mathbb{R}^{d\times f}$ , 则输出为 $Z=XY\in\mathbb{R}^{b\times f}$. 计算过程为：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从 HBM 中加载 $X$ 和 $Y$, 通信量为 $2df+2bd$ bytes&lt;/li&gt;
&lt;li&gt;计算矩阵乘法，计算量为 $2bdf$ FLOPs&lt;/li&gt;
&lt;li&gt;将结果写回到 HBM, 通信量为 $2bf$.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;因此对应的 intensity 为&lt;/p&gt;
$$
\text{Intensity}(\text{MatMul}) = \frac{2bdf}{2bd+2df+2bf} = \frac{bfd}{bd+df+bf}
$$&lt;p&gt;假设 $b &lt;&lt; \min(d,f)$ (在 LLM 中这个假设一般成立)，我们有&lt;/p&gt;
$$
\text{Intensity}(\text{MatMul}) = \frac{bfd}{bd+df+bf}\approx \frac{bdf}{df}=b
$$&lt;p&gt;因此我们就可以通过调整 $b$ (batch size) 来将算法从 memory-bound 转换为 compute bound.&lt;/p&gt;
&lt;h2 id="multi-gpu"&gt;&lt;a href="#multi-gpu" class="header-anchor"&gt;&lt;/a&gt;Multi GPU
&lt;/h2&gt;&lt;p&gt;在 multi GPU 的场景下，我们需要关注 GPU 之间通信的效率，一般来说，GPU 之间效率要远小于 GPU 内部通信效率，下面是不同 GPU 的内部通信（HBM bandwidth） 和 GPU 之间通信效率对比&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;GPU&lt;/th&gt;
&lt;th&gt;Generation&lt;/th&gt;
&lt;th&gt;HBM Type&lt;/th&gt;
&lt;th&gt;HBM bandwidth&lt;/th&gt;
&lt;th&gt;NVLink Generation&lt;/th&gt;
&lt;th&gt;NVLink Bandwidth&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;V100&lt;/td&gt;
&lt;td&gt;Volta&lt;/td&gt;
&lt;td&gt;HBM2&lt;/td&gt;
&lt;td&gt;300 GB/s&lt;/td&gt;
&lt;td&gt;2.0&lt;/td&gt;
&lt;td&gt;300 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;A100&lt;/td&gt;
&lt;td&gt;Amper&lt;/td&gt;
&lt;td&gt;HBM2e&lt;/td&gt;
&lt;td&gt;1,935 GB/s&lt;/td&gt;
&lt;td&gt;3.0&lt;/td&gt;
&lt;td&gt;600 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;H100&lt;/td&gt;
&lt;td&gt;Hopper&lt;/td&gt;
&lt;td&gt;HBM3&lt;/td&gt;
&lt;td&gt;3.35TB/s&lt;/td&gt;
&lt;td&gt;4.0&lt;/td&gt;
&lt;td&gt;900 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;H200&lt;/td&gt;
&lt;td&gt;Hopper&lt;/td&gt;
&lt;td&gt;HBM3e&lt;/td&gt;
&lt;td&gt;4.8TB/s&lt;/td&gt;
&lt;td&gt;4.0&lt;/td&gt;
&lt;td&gt;900 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;B200&lt;/td&gt;
&lt;td&gt;Blackwell&lt;/td&gt;
&lt;td&gt;HBM3e&lt;/td&gt;
&lt;td&gt;576 TB/s&lt;/td&gt;
&lt;td&gt;5.0&lt;/td&gt;
&lt;td&gt;1800 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Example&lt;/strong&gt;
我们考虑一个分布式矩阵乘法，假设我们有两个 GPU, 计算精度为 BF16, 矩阵 $X\in\mathbb{R}^{b\times d}$ 以及 $Y\in\mathbb{R}^{d\times f}$ 分别被切分为相同大小存储在这两个 GPU 上，此时，计算流程为：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在 GPU0/GPU1 上，分别从对应的 HBM 中加载 $X_1, Y_1$ 以及 $X_2, Y_2$&lt;/li&gt;
&lt;li&gt;在 GPU0/GPU1 上，分别计算对应的矩阵乘法 $A=X_1Y_1\in\mathbb{R}^{b\times f}$ 和 $B=X_2Y_2\in\mathbb{R}^{b\times f}$, 计算量为 $2bdf$.&lt;/li&gt;
&lt;li&gt;将 GPU1 的结果 $B$ 通信传输到 GPU0 上，通信量为 $2bf$.&lt;/li&gt;
&lt;li&gt;对结果进行相加，$Z=A+B$. 计算量为 $bf$.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;此时，我们的 intensity 为 （注意这里计算时间除以 2 代表我们使用两张 GPU 因而效率翻倍了）&lt;/p&gt;
$$
\text{Intensity}(\text{MatMul (2-GPU)}) = \frac{2bfd/2}{2bf}= \frac{d}{2}
$$&lt;p&gt;可以看到，此时决定性因素在于 $d$ 而不是 $b$, 这对于我们实现并行算法至关重要&lt;/p&gt;</description></item><item><title>Nvidia-GPU specs</title><link>https://jiangyigithub.github.io/ai.github.io/p/nvidia-gpu-specs/</link><pubDate>Wed, 14 Jan 2026 11:09:19 +0800</pubDate><guid>https://jiangyigithub.github.io/ai.github.io/p/nvidia-gpu-specs/</guid><description>&lt;h2 id="v100"&gt;&lt;a href="#v100" class="header-anchor"&gt;&lt;/a&gt;V100
&lt;/h2&gt;&lt;h3 id="v100-关键改进"&gt;&lt;a href="#v100-%e5%85%b3%e9%94%ae%e6%94%b9%e8%bf%9b" class="header-anchor"&gt;&lt;/a&gt;V100 关键改进
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;Volta architecture&lt;/li&gt;
&lt;li&gt;SM architecture: 支持深度学习&lt;/li&gt;
&lt;li&gt;2nd NVIDIA NVLink&lt;/li&gt;
&lt;li&gt;HBM2 memory&lt;/li&gt;
&lt;li&gt;Volta Multi-process Service&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="v100-技术规格"&gt;&lt;a href="#v100-%e6%8a%80%e6%9c%af%e8%a7%84%e6%a0%bc" class="header-anchor"&gt;&lt;/a&gt;V100 技术规格
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Tesla Product&lt;/th&gt;
&lt;th&gt;Tesla K40&lt;/th&gt;
&lt;th&gt;Tesla M40&lt;/th&gt;
&lt;th&gt;Tesla P100&lt;/th&gt;
&lt;th&gt;Tesla V100&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;GPU&lt;/td&gt;
&lt;td&gt;GK180 (Kepler)&lt;/td&gt;
&lt;td&gt;GM200 (Maxwell)&lt;/td&gt;
&lt;td&gt;GP100 (Pascal)&lt;/td&gt;
&lt;td&gt;GV100 (Volta)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SMs&lt;/td&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;td&gt;24&lt;/td&gt;
&lt;td&gt;56&lt;/td&gt;
&lt;td&gt;80&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TPCs&lt;/td&gt;
&lt;td&gt;15&lt;/td&gt;
&lt;td&gt;24&lt;/td&gt;
&lt;td&gt;28&lt;/td&gt;
&lt;td&gt;40&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32 Cores / GPU&lt;/td&gt;
&lt;td&gt;2880&lt;/td&gt;
&lt;td&gt;3072&lt;/td&gt;
&lt;td&gt;3584&lt;/td&gt;
&lt;td&gt;5120&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP64 Cores / GPU&lt;/td&gt;
&lt;td&gt;960&lt;/td&gt;
&lt;td&gt;96&lt;/td&gt;
&lt;td&gt;1792&lt;/td&gt;
&lt;td&gt;2560&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tensor Cores / GPU&lt;/td&gt;
&lt;td&gt;NA&lt;/td&gt;
&lt;td&gt;NA&lt;/td&gt;
&lt;td&gt;NA&lt;/td&gt;
&lt;td&gt;640&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Boost Clock&lt;/td&gt;
&lt;td&gt;810/875 MHz&lt;/td&gt;
&lt;td&gt;1114 MHz&lt;/td&gt;
&lt;td&gt;1480 MHz&lt;/td&gt;
&lt;td&gt;1530 MHz&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Peak FP32 TFLOPS²&lt;/td&gt;
&lt;td&gt;5&lt;/td&gt;
&lt;td&gt;6.8&lt;/td&gt;
&lt;td&gt;10.6&lt;/td&gt;
&lt;td&gt;15.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Peak FP64 TFLOPS²&lt;/td&gt;
&lt;td&gt;1.7&lt;/td&gt;
&lt;td&gt;.21&lt;/td&gt;
&lt;td&gt;5.3&lt;/td&gt;
&lt;td&gt;7.8&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Peak Tensor TFLOPS²&lt;/td&gt;
&lt;td&gt;NA&lt;/td&gt;
&lt;td&gt;NA&lt;/td&gt;
&lt;td&gt;NA&lt;/td&gt;
&lt;td&gt;125&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Memory Size&lt;/td&gt;
&lt;td&gt;Up to 12 GB&lt;/td&gt;
&lt;td&gt;Up to 24 GB&lt;/td&gt;
&lt;td&gt;16 GB&lt;/td&gt;
&lt;td&gt;16 GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Memory Interface&lt;/td&gt;
&lt;td&gt;384-bit GDDR5&lt;/td&gt;
&lt;td&gt;384-bit GDDR5&lt;/td&gt;
&lt;td&gt;4096-bit HBM2&lt;/td&gt;
&lt;td&gt;4096-bit HBM2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TDP&lt;/td&gt;
&lt;td&gt;235 Watts&lt;/td&gt;
&lt;td&gt;250 Watts&lt;/td&gt;
&lt;td&gt;300 Watts&lt;/td&gt;
&lt;td&gt;300 Watts&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Manufacturing Process&lt;/td&gt;
&lt;td&gt;28 nm&lt;/td&gt;
&lt;td&gt;28 nm&lt;/td&gt;
&lt;td&gt;16 nm FinFET+&lt;/td&gt;
&lt;td&gt;12 nm FFN&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;内存规格&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;GPU&lt;/th&gt;
&lt;th&gt;Kepler GK180&lt;/th&gt;
&lt;th&gt;Maxwell GM200&lt;/th&gt;
&lt;th&gt;Pascal GP100&lt;/th&gt;
&lt;th&gt;Volta GV100&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Compute Capability&lt;/td&gt;
&lt;td&gt;3.5&lt;/td&gt;
&lt;td&gt;5.2&lt;/td&gt;
&lt;td&gt;6.0&lt;/td&gt;
&lt;td&gt;7.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Threads / Warp&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Warps / SM&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Threads / SM&lt;/td&gt;
&lt;td&gt;2048&lt;/td&gt;
&lt;td&gt;2048&lt;/td&gt;
&lt;td&gt;2048&lt;/td&gt;
&lt;td&gt;2048&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thread Blocks / SM&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;td&gt;32&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max 32-bit Registers / SM&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Registers / Block&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;td&gt;65536&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Registers / Thread&lt;/td&gt;
&lt;td&gt;255&lt;/td&gt;
&lt;td&gt;255&lt;/td&gt;
&lt;td&gt;255&lt;/td&gt;
&lt;td&gt;255&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thread Block Size&lt;/td&gt;
&lt;td&gt;1024&lt;/td&gt;
&lt;td&gt;1024&lt;/td&gt;
&lt;td&gt;1024&lt;/td&gt;
&lt;td&gt;1024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32 Cores / SM&lt;/td&gt;
&lt;td&gt;192&lt;/td&gt;
&lt;td&gt;128&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;td&gt;64&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ratio of SM Registers to FP32 Cores&lt;/td&gt;
&lt;td&gt;341&lt;/td&gt;
&lt;td&gt;512&lt;/td&gt;
&lt;td&gt;1024&lt;/td&gt;
&lt;td&gt;1024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Shared Memory Size / SM&lt;/td&gt;
&lt;td&gt;16 KB/32 KB/ 48 KB&lt;/td&gt;
&lt;td&gt;96 KB&lt;/td&gt;
&lt;td&gt;64 KB&lt;/td&gt;
&lt;td&gt;Configurable up to 96 KB&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;系统规格&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Specification&lt;/th&gt;
&lt;th&gt;DGX-1 (Tesla P100)&lt;/th&gt;
&lt;th&gt;DGX-1 (Tesla V100)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;GPU&lt;/td&gt;
&lt;td&gt;8x Tesla P100 GPUs&lt;/td&gt;
&lt;td&gt;8x Tesla V100 GPUs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TFLOPS&lt;/td&gt;
&lt;td&gt;170 (GPU FP16) + 3 (CPU FP32)&lt;/td&gt;
&lt;td&gt;1 (GPU Tensor PFLOP)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory&lt;/td&gt;
&lt;td&gt;16 GB per GPU / 128 GB per DGX-1 Node&lt;/td&gt;
&lt;td&gt;16 GB or 32 GB per GPU / 128-256 GB per DGX-1 Node&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;CPU&lt;/td&gt;
&lt;td&gt;Dual 20-core Intel® Xeon® E5-2698 v4&lt;/td&gt;
&lt;td&gt;Dual 20-core Intel® Xeon® E5-2698 v4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32 CUDA Cores&lt;/td&gt;
&lt;td&gt;28,672 Cores&lt;/td&gt;
&lt;td&gt;40,960 Cores&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;System Memory&lt;/td&gt;
&lt;td&gt;Up to 512 GB 2133 MHz DDR4 LRDIMM&lt;/td&gt;
&lt;td&gt;Up to 512 GB 2133 MHz DDR4 LRDIMM&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Storage&lt;/td&gt;
&lt;td&gt;4x 1.92 TB SSD RAID 0&lt;/td&gt;
&lt;td&gt;4x 1.92 TB SSD RAID 0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Network Interconnect&lt;/td&gt;
&lt;td&gt;Dual 10 GbE, 4 IB EDR&lt;/td&gt;
&lt;td&gt;Dual 10 GbE, 4 IB EDR&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;System Dimensions&lt;/td&gt;
&lt;td&gt;866 D x 444 W x 131 H (mm)&lt;/td&gt;
&lt;td&gt;866 D x 444 W x 131 H (mm)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;System Weight&lt;/td&gt;
&lt;td&gt;80 lbs&lt;/td&gt;
&lt;td&gt;80 lbs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Power TDP&lt;/td&gt;
&lt;td&gt;3200 W&lt;/td&gt;
&lt;td&gt;3200 W&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Operating Temp&lt;/td&gt;
&lt;td&gt;10 - 35°C&lt;/td&gt;
&lt;td&gt;10 - 35°C&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="a100"&gt;&lt;a href="#a100" class="header-anchor"&gt;&lt;/a&gt;A100
&lt;/h2&gt;&lt;h3 id="a100-关键改进"&gt;&lt;a href="#a100-%e5%85%b3%e9%94%ae%e6%94%b9%e8%bf%9b" class="header-anchor"&gt;&lt;/a&gt;A100 关键改进
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;Ampere 架构：使用 MIG 来将 A100 切分为更小的实例或者链接更多 GPU&lt;/li&gt;
&lt;li&gt;Tensor Cores: 312 TFLOPs/s&lt;/li&gt;
&lt;li&gt;NVLink: 更高的 throughput&lt;/li&gt;
&lt;li&gt;MIG (multi-instance GPU): 一个 A100 可以切分为至多 7 个硬件层面隔离的实例&lt;/li&gt;
&lt;li&gt;HBM2e: 更大的 HBM, 更快的 bandwidth, 更高的 DRAM 使用效率&lt;/li&gt;
&lt;li&gt;structure sparsity: 稀疏运算可以带来 2 倍的算力提升&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="a100-技术规格"&gt;&lt;a href="#a100-%e6%8a%80%e6%9c%af%e8%a7%84%e6%a0%bc" class="header-anchor"&gt;&lt;/a&gt;A100 技术规格
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;A100 80GB PCIe&lt;/th&gt;
&lt;th&gt;A100 80GB SXM&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;FP64&lt;/td&gt;
&lt;td&gt;9.7 TFLOPS&lt;/td&gt;
&lt;td&gt;9.7 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP64 Tensor Core&lt;/td&gt;
&lt;td&gt;19.5 TFLOPS&lt;/td&gt;
&lt;td&gt;19.5 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32&lt;/td&gt;
&lt;td&gt;19.5 TFLOPS&lt;/td&gt;
&lt;td&gt;19.5 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tensor Float 32 (TF32)&lt;/td&gt;
&lt;td&gt;156 TFLOPS | 312 TFLOPS&lt;/td&gt;
&lt;td&gt;156 TFLOPS | 312 TFLOPS*&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BFLOAT16 Tensor Core&lt;/td&gt;
&lt;td&gt;312 TFLOPS | 624 TFLOPS*&lt;/td&gt;
&lt;td&gt;312 TFLOPS | 624 TFLOPS*&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP16 Tensor Core&lt;/td&gt;
&lt;td&gt;312 TFLOPS | 624 TFLOPS*&lt;/td&gt;
&lt;td&gt;312 TFLOPS | 624 TFLOPS*&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;INT8 Tensor Core&lt;/td&gt;
&lt;td&gt;624 TOPS | 1248 TOPS*&lt;/td&gt;
&lt;td&gt;624 TOPS | 1248 TOPS*&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory&lt;/td&gt;
&lt;td&gt;80GB HBM2e&lt;/td&gt;
&lt;td&gt;80GB HBM2e&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory Bandwidth&lt;/td&gt;
&lt;td&gt;1,935 GB/s&lt;/td&gt;
&lt;td&gt;2,039 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thermal Design Power (TDP)&lt;/td&gt;
&lt;td&gt;300W&lt;/td&gt;
&lt;td&gt;400W ***&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Multi-Instance GPU&lt;/td&gt;
&lt;td&gt;Up to 7 MIGs @ 10GB&lt;/td&gt;
&lt;td&gt;Up to 7 MIGs @ 10GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Form Factor&lt;/td&gt;
&lt;td&gt;PCIe &lt;br&gt;Dual-slot air-cooled or single-slot liquid-cooled&lt;/td&gt;
&lt;td&gt;SXM&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interconnect&lt;/td&gt;
&lt;td&gt;NVIDIA® NVLink® Bridge &lt;br&gt;for 2 GPUs: 600 GB/s ** &lt;br&gt;PCIe Gen4: 64 GB/s&lt;/td&gt;
&lt;td&gt;NVLink: 600 GB/s &lt;br&gt;PCIe Gen4: 64 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Server Options&lt;/td&gt;
&lt;td&gt;Partner and NVIDIA-Certified Systems™ with 1-8 GPUs&lt;/td&gt;
&lt;td&gt;NVIDIA HGX™ A100-Partner and NVIDIA-Certified Systems with 4,8, or 16 GPUs NVIDIA DGX™ A100 with 8 GPUs&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="h100"&gt;&lt;a href="#h100" class="header-anchor"&gt;&lt;/a&gt;H100
&lt;/h2&gt;&lt;h3 id="h100-关键改进"&gt;&lt;a href="#h100-%e5%85%b3%e9%94%ae%e6%94%b9%e8%bf%9b" class="header-anchor"&gt;&lt;/a&gt;H100 关键改进
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;Hopper 架构&lt;/li&gt;
&lt;li&gt;Tensor Core: 更强的 tensor core&lt;/li&gt;
&lt;li&gt;transformer engine: 加速基于 transformer 架构模型的训练&lt;/li&gt;
&lt;li&gt;NVLink: 900GB/s 的 bandwidth&lt;/li&gt;
&lt;li&gt;2nd MIG: 支持 multi-tenant, multi-user 使用&lt;/li&gt;
&lt;li&gt;DPX: 基于 DPX 指令集加速动态规划算法&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="h100-技术规格"&gt;&lt;a href="#h100-%e6%8a%80%e6%9c%af%e8%a7%84%e6%a0%bc" class="header-anchor"&gt;&lt;/a&gt;H100 技术规格
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;H100 SXM&lt;/th&gt;
&lt;th&gt;H100 NVL&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;FP64&lt;/td&gt;
&lt;td&gt;34 teraFLOPS&lt;/td&gt;
&lt;td&gt;30 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP64 Tensor Core&lt;/td&gt;
&lt;td&gt;67 teraFLOPS&lt;/td&gt;
&lt;td&gt;60 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32&lt;/td&gt;
&lt;td&gt;67 teraFLOPS&lt;/td&gt;
&lt;td&gt;60 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TF32 Tensor Core*&lt;/td&gt;
&lt;td&gt;989 teraFLOPS&lt;/td&gt;
&lt;td&gt;835 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BFLOAT16 Tensor Core*&lt;/td&gt;
&lt;td&gt;1,979 teraFLOPS&lt;/td&gt;
&lt;td&gt;1,671 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP16 Tensor Core*&lt;/td&gt;
&lt;td&gt;1,979 teraFLOPS&lt;/td&gt;
&lt;td&gt;1,671 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP8 Tensor Core*&lt;/td&gt;
&lt;td&gt;3,958 teraFLOPS&lt;/td&gt;
&lt;td&gt;3,341 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;INT8 Tensor Core*&lt;/td&gt;
&lt;td&gt;3,958 teraFLOPS&lt;/td&gt;
&lt;td&gt;3,341 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory&lt;/td&gt;
&lt;td&gt;80GB&lt;/td&gt;
&lt;td&gt;94GB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory Bandwidth&lt;/td&gt;
&lt;td&gt;3.35TB/s&lt;/td&gt;
&lt;td&gt;3.9TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decoders&lt;/td&gt;
&lt;td&gt;7 NVDEC &lt;br&gt;7 JPEG&lt;/td&gt;
&lt;td&gt;7 NVDEC &lt;br&gt;7 JPEG&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thermal Design Power (TDP)&lt;/td&gt;
&lt;td&gt;Up to 700W (configurable)&lt;/td&gt;
&lt;td&gt;350-400W (configurable)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Multi-Instance GPUs&lt;/td&gt;
&lt;td&gt;Up to 7 MIGS @ 10GB each&lt;/td&gt;
&lt;td&gt;Up to 7 MIGS @ 12GB each&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Form Factor&lt;/td&gt;
&lt;td&gt;SXM&lt;/td&gt;
&lt;td&gt;PCIe &lt;br&gt;dual-slot air-cooled&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interconnect&lt;/td&gt;
&lt;td&gt;NVIDIA NVLink™: 900GB/s &lt;br&gt;PCIe Gen5: 128GB/s&lt;/td&gt;
&lt;td&gt;NVIDIA NVLink: 600GB/s &lt;br&gt;PCIe Gen5: 128GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Server Options&lt;/td&gt;
&lt;td&gt;NVIDIA HGX H100 Partner and NVIDIA- &lt;br&gt;Certified Systems™ with 4 or 8 GPUs &lt;br&gt;NVIDIA DGX H100 with 8 GPUs&lt;/td&gt;
&lt;td&gt;Partner and NVIDIA-Certified Systems with 1–8 GPUs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;NVIDIA AI Enterprise&lt;/td&gt;
&lt;td&gt;Add-on&lt;/td&gt;
&lt;td&gt;Included&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="h200"&gt;&lt;a href="#h200" class="header-anchor"&gt;&lt;/a&gt;H200
&lt;/h2&gt;&lt;h3 id="h200-关键改进"&gt;&lt;a href="#h200-%e5%85%b3%e9%94%ae%e6%94%b9%e8%bf%9b" class="header-anchor"&gt;&lt;/a&gt;H200 关键改进
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;更高的 HBM 内存和带宽&lt;/li&gt;
&lt;li&gt;更高的 LLM inference 速度&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="h200-技术规格"&gt;&lt;a href="#h200-%e6%8a%80%e6%9c%af%e8%a7%84%e6%a0%bc" class="header-anchor"&gt;&lt;/a&gt;H200 技术规格
&lt;/h3&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;H200 SXM&lt;/th&gt;
&lt;th&gt;H200 NVL&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;FP64&lt;/td&gt;
&lt;td&gt;34 teraFLOPS&lt;/td&gt;
&lt;td&gt;30 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP64 Tensor Core&lt;/td&gt;
&lt;td&gt;67 teraFLOPS&lt;/td&gt;
&lt;td&gt;60 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32&lt;/td&gt;
&lt;td&gt;67 teraFLOPS&lt;/td&gt;
&lt;td&gt;60 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TF32 Tensor Core*&lt;/td&gt;
&lt;td&gt;989 teraFLOPS&lt;/td&gt;
&lt;td&gt;835 teraFLOPs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BFLOAT16 Tensor Core*&lt;/td&gt;
&lt;td&gt;1,979 teraFLOPS&lt;/td&gt;
&lt;td&gt;1,671 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP16 Tensor Core*&lt;/td&gt;
&lt;td&gt;1,979 teraFLOPS&lt;/td&gt;
&lt;td&gt;1,671 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP8 Tensor Core*&lt;/td&gt;
&lt;td&gt;3,958 teraFLOPS&lt;/td&gt;
&lt;td&gt;3,341 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;INT8 Tensor Core*&lt;/td&gt;
&lt;td&gt;3,958 teraFLOPS&lt;/td&gt;
&lt;td&gt;3,341 teraFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;141GB&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;141GB&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory Bandwidth&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;4.8TB/s&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;4.8TB/s&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decoders&lt;/td&gt;
&lt;td&gt;7 NVDEC &lt;br&gt;7 JPEG&lt;/td&gt;
&lt;td&gt;7 NVDEC &lt;br&gt;7 JPEG&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Confidential Computing&lt;/td&gt;
&lt;td&gt;Supported&lt;/td&gt;
&lt;td&gt;Supported&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thermal Design Power (TDP)&lt;/td&gt;
&lt;td&gt;Up to 700W (configurable)&lt;/td&gt;
&lt;td&gt;Up to &lt;strong&gt;600W&lt;/strong&gt; (configurable)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Multi-Instance GPUs&lt;/td&gt;
&lt;td&gt;Up to 7 MIGS @ &lt;strong&gt;18GB&lt;/strong&gt; each&lt;/td&gt;
&lt;td&gt;Up to 7 MIGS @ &lt;strong&gt;18GB&lt;/strong&gt; each&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Form Factor&lt;/td&gt;
&lt;td&gt;SXM&lt;/td&gt;
&lt;td&gt;PCIe &lt;br&gt;dual-slot air-cooled&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interconnect&lt;/td&gt;
&lt;td&gt;NVIDIA NVLink™: 900GB/s &lt;br&gt;PCIe Gen5: 128GB/s&lt;/td&gt;
&lt;td&gt;2- or 4-way NVIDIA NVLink bridge: ** 900GB/s** per GPU&lt;br&gt;PCIe Gen5: 128GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Server Options&lt;/td&gt;
&lt;td&gt;NVIDIA HGX H200 Partner and NVIDIA- &lt;br&gt;Certified Systems™ with 4 or 8 GPUs&lt;/td&gt;
&lt;td&gt;NVIDIA MGX™ H200 NVL partner and &lt;br&gt;NVIDIA-Certified Systems with up to 8 GPUs&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;NVIDIA AI Enterprise&lt;/td&gt;
&lt;td&gt;Add-on&lt;/td&gt;
&lt;td&gt;Included&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;相比于 H100, H200 升级了 HBM 和 bandwidth&lt;/p&gt;
&lt;h2 id="b200"&gt;&lt;a href="#b200" class="header-anchor"&gt;&lt;/a&gt;B200
&lt;/h2&gt;&lt;h3 id="b200-关键改进"&gt;&lt;a href="#b200-%e5%85%b3%e9%94%ae%e6%94%b9%e8%bf%9b" class="header-anchor"&gt;&lt;/a&gt;B200 关键改进
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;blackwell 架构： GPU 之间的通信效率大幅度提升&lt;/li&gt;
&lt;li&gt;Grace CPU: GPU 可以与 Grace CPu 之间达到 900GB/s 的 bidirectional bandwidth&lt;/li&gt;
&lt;li&gt;5th NVIDIA NVLink: 可以链接 576 块 GPU 来支持计算，NVlink 的带宽可以达到 130TB/s&lt;/li&gt;
&lt;li&gt;RAS engine: 自动识别故障来提高效率&lt;/li&gt;
&lt;li&gt;NVIDIA networking&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="b2100-技术规格"&gt;&lt;a href="#b2100-%e6%8a%80%e6%9c%af%e8%a7%84%e6%a0%bc" class="header-anchor"&gt;&lt;/a&gt;B2100 技术规格
&lt;/h3&gt;&lt;p&gt;system specification 如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Specification&lt;/th&gt;
&lt;th&gt;GB200 NVL72&lt;/th&gt;
&lt;th&gt;GB200 NVL4&lt;/th&gt;
&lt;th&gt;HGX B200&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;NVIDIA Blackwell GPUs | Grace CPUs&lt;/td&gt;
&lt;td&gt;72 | 36&lt;/td&gt;
&lt;td&gt;4 | 2&lt;/td&gt;
&lt;td&gt;8 | 0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;CPU Cores&lt;/td&gt;
&lt;td&gt;2,592 Arm® Neoverse V2 Cores&lt;/td&gt;
&lt;td&gt;144 Arm Neoverse V2 Cores&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total NVFP4 Tensor Core²&lt;/td&gt;
&lt;td&gt;1,440 | 720 PFLOPS&lt;/td&gt;
&lt;td&gt;80 | 40 PFLOPS&lt;/td&gt;
&lt;td&gt;144 | 72 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total FP8/FP6 Tensor Core²&lt;/td&gt;
&lt;td&gt;720 PFLOPS&lt;/td&gt;
&lt;td&gt;40 PFLOPS&lt;/td&gt;
&lt;td&gt;72 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Fast Memory&lt;/td&gt;
&lt;td&gt;31 TB&lt;/td&gt;
&lt;td&gt;1.8 TB&lt;/td&gt;
&lt;td&gt;1.4 TB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Memory Bandwidth&lt;/td&gt;
&lt;td&gt;576 TB/s&lt;/td&gt;
&lt;td&gt;32 TB/s&lt;/td&gt;
&lt;td&gt;62 TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total NVLink Bandwidth&lt;/td&gt;
&lt;td&gt;130 TB/s&lt;/td&gt;
&lt;td&gt;7.2 TB/s&lt;/td&gt;
&lt;td&gt;14.4 TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;individual specification 如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Specification&lt;/th&gt;
&lt;th&gt;GB200 NVL72&lt;/th&gt;
&lt;th&gt;GB200 NVL4&lt;/th&gt;
&lt;th&gt;HGX B200&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;FP4 Tensor Core&lt;/td&gt;
&lt;td&gt;20 PFLOPS&lt;/td&gt;
&lt;td&gt;20 PFLOPS&lt;/td&gt;
&lt;td&gt;18 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP8/FP6 Tensor Core²&lt;/td&gt;
&lt;td&gt;10 PFLOPS&lt;/td&gt;
&lt;td&gt;10 PFLOPS&lt;/td&gt;
&lt;td&gt;9 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;INT8 Tensor Core²&lt;/td&gt;
&lt;td&gt;10 POPS&lt;/td&gt;
&lt;td&gt;10 POPS&lt;/td&gt;
&lt;td&gt;9 POPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP16/BF16 Tensor Core²&lt;/td&gt;
&lt;td&gt;5 PFLOPS&lt;/td&gt;
&lt;td&gt;5 PFLOPS&lt;/td&gt;
&lt;td&gt;4.5 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TF32 Tensor Core²&lt;/td&gt;
&lt;td&gt;2.5 PFLOPS&lt;/td&gt;
&lt;td&gt;2.5 PFLOPS&lt;/td&gt;
&lt;td&gt;2.2 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32&lt;/td&gt;
&lt;td&gt;80 TFLOPS&lt;/td&gt;
&lt;td&gt;80 TFLOPS&lt;/td&gt;
&lt;td&gt;75 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP64 / FP64 Tensor Core&lt;/td&gt;
&lt;td&gt;40 TFLOPS&lt;/td&gt;
&lt;td&gt;40 TFLOPS&lt;/td&gt;
&lt;td&gt;37 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory &lt;br&gt;Bandwidth&lt;/td&gt;
&lt;td&gt;186 GB HBM3E &lt;br&gt;8 TB/s&lt;/td&gt;
&lt;td&gt;186 GB HBM3E &lt;br&gt;8 TB/s&lt;/td&gt;
&lt;td&gt;180 GB HBM3E &lt;br&gt;7.7 TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Multi-Instance GPU (MIG)&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decompression Engine&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;Yes&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decoders&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;7 NVDEC³ &lt;br&gt;7 nvJPEG&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thermal Design Power (TDP)&lt;/td&gt;
&lt;td&gt;Configurable up to 1,200 W&lt;/td&gt;
&lt;td&gt;Configurable up to 1,200 W&lt;/td&gt;
&lt;td&gt;Configurable up to 1,000 W&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interconnect&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;td&gt;Fifth-generation NVLink: 1.8 TB/s &lt;br&gt;PCIe Gen5: 128 GB/s&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Server Options&lt;/td&gt;
&lt;td&gt;NVIDIA GB200 NVL72 partner and NVIDIA-Certified Systems™ with 72 GPUs&lt;/td&gt;
&lt;td&gt;NVIDIA MGX partner and NVIDIA-Certified Systems&lt;/td&gt;
&lt;td&gt;NVIDIA HGX B200 partner and NVIDIA-Certified Systems with 8 GPUs&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="b300"&gt;&lt;a href="#b300" class="header-anchor"&gt;&lt;/a&gt;B300
&lt;/h2&gt;&lt;h3 id="b300-关键改进"&gt;&lt;a href="#b300-%e5%85%b3%e9%94%ae%e6%94%b9%e8%bf%9b" class="header-anchor"&gt;&lt;/a&gt;B300 关键改进
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;Blackwell 架构&lt;/li&gt;
&lt;li&gt;AI reasoning inference: 支持 test-time scaling, 对 attention layer 和 FLOPs 都有加速&lt;/li&gt;
&lt;li&gt;HBM3e: 支持更大的 batch size 和 throughput&lt;/li&gt;
&lt;li&gt;ConnectX-8 SuperNIC, 一个 host2 个 ConnectX-8 设备，支持 800Gb/s 的 GPU 之间通信&lt;/li&gt;
&lt;li&gt;Grace-CPU: 更强的表现和带宽&lt;/li&gt;
&lt;li&gt;5th NVIDIA NVLink: 更高的通信效率&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="b3100-技术规格"&gt;&lt;a href="#b3100-%e6%8a%80%e6%9c%af%e8%a7%84%e6%a0%bc" class="header-anchor"&gt;&lt;/a&gt;B3100 技术规格
&lt;/h3&gt;&lt;p&gt;system specification 如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;GB300 NVL72&lt;/th&gt;
&lt;th&gt;HGX B300&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Blackwell Ultra GPUs| Grace CPUs&lt;/td&gt;
&lt;td&gt;72 | 36&lt;/td&gt;
&lt;td&gt;8 | 0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;CPU Cores&lt;/td&gt;
&lt;td&gt;2,592 Arm Neoverse V2 Cores&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total FP4 Tensor Core&lt;/td&gt;
&lt;td&gt;1 1,440 PFLOPS | 1,080 PFLOPS&lt;/td&gt;
&lt;td&gt;144 PFLOPS | 108 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total FP8/FP6 Tensor Core&lt;/td&gt;
&lt;td&gt;2 720 PFLOPS&lt;/td&gt;
&lt;td&gt;72 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Fast Memory&lt;/td&gt;
&lt;td&gt;37 TB&lt;/td&gt;
&lt;td&gt;2.1 TB&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total Memory Bandwidth&lt;/td&gt;
&lt;td&gt;576 TB/s&lt;/td&gt;
&lt;td&gt;62 TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Total NVLink Switch Bandwidth&lt;/td&gt;
&lt;td&gt;130 TB/s&lt;/td&gt;
&lt;td&gt;14.4 TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;individual specification 如下&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;GB300 NVL72&lt;/th&gt;
&lt;th&gt;HGX B300&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;FP4 Tensor Core&lt;/td&gt;
&lt;td&gt;20 PFLOPS | 15 PFLOPS&lt;/td&gt;
&lt;td&gt;18 PFLOPS | 14 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP8/FP6 Tensor Core2&lt;/td&gt;
&lt;td&gt;10 PFLOPS&lt;/td&gt;
&lt;td&gt;9 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;INT8 Tensor Core2&lt;/td&gt;
&lt;td&gt;330 TOPS&lt;/td&gt;
&lt;td&gt;307 TOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP16/BF16 Tensor Core&lt;/td&gt;
&lt;td&gt;5 PFLOPS&lt;/td&gt;
&lt;td&gt;4.5 PLFOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TF32 Tensor Core2&lt;/td&gt;
&lt;td&gt;2.5 PFLOPS&lt;/td&gt;
&lt;td&gt;2.2 PFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP32&lt;/td&gt;
&lt;td&gt;80 TFLOPS&lt;/td&gt;
&lt;td&gt;75 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FP64/FP64 Tensor Core&lt;/td&gt;
&lt;td&gt;1.3 TFLOPS&lt;/td&gt;
&lt;td&gt;1.2 TFLOPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPU Memory | Bandwidth&lt;/td&gt;
&lt;td&gt;279 GB HBM3E | 8 TB/s&lt;/td&gt;
&lt;td&gt;270 GB HBM3E | 7.7 TB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Multi-Instance GPU (MIG)&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;td&gt;7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decompression Engine&lt;/td&gt;
&lt;td&gt;Yes&lt;/td&gt;
&lt;td&gt;Yes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decoders&lt;/td&gt;
&lt;td&gt;7 NVDEC3 &lt;br&gt;7 nvJPEG&lt;/td&gt;
&lt;td&gt;7 NVDEC3 &lt;br&gt;7 nvJPEG&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Max Thermal Design Power (TDP)&lt;/td&gt;
&lt;td&gt;Configurable up to 1,400 W&lt;/td&gt;
&lt;td&gt;Configurable up to 1,100 W&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interconnect&lt;/td&gt;
&lt;td&gt;Fifth-Generation NVLink: 1.8 TB/s &lt;br&gt;PCIe Gen6: 256 GB/s&lt;/td&gt;
&lt;td&gt;Fifth-Generation NVLink: 1.8 TB/s &lt;br&gt;PCIe Gen6: 256 GB/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Server Options&lt;/td&gt;
&lt;td&gt;NVIDIA GB300 NVL72 partner and &lt;br&gt;NVIDIA-Certified Systems™&lt;/td&gt;
&lt;td&gt;NVIDIA HGX B300 partner and &lt;br&gt;NVIDIA-Certified Systems&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="references"&gt;&lt;a href="#references" class="header-anchor"&gt;&lt;/a&gt;References
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://images.nvidia.com/content/volta-architecture/pdf/volta-architecture-whitepaper.pdf" target="_blank" rel="noopener"
&gt;V100 white paper&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.nvidia.com/en-us/data-center/a100/" target="_blank" rel="noopener"
&gt;A100&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://resources.nvidia.com/en-us-hopper-architecture/nvidia-h100-tensor-c" target="_blank" rel="noopener"
&gt;Hopper Architecture&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.nvidia.com/en-us/data-center/h100/" target="_blank" rel="noopener"
&gt;H100&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.nvidia.com/en-us/data-center/h200/" target="_blank" rel="noopener"
&gt;H200&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.nvidia.com/en-us/data-center/gb200-nvl72/" target="_blank" rel="noopener"
&gt;B200&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://resources.nvidia.com/en-us-blackwell-architecture/blackwell-ultra-datasheet" target="_blank" rel="noopener"
&gt;B300&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://resources.nvidia.com/en-us-gpu-resources/blackwell-ultra-datasheet?lx=CPwSfP" target="_blank" rel="noopener"
&gt;blackwell&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>