免责声明:所有段落均由人类撰写。表格由人工智能在人类监督下生成。

GPT-6 Astra 登场。据 The Information 报道,它采用了循环变压器架构。相较于 GPT5.6,这是一个重大改进。人们认为,这个模型标志着我们已进入通用人工智能时代。

大语言模型拥有多层数据,称为权重。在推理过程中,每一层只计算一次。因此,将权重从高带宽内存(HBM)传输到芯片是一个主要瓶颈,因为要生成一个 token,你需要将整个层移入芯片,计算一次,移出,再移入下一层。因此,内存带宽一直是推理的首要瓶颈。

循环变压器改变了这一点。它不再让每一层只计算一次,而是多次计算同一层,从而在不那么依赖内存带宽的情况下提升模型智能。带宽依然重要,但不再那么关键。

由于循环变压器架构通过多次计算同一层来提升智能,你无需大幅增加模型参数量即可达到同等智能水平。例如,一个 250GB 的万亿参数循环变压器模型,其智能程度可能与当今的 1 万亿参数模型相当。

总而言之,循环变压器架构降低了内存带宽和容量的瓶颈,同时增加了对更多算力的需求。

以下是赢家与输家:

硬件领域 循环变压器影响 赢家 输家 / 受压方
AI 算力 ↑↑↑ 英伟达、AMD、谷歌 TPU、台积电 低算力架构
HBM 容量 每 FLOP ↓ 算力供应商、超大规模企业 SK 海力士、美光、三星
HBM 带宽 每 FLOP ↓ 算力供应商、超大规模企业 SK 海力士、美光、三星
片上 SRAM / 缓存 ↑↑↑ 台积电、定制 AI ASIC、SRAM IP 供应商、三星、英特尔、Cerebras HBM 相对不那么重要
GPU 间带宽 超大规模企业 英伟达 NVLink/NVSwitch、博通/迈威尔网络
动态 / 自适应算力 ↑↑ 英伟达 CUDA、谷歌 TPU/XLA、AMD ROCm 灵活性较低的加速器栈
先进封装 转向算力 + 缓存 台积电 以 HBM 为主的封装相对不那么重要
加速器总需求 可能 ↑ 所有 AI 硬件供应商 Michael Burry、Reddit r/stocks
电力 + 散热 Vertiv、Eaton、Schneider 无明显输家

另请注意,循环变压器架构继续证明了"苦涩教训"的正确性。https://en.wikipedia.org/wiki/Bitter_lesson