免责声明:所有段落均由人类撰写。表格由人工智能在人类监督下生成。
GPT-6 Astra 登场。据 The Information 报道,它采用了循环变压器架构。相较于 GPT5.6,这是一个重大改进。人们认为,这个模型标志着我们已进入通用人工智能时代。
大语言模型拥有多层数据,称为权重。在推理过程中,每一层只计算一次。因此,将权重从高带宽内存(HBM)传输到芯片是一个主要瓶颈,因为要生成一个 token,你需要将整个层移入芯片,计算一次,移出,再移入下一层。因此,内存带宽一直是推理的首要瓶颈。
循环变压器改变了这一点。它不再让每一层只计算一次,而是多次计算同一层,从而在不那么依赖内存带宽的情况下提升模型智能。带宽依然重要,但不再那么关键。
由于循环变压器架构通过多次计算同一层来提升智能,你无需大幅增加模型参数量即可达到同等智能水平。例如,一个 250GB 的万亿参数循环变压器模型,其智能程度可能与当今的 1 万亿参数模型相当。
总而言之,循环变压器架构降低了内存带宽和容量的瓶颈,同时增加了对更多算力的需求。
以下是赢家与输家:
| 硬件领域 | 循环变压器影响 | 赢家 | 输家 / 受压方 |
|---|---|---|---|
| AI 算力 | ↑↑↑ | 英伟达、AMD、谷歌 TPU、台积电 | 低算力架构 |
| HBM 容量 | 每 FLOP ↓ | 算力供应商、超大规模企业 | SK 海力士、美光、三星 |
| HBM 带宽 | 每 FLOP ↓ | 算力供应商、超大规模企业 | SK 海力士、美光、三星 |
| 片上 SRAM / 缓存 | ↑↑↑ | 台积电、定制 AI ASIC、SRAM IP 供应商、三星、英特尔、Cerebras | HBM 相对不那么重要 |
| GPU 间带宽 | ↓ | 超大规模企业 | 英伟达 NVLink/NVSwitch、博通/迈威尔网络 |
| 动态 / 自适应算力 | ↑↑ | 英伟达 CUDA、谷歌 TPU/XLA、AMD ROCm | 灵活性较低的加速器栈 |
| 先进封装 | 转向算力 + 缓存 | 台积电 | 以 HBM 为主的封装相对不那么重要 |
| 加速器总需求 | 可能 ↑ | 所有 AI 硬件供应商 | Michael Burry、Reddit r/stocks |
| 电力 + 散热 | ↑ | Vertiv、Eaton、Schneider | 无明显输家 |
另请注意,循环变压器架构继续证明了"苦涩教训"的正确性。https://en.wikipedia.org/wiki/Bitter_lesson
评论 (0)