返回技术笔记

AI 硬件

面向 LLM 推理的 AI 芯片架构

梳理现代语言模型服务背后的计算、存储与互连约束。

LLM 推理在加速器上形成两类不同工作负载。Prefill 并行处理大量提示 token,能够高效使用密集矩阵乘法;Decode 顺序生成 token,并反复读取模型权重与缓存数据。峰值算力出色的芯片,在 Decode 阶段仍可能表现不佳。

存储墙

Decode 的算术强度通常较低。每一步都会访问大部分模型,却只产生相对有限的单位字节计算量。因此,高带宽内存、缓存层级与数据放置和理论 FLOPS 同样重要。

正确的问题不是“加速器有多快”,而是“该工作负载能以多快速度搬运下一次操作需要的数据”。

架构层次

计算阵列

张量单元决定哪些数据类型与矩阵形状能够高效执行。只有硬件与算子能够直接运行低精度路径,且不需要昂贵转换时,模型量化才会真正产生价值。

片上存储

寄存器与 SRAM 能以远低于外部存储的能耗和延迟为计算阵列供数。分块策略决定算子能否有效复用数据,还是需要反复读取。

高带宽内存

HBM 容量决定模型和缓存是否能够驻留,带宽则塑造 Decode 速度。容量与带宽需要分别衡量,因为量化等方法会以不同方式改善二者。

互连

大型模型需要跨设备运行。集合通信、拓扑与同步会影响张量并行和流水线执行。在集群规模上,网络行为本身就是加速器架构的一部分。

评测服务系统

有效评测需要明确模型、精度、上下文分布、批处理策略、延迟目标与并行方案,并分别报告 Prefill 与 Decode。没有延迟约束的峰值吞吐可能掩盖用户无法接受的排队时间。

硬件感知的模型设计越早开始越有效。注意力结构、激活规模、稀疏性与精度选择,共同决定最终系统必须支持的数据移动模式。