从事分布式、后端系统开发的工程师几乎没人不知道 Jeff Dean 的传世清单 Latency Numbers Every Programmer Should Know。这份诞生于十余年前的延迟对照表,用直观的纳秒、微妙、毫秒量级对比,讲清了CPU缓存、内存、SSD、磁盘、跨地域网络之间巨大的性能鸿沟,成为系统架构设计的速算手册,无数工程师把它打印贴在工位做性能预判基准。
2026年7月,Y Combinator 发布了与 Jeff Dean 访谈《Jeff Dean: The 1% Rule for Building in AI》。在访谈10分29秒处,主持人重提这份经典延迟清单,并邀请 Jeff Dean 给出AI大模型时代专属、适配2026硬件与推理场景的全新系统量化指标。
不同于传统分布式系统以时间延迟为核心标尺,AI系统的底层约束彻底切换为硬件带宽、运算能耗、多芯片互联损耗三大维度。本文基于访谈完整对话,系统化拆解 Jeff Dean 提出的AI时代必知底层数字、核心矛盾、硬件演进逻辑,并与传统系统延迟体系做横向对比。
AI时代系统架构必须掌握的四大核心量化指标
传统分布式系统的性能瓶颈集中在:L1/L2缓存缺失、磁盘寻道、跨数据中心/跨洲网络往返延迟;而在大模型训练、推理、Agent 长链路场景下,所有性能、成本、延迟问题,根源都落在加速器硬件(即GPU、TPU、NPU等并行数值计算设备的统称)存储层级、运算能耗与芯片互联上。Jeff Dean 将AI工程师必须熟记的底层数字归纳为三类核心观测维度:
1. 加速器存储层级带宽(决定算力利用率的根本)
算力芯片(TPU/GPU)内部存在多层存储,带宽分层直接决定Tensor Core、矩阵运算单元能否被“喂饱”,是推理/训练吞吐天花板:
- HBM高带宽内存 $\to$ 芯片片上SRAM高速缓存带宽
- 片上SRAM $\to$ ALU/Tensor Core矩阵计算单元带宽
核心逻辑:哪怕芯片理论FLOPS再高,只要上层存储带宽跟不上,计算单元会持续空转,硬件算力完全无法释放。
2. 单次运算能耗(AI系统新的统一度量单位)
Jeff Dean 在访谈中明确提出:能耗才是衡量AI系统的底层基准,延迟只是能耗约束下的表层结果。 指标定义:FP8/FP16/INT8 单次数值乘加(MAC)操作消耗能量,单位为皮焦耳(pJ);单次运算能耗仅1pJ级别,而数据搬运能耗高出三个数量级,形成AI系统最核心的物理鸿沟。
3. 芯片间互联带宽与规模衰减曲线
AI训练动辄数百至万级加速器芯片集群,互联网络的带宽损耗直接限制集群扩展上限:
- 小规模近距离互联:同机柜/Pod内数百颗芯片的高速互联带宽、基础往返延迟;
- 超大规模衰减:集群从512颗拓展至10000颗芯片时,跨机柜、跨网络层级带来的带宽衰减、通信开销爆炸式上涨; 集群规模越大,通信损耗占整体算力成本的比例越高,这也是超大模型训练必须做张量并行、流水线并行、重计算优化的底层原因。
4. 2026真实可落地的LLM全链路延迟参考
社区基于原延迟清单补充了当代大模型推理实测延迟,和Jeff Dean访谈观点相互印证:
| 推理操作 | 耗时 | 场景说明 |
|---|---|---|
| 消费级GPU小模型单Token生成 | 15ms | 本地小参数量模型 |
| 云端前沿大模型单Token生成 | 20ms | 线上托管基础模型 |
| CPU本地跑小模型单Token | 100ms | 无加速卡纯CPU推理 |
| 本地小模型首Token输出 | 75ms | 短Prompt无缓存 |
| 通用推理硬件首Token | 250ms | 标准化云端推理集群 |
| 前沿大模型无缓存首Token | 1000ms | 超长上下文无预热 |
| 大模型长上下文预填充 | 10000ms | 100K输入Token |
| 带深度思考的推理响应 | 30000ms | Agent多轮反思链路 |
数据搬运能耗是计算的1000倍
访谈中最具颠覆性的结论(12分28秒),也是所有AI架构、推理优化、硬件设计的出发点:
将模型权重、中间激活值从HBM高带宽内存搬运至计算单元的能耗,是执行一次数学乘加运算的1000倍。
千倍能耗差如何塑造现代AI工程设计
(1)Batch批处理机制的本质是摊薄搬运成本
正因为单次数据搬运成本极高,行业普遍采用批量Token/批量请求合并处理:同一份权重数据从HBM搬运一次,同时服务数十、数百个Token的计算,把千倍级搬运能耗平摊到批量计算上,大幅降低单Token平均能耗与成本。
(2)批处理与低延迟Agent场景天然冲突
交互式对话、AI智能体、实时工具调用等场景,对首Token延迟、单请求响应速度有硬性要求,无法堆积大Batch。此时批优化完全失效,数据搬运的高额能耗会直接拉高单Token成本与响应耗时。Jeff Dean 判断:面向Agent低延迟场景,不能依赖传统批处理,必须从硬件架构降低数据移动开销。
(3)低精度量化是折中解法
FP8/INT8/三值量化等低精度运算,核心收益不只是算力提升,而是减少权重与激活值的数据体积,同等带宽下降低数据搬运总量,间接削减千倍级的IO能耗开销,是现阶段通用GPU/TPU的低成本优化手段。
AI硬件与系统架构未来演进方向
Jeff Dean 从带宽、能耗、互联三大底层约束,推导出未来AI基础设施两大核心发展趋势:
专用推理硬件将成为刚需,可实现50倍延迟下降
训练与推理存在完全不同的性能诉求:
- 训练任务对延迟容忍度高,优先追求超大批量、高吞吐;
- 推理是Agent、C端产品、企业自动化系统的核心瓶颈,低延迟直接决定产品可用边界。
专为低精度运算、最小化数据搬运设计的专用推理芯片,能规避通用GPU冗余的数据搬运流程,实现最高50倍推理延迟降低、数十倍能效提升,是解决实时Agent系统性能痛点的核心方案。
大量模型层面问题,本质是系统硬件能耗约束妥协
很多算法工程师会把训练收敛速度、上下文窗口限制、序列长度截断、蒸馏轻量化等问题归为模型算法缺陷,但 Jeff Dean 指出:绝大多数设计妥协,根源是底层IO与能耗物理限制。 举个典型例子:长上下文窗口会成倍增加激活值存储与搬运量,能耗成本指数上涨;不是模型无法支持百万级上下文,而是现有硬件无法承载对应的海量数据搬运能耗。所有算法、框架优化,最终都是在硬件能耗上限内做取舍。
传统分布式系统 vs AI时代系统核心标尺
| 对比维度 | 传统分布式系统(2000s Jeff Dean原版清单) | AI大模型系统(2026 Jeff Dean新版指标) |
|---|---|---|
| 核心性能瓶颈 | L1/L2缓存缺失、磁盘寻道、跨洲网络往返 | HBM与计算单元带宽、万卡集群互联损耗 |
| 统一度量标准 | 绝对时间:纳秒/微秒/毫秒延迟 | 运算能耗:皮焦耳pJ,延迟是衍生结果 |
| 核心量级鸿沟 | 内存访问比L1缓存慢200倍、磁盘比内存慢80倍 | 数据搬运能耗 = 单次计算能耗 × 1000 |
| 经典优化解法 | 全内存存储替代磁盘(Google早年索引方案) | 专用低延迟推理芯片、最小化数据移动架构 |
| 架构设计重心 | 减少磁盘、跨机房网络IO | 减少芯片内部、芯片间数据传输量 |
总结
十余年前,一张缓存、磁盘、网络延迟对照表,教会一代系统工程师用量级思维预判性能瓶颈;2026年 Jeff Dean 给出的AI新版底层数字,则把衡量标尺从“时间延迟”切换为“硬件能耗与带宽”。
对AI架构师、推理引擎开发者、大模型创业团队来说,这份指标的核心价值和原版延迟清单完全一致:建立底层物理量级直觉。当你理解“搬数据比算数据贵1000倍”这个基础事实,批处理、量化、专用推理芯片、张量并行、重计算等所有行业主流优化方案,都会拥有统一、清晰的底层逻辑支撑,不再是零散的工程技巧。
未来所有面向实时Agent、长链路自动化的AI产品,性能与成本的胜负,最终都会落在存储带宽、数据搬运能耗、多芯片互联损耗这三组基础数字上。
完整的延迟表(2012原版+2026年LLM)
| 操作 | 纳秒 (ns) | 微秒 (μs) | 毫秒 (ms) | 说明 |
|---|---|---|---|---|
| L1 缓存引用 | 0.5 | — | — | — |
| 分支预测失败 | 5 | — | — | — |
| L2 缓存引用 | 7 | — | — | 是 L1 缓存的 14 倍 |
| 互斥锁加锁 / 解锁 | 25 | — | — | — |
| 主内存引用 | 100 | — | — | 是 L2 缓存的 20 倍,是 L1 缓存的 200 倍 |
| 用 Zippy 压缩 1KB 数据 | 3,000 | 3 | — | — |
| 通过 1Gbps 网络发送 1KB 数据 | 10,000 | 10 | — | — |
| 从 SSD 随机读取 4KB 数据 | 150,000 | 150 | — | SSD 带宽约 1GB/s |
| 从内存顺序读取 1MB 数据 | 250,000 | 250 | — | — |
| 同一数据中心内往返延迟 | 500,000 | 500 | — | — |
| 从 SSD 顺序读取 1MB 数据 | 1,000,000 | 1,000 | 1 | SSD 带宽约 1GB/s,是内存的 4 倍耗时 |
| 磁盘寻道 | 10,000,000 | 10,000 | 10 | 是数据中心内往返的 20 倍 |
| 本地 LLM 生成 1 个 Token | 15,000,000 | 15,000 | 15 | 消费级 GPU 上的小模型(2026 年) |
| 从磁盘顺序读取 1MB 数据 | 20,000,000 | 20,000 | 20 | 是内存的 80 倍耗时,是 SSD 的 20 倍耗时 |
| 前沿大模型生成 1 个 Token | 20,000,000 | 20,000 | 20 | 云端托管模型输出(2026 年) |
| 本地 LLM 首 Token 输出延迟 | 75,000,000 | 75,000 | 75 | 小模型、短 Prompt(2026 年) |
| 本地 LLM(CPU)生成 1 个 Token | 100,000,000 | 100,000 | 100 | 小模型、无 GPU(2026 年) |
| 数据包从加州到荷兰再返回加州 | 150,000,000 | 150,000 | 150 | — |
| 快速 LLM 首 Token 输出延迟 | 250,000,000 | 250,000 | 250 | 专用推理硬件(2026 年) |
| 前沿大模型首 Token 输出延迟 | — | — | 1,000 | 短 Prompt、无缓存(2026 年) |
| 前沿大模型短回复延迟 | — | — | 3,000 | 约 100 个输出 Token(2026 年) |
| 前沿大模型长上下文预填充延迟 | — | — | 10,000 | 约 10 万输入 Token、无缓存(2026 年) |
| 前沿大模型推理(带思考)响应延迟 | — | — | 30,000 | 单次调用含思考链路(2026 年) |
参考链接
- Jeff Dean 经典原文《Latency Numbers Every Programmer Should Know》:https://gist.github.com/jboner/2841832
- YC 2026访谈视频《Jeff Dean: The 1% Rule for Building in AI》:https://www.youtube.com/watch?v=CxXgV54KzpQ(视频10分29秒处)