从事分布式、后端系统开发的工程师几乎没人不知道 Jeff Dean 的传世清单 Latency Numbers Every Programmer Should Know。这份诞生于十余年前的延迟对照表,用直观的纳秒、微妙、毫秒量级对比,讲清了CPU缓存、内存、SSD、磁盘、跨地域网络之间巨大的性能鸿沟,成为系统架构设计的速算手册,无数工程师把它打印贴在工位做性能预判基准。

2026年7月,Y Combinator 发布了与 Jeff Dean 访谈《Jeff Dean: The 1% Rule for Building in AI》。在访谈10分29秒处,主持人重提这份经典延迟清单,并邀请 Jeff Dean 给出AI大模型时代专属、适配2026硬件与推理场景的全新系统量化指标

不同于传统分布式系统以时间延迟为核心标尺,AI系统的底层约束彻底切换为硬件带宽、运算能耗、多芯片互联损耗三大维度。本文基于访谈完整对话,系统化拆解 Jeff Dean 提出的AI时代必知底层数字、核心矛盾、硬件演进逻辑,并与传统系统延迟体系做横向对比。


AI时代系统架构必须掌握的四大核心量化指标

传统分布式系统的性能瓶颈集中在:L1/L2缓存缺失、磁盘寻道、跨数据中心/跨洲网络往返延迟;而在大模型训练、推理、Agent 长链路场景下,所有性能、成本、延迟问题,根源都落在加速器硬件(即GPU、TPU、NPU等并行数值计算设备的统称)存储层级、运算能耗与芯片互联上。Jeff Dean 将AI工程师必须熟记的底层数字归纳为三类核心观测维度:


1. 加速器存储层级带宽(决定算力利用率的根本)

算力芯片(TPU/GPU)内部存在多层存储,带宽分层直接决定Tensor Core、矩阵运算单元能否被“喂饱”,是推理/训练吞吐天花板:

  • HBM高带宽内存 $\to$ 芯片片上SRAM高速缓存带宽
  • 片上SRAM $\to$ ALU/Tensor Core矩阵计算单元带宽

核心逻辑:哪怕芯片理论FLOPS再高,只要上层存储带宽跟不上,计算单元会持续空转,硬件算力完全无法释放。

2. 单次运算能耗(AI系统新的统一度量单位)

Jeff Dean 在访谈中明确提出:能耗才是衡量AI系统的底层基准,延迟只是能耗约束下的表层结果。 指标定义:FP8/FP16/INT8 单次数值乘加(MAC)操作消耗能量,单位为皮焦耳(pJ);单次运算能耗仅1pJ级别,而数据搬运能耗高出三个数量级,形成AI系统最核心的物理鸿沟。

3. 芯片间互联带宽与规模衰减曲线

AI训练动辄数百至万级加速器芯片集群,互联网络的带宽损耗直接限制集群扩展上限:

  • 小规模近距离互联:同机柜/Pod内数百颗芯片的高速互联带宽、基础往返延迟;
  • 超大规模衰减:集群从512颗拓展至10000颗芯片时,跨机柜、跨网络层级带来的带宽衰减、通信开销爆炸式上涨; 集群规模越大,通信损耗占整体算力成本的比例越高,这也是超大模型训练必须做张量并行、流水线并行、重计算优化的底层原因。

4. 2026真实可落地的LLM全链路延迟参考

社区基于原延迟清单补充了当代大模型推理实测延迟,和Jeff Dean访谈观点相互印证:

推理操作耗时场景说明
消费级GPU小模型单Token生成15ms本地小参数量模型
云端前沿大模型单Token生成20ms线上托管基础模型
CPU本地跑小模型单Token100ms无加速卡纯CPU推理
本地小模型首Token输出75ms短Prompt无缓存
通用推理硬件首Token250ms标准化云端推理集群
前沿大模型无缓存首Token1000ms超长上下文无预热
大模型长上下文预填充10000ms100K输入Token
带深度思考的推理响应30000msAgent多轮反思链路

数据搬运能耗是计算的1000倍

访谈中最具颠覆性的结论(12分28秒),也是所有AI架构、推理优化、硬件设计的出发点:

将模型权重、中间激活值从HBM高带宽内存搬运至计算单元的能耗,是执行一次数学乘加运算的1000倍。

千倍能耗差如何塑造现代AI工程设计

(1)Batch批处理机制的本质是摊薄搬运成本

正因为单次数据搬运成本极高,行业普遍采用批量Token/批量请求合并处理:同一份权重数据从HBM搬运一次,同时服务数十、数百个Token的计算,把千倍级搬运能耗平摊到批量计算上,大幅降低单Token平均能耗与成本。

(2)批处理与低延迟Agent场景天然冲突

交互式对话、AI智能体、实时工具调用等场景,对首Token延迟、单请求响应速度有硬性要求,无法堆积大Batch。此时批优化完全失效,数据搬运的高额能耗会直接拉高单Token成本与响应耗时。Jeff Dean 判断:面向Agent低延迟场景,不能依赖传统批处理,必须从硬件架构降低数据移动开销

(3)低精度量化是折中解法

FP8/INT8/三值量化等低精度运算,核心收益不只是算力提升,而是减少权重与激活值的数据体积,同等带宽下降低数据搬运总量,间接削减千倍级的IO能耗开销,是现阶段通用GPU/TPU的低成本优化手段。


AI硬件与系统架构未来演进方向

Jeff Dean 从带宽、能耗、互联三大底层约束,推导出未来AI基础设施两大核心发展趋势:

专用推理硬件将成为刚需,可实现50倍延迟下降

训练与推理存在完全不同的性能诉求:

  • 训练任务对延迟容忍度高,优先追求超大批量、高吞吐;
  • 推理是Agent、C端产品、企业自动化系统的核心瓶颈,低延迟直接决定产品可用边界。

专为低精度运算、最小化数据搬运设计的专用推理芯片,能规避通用GPU冗余的数据搬运流程,实现最高50倍推理延迟降低、数十倍能效提升,是解决实时Agent系统性能痛点的核心方案。


大量模型层面问题,本质是系统硬件能耗约束妥协

很多算法工程师会把训练收敛速度、上下文窗口限制、序列长度截断、蒸馏轻量化等问题归为模型算法缺陷,但 Jeff Dean 指出:绝大多数设计妥协,根源是底层IO与能耗物理限制。 举个典型例子:长上下文窗口会成倍增加激活值存储与搬运量,能耗成本指数上涨;不是模型无法支持百万级上下文,而是现有硬件无法承载对应的海量数据搬运能耗。所有算法、框架优化,最终都是在硬件能耗上限内做取舍。


传统分布式系统 vs AI时代系统核心标尺

对比维度传统分布式系统(2000s Jeff Dean原版清单)AI大模型系统(2026 Jeff Dean新版指标)
核心性能瓶颈L1/L2缓存缺失、磁盘寻道、跨洲网络往返HBM与计算单元带宽、万卡集群互联损耗
统一度量标准绝对时间:纳秒/微秒/毫秒延迟运算能耗:皮焦耳pJ,延迟是衍生结果
核心量级鸿沟内存访问比L1缓存慢200倍、磁盘比内存慢80倍数据搬运能耗 = 单次计算能耗 × 1000
经典优化解法全内存存储替代磁盘(Google早年索引方案)专用低延迟推理芯片、最小化数据移动架构
架构设计重心减少磁盘、跨机房网络IO减少芯片内部、芯片间数据传输量

总结

十余年前,一张缓存、磁盘、网络延迟对照表,教会一代系统工程师用量级思维预判性能瓶颈;2026年 Jeff Dean 给出的AI新版底层数字,则把衡量标尺从“时间延迟”切换为“硬件能耗与带宽”。

对AI架构师、推理引擎开发者、大模型创业团队来说,这份指标的核心价值和原版延迟清单完全一致:建立底层物理量级直觉。当你理解“搬数据比算数据贵1000倍”这个基础事实,批处理、量化、专用推理芯片、张量并行、重计算等所有行业主流优化方案,都会拥有统一、清晰的底层逻辑支撑,不再是零散的工程技巧。

未来所有面向实时Agent、长链路自动化的AI产品,性能与成本的胜负,最终都会落在存储带宽、数据搬运能耗、多芯片互联损耗这三组基础数字上。


完整的延迟表(2012原版+2026年LLM)

操作纳秒 (ns)微秒 (μs)毫秒 (ms)说明
L1 缓存引用0.5
分支预测失败5
L2 缓存引用7是 L1 缓存的 14 倍
互斥锁加锁 / 解锁25
主内存引用100是 L2 缓存的 20 倍,是 L1 缓存的 200 倍
用 Zippy 压缩 1KB 数据3,0003
通过 1Gbps 网络发送 1KB 数据10,00010
从 SSD 随机读取 4KB 数据150,000150SSD 带宽约 1GB/s
从内存顺序读取 1MB 数据250,000250
同一数据中心内往返延迟500,000500
从 SSD 顺序读取 1MB 数据1,000,0001,0001SSD 带宽约 1GB/s,是内存的 4 倍耗时
磁盘寻道10,000,00010,00010是数据中心内往返的 20 倍
本地 LLM 生成 1 个 Token15,000,00015,00015消费级 GPU 上的小模型(2026 年)
从磁盘顺序读取 1MB 数据20,000,00020,00020是内存的 80 倍耗时,是 SSD 的 20 倍耗时
前沿大模型生成 1 个 Token20,000,00020,00020云端托管模型输出(2026 年)
本地 LLM 首 Token 输出延迟75,000,00075,00075小模型、短 Prompt(2026 年)
本地 LLM(CPU)生成 1 个 Token100,000,000100,000100小模型、无 GPU(2026 年)
数据包从加州到荷兰再返回加州150,000,000150,000150
快速 LLM 首 Token 输出延迟250,000,000250,000250专用推理硬件(2026 年)
前沿大模型首 Token 输出延迟1,000短 Prompt、无缓存(2026 年)
前沿大模型短回复延迟3,000约 100 个输出 Token(2026 年)
前沿大模型长上下文预填充延迟10,000约 10 万输入 Token、无缓存(2026 年)
前沿大模型推理(带思考)响应延迟30,000单次调用含思考链路(2026 年)

参考链接

  1. Jeff Dean 经典原文《Latency Numbers Every Programmer Should Know》:https://gist.github.com/jboner/2841832
  2. YC 2026访谈视频《Jeff Dean: The 1% Rule for Building in AI》:https://www.youtube.com/watch?v=CxXgV54KzpQ(视频10分29秒处)