站主按:Sebastian Raschka(塞巴斯蒂安.拉什卡)是全球极具影响力的机器学习、大模型科普作家与研究者,拥有计算生物学博士学位,横跨学术界与产业界。他曾任职威斯康星大学麦迪逊分校统计学终身助理教授,如今在 AI 企业 Lightning AI 担任大模型研究工程师,专注 LLM 架构、推理模型与落地工程实践。他著有多本人工智能经典教材:全球畅销书《Python 机器学习》、爆款实战书籍《从零构建大模型》,配套开源项目 LLMs-from-scratch 在 GitHub 收获超高星标,用清晰代码拆解大模型底层原理。他长期深耕前沿大模型架构解读,撰写大量专业笔记剖析 Kimi、DeepSeek、Nemotron 等主流开源模型,擅长把复杂 AI 理论通俗化,是开发者、科研人员公认的优质学习资源创作者。

以下是昨日重磅开源权重模型发布配套的 Kimi K3 架构图解笔记,附带若干观察与思考。

Sebastian Raschka画的架构图系列是经典

Kimi K3架构图

诚然这套架构看着相对繁杂,但本质是其去年发布的Kimi Linear模型的量产放大版本(参数量从480亿扩容至2.8万亿;K3是目前参数量规模最大的开源权重模型)。

相较于Kimi Linear,本次唯一新增模块为隐混合专家模块(LatentMoE)。下方架构图内容已十分拥挤,因此我在图中略去了该模块;但它和Nemotron 3 Ultra所采用的隐混合专家方案完全一致(感兴趣可翻阅我的大模型架构图鉴查看对应图解)。该模块核心思路与多头隐式注意力机制类似:对大规模线性层做降维压缩处理。

和Nemotron 3、深度求索V4等主流模型一致,Kimi K3整体设计导向更高的推理效率。模型大量采用优化效率的全新组件替换原有结构:用隐混合专家(LatentMoE)替代传统混合专家(MoE);用多头隐式注意力、Kimi差分注意力替换标准注意力机制。(若想了解更多细节,我的架构图鉴里也配套了简短教程与解读文章)。

所有组件改动里,注意力残差连接是唯一不以提升推理效率为目标的优化项。深度求索V4通过流形约束超连接(mHC)拓宽残差通路以优化模型,而注意力残差连接同样用于强化残差链路,但实现逻辑有所区别:mHC的思路是加宽残差通道;注意力残差连接(Kimi Linear已搭载该设计)则实现跨层残差互通,且会通过注意力分数作为权重,衡量每层残差信息的重要程度与贡献占比**。根据技术报告数据,该设计能够稳定小幅降低验证损失、提升下游任务效果;代价是训练成本增加约4%,推理成本上涨2%。

一个颇具亮点的设计:Kimi K3彻底移除所有旋转位置编码(RoPE)层,全程统一采用无位置编码(NoPE)方案(该设计同样承袭自Kimi Linear)。其他主流架构近期普遍采用混合方案:滑动窗口等局部注意力层使用RoPE,全局注意力层使用NoPE。此前虽有少数模型全程只用NoPE,但据我所知,Kimi K3是首个采用该纯无位置编码设计的顶尖超大参数量模型。

另外Kimi K3原生支持多模态输入,这点十分亮眼!

技术报告中还有不少值得一提的训练细节,但以上就是架构层面的全部解读。整体而言,这次模型发布成果十分出色。

关键术语注释

  1. LatentMoE:隐式混合专家模型
  2. RoPE:旋转位置编码
  3. NoPE:无位置编码
  4. mHC (manifold-constrained Hyper-Connections):流形约束超连接
  5. sliding window attention:滑动窗口注意力

原文链接

https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html

扩展阅读

https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison