<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>高性能推理 on mayulu的AI笔记</title><link>https://mayulu.co/tags/%E9%AB%98%E6%80%A7%E8%83%BD%E6%8E%A8%E7%90%86/</link><description>Recent content in 高性能推理 on mayulu的AI笔记</description><generator>Hugo</generator><language>zhcn</language><copyright>Copyright © 2025–2026 mayulu All Rights Reserved</copyright><lastBuildDate>Wed, 29 Jul 2026 10:53:39 +0800</lastBuildDate><atom:link href="https://mayulu.co/tags/%E9%AB%98%E6%80%A7%E8%83%BD%E6%8E%A8%E7%90%86/index.xml" rel="self" type="application/rss+xml"/><item><title>Sebastian Raschka 对 Kimi K3 架构的观察笔记要点</title><link>https://mayulu.co/posts/rasbt-kimi-k3-arch/</link><pubDate>Wed, 29 Jul 2026 08:53:39 +0800</pubDate><guid>https://mayulu.co/posts/rasbt-kimi-k3-arch/</guid><description>本文全文翻译 Sebastian Raschka 解读的开源超大模型 Kimi K3 架构，该模型由 48B 参数扩容至 2.8T，沿用前代 Kimi Linear 核心设计，新增 LatentMoE 提升效率，搭配多头隐注意力、注意力残差模块优化性能。模型摒弃 RoPE，全域采用 NoPE，原生支持多模态；该设计小幅提升任务效果，仅轻微增加训练与推理开销，是兼顾性能与效率的前沿大模型。</description></item><item><title>注意力机制其实是对数复杂度-重新思考计算复杂度</title><link>https://mayulu.co/posts/attention-is-logarithmic/</link><pubDate>Wed, 22 Jul 2026 07:56:01 +0800</pubDate><guid>https://mayulu.co/posts/attention-is-logarithmic/</guid><description>本文提出 Work-Depth 工作量 - 深度模型，指出传统时间复杂度不适用于多核并行硬件，以张量、矩阵乘、Softmax 等算子逐层推导，论证标准 Transformer 注意力机制并行计算深度为对数计算复杂度O(logn)。文章拆解各类深度学习基础运算并行瓶颈，分析缓存溢出导致实际性能退化的原因，结合 FlashAttention 分块思路给出工程解释，同时探讨该理论对 GPU、AI 芯片等下一代算力硬件设计的指导价值，适合大模型、高性能计算从业者阅读。</description></item></channel></rss>