<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>GPU on mayulu的AI笔记</title><link>https://mayulu.co/tags/gpu/</link><description>Recent content in GPU on mayulu的AI笔记</description><generator>Hugo</generator><language>zhcn</language><copyright>Copyright © 2025–2026 mayulu All Rights Reserved</copyright><lastBuildDate>Wed, 22 Jul 2026 07:56:01 +0800</lastBuildDate><atom:link href="https://mayulu.co/tags/gpu/index.xml" rel="self" type="application/rss+xml"/><item><title>注意力机制其实是对数复杂度-重新思考计算复杂度</title><link>https://mayulu.co/posts/attention-is-logarithmic/</link><pubDate>Wed, 22 Jul 2026 07:56:01 +0800</pubDate><guid>https://mayulu.co/posts/attention-is-logarithmic/</guid><description>本文提出 Work-Depth 工作量 - 深度模型，指出传统时间复杂度不适用于多核并行硬件，以张量、矩阵乘、Softmax 等算子逐层推导，论证标准 Transformer 注意力机制并行计算深度为对数计算复杂度O(logn)。文章拆解各类深度学习基础运算并行瓶颈，分析缓存溢出导致实际性能退化的原因，结合 FlashAttention 分块思路给出工程解释，同时探讨该理论对 GPU、AI 芯片等下一代算力硬件设计的指导价值，适合大模型、高性能计算从业者阅读。</description></item></channel></rss>