异星心智

我们尚未完全理解的智能 2023 年年中,在 “RLSlow” 研究项目中,我们拿到第一批实验结果。这些结果让我们确信,我们可以扩大推理模型的训练规模,释放预训练模型构建自身思维链的能力。当晚,我与希蒙(Szymon)留在办公室。我们没有畅想这项技术将会带来惊艳的基准测试分数、各类产品或是科研突破,而是在消化一个令人清醒的现实:在我们的有生之年,就会出现显著超越人类智慧的机器,而这类系统的雏形已经出现。我们也在思索,该如何向世人点明这件事的重大意义。 ...

September 7, 2026 · mayulu

Sebastian Raschka 对 Kimi K3 架构的观察笔记要点

站主按:Sebastian Raschka(塞巴斯蒂安.拉什卡)是全球极具影响力的机器学习、大模型科普作家与研究者,拥有计算生物学博士学位,横跨学术界与产业界。他曾任职威斯康星大学麦迪逊分校统计学终身助理教授,如今在 AI 企业 Lightning AI 担任大模型研究工程师,专注 LLM 架构、推理模型与落地工程实践。他著有多本人工智能经典教材:全球畅销书《Python 机器学习》、爆款实战书籍《从零构建大模型》,配套开源项目 LLMs-from-scratch 在 GitHub 收获超高星标,用清晰代码拆解大模型底层原理。他长期深耕前沿大模型架构解读,撰写大量专业笔记剖析 Kimi、DeepSeek、Nemotron 等主流开源模型,擅长把复杂 AI 理论通俗化,是开发者、科研人员公认的优质学习资源创作者。 ...

July 29, 2026 · mayulu

注意力机制其实是对数复杂度-重新思考计算复杂度

并行计算场景下,传统时间复杂度模型完全失效 本文将论证:相比传统时间复杂度分析,计算工作量-计算深度(Work-Depth)模型才是更适合分析算法性能的理论工具。 讨论算法快慢时,大家第一反应永远是时间复杂度。 ...

July 22, 2026 · mayulu

你和你的研究 - 理查德.汉明那场经典演讲的完整记录

理查德・汉明 贝尔通信研究所学术研讨会演讲稿整理稿 1986 年 3 月 7 日 J. F. 凯泽 贝尔通信研究所 新泽西州莫里斯敦市南街 445 号,邮编 07962-1910 邮箱:jfk@bellcore.com ...

July 20, 2026 · mayulu

循环工程:Claude官方入门指南

本文将为你讲解 Claude Code 团队对智能体循环(agentic loops)的定义,手把手教你从回合式循环,逐步进阶到目标式、时间式、主动式循环,并说明各类循环的适用场景。 ...

July 14, 2026 · mayulu