Glean 拾遗
最近收录

2 条 · 按时间

07-30

从GPT-2到KimiK3:七年规模增长22,580倍的架构演进全解析

本文以代码和架构图为线索,系统回顾了从GPT-2(2019)到KimiK3(2026)的七年LLM架构演进。核心论点:进步不只是规模扩大,更是状态管理与检索机制的不断创新。文章依次讲解了标准Transformer的KV缓存瓶颈、线性注意力以固定状态交换精确检索、DeltaNet通过delta规则实现精确擦写、Gated DeltaNet结合衰减机制、KDA/Kimi Linear引入细粒度通道级门控,最终KimiK3通过混合KDA与MLA层、MoE、SiTU激活、以及块级Attention Residual(AttnRes)实现深度残差选择。适合对LLM内核架构感兴趣的一线工程师。

x.com · 27 min · DeltaNet · Kimi K3 · Linear Attention
07-17

Kimi K3 发布:2.8T参数开源模型,聚焦长周期编程与知识密集型工作

月之暗面发布了 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 架构,激活 896 个专家中的 16 个,扩展效率较 K2 提升约 2.5 倍。Kimi K3 支持原生视觉和 100 万 token 上下文窗口,在编程、知识工作、推理等基准上与 Claude Fable 5 和 GPT 5.6 Sol 竞争,虽整体仍稍逊,但在多个内部评测中表现突出。文章详细展示了其在 GPU 内核优化、编译器开发(MiniTriton)、3D 游戏开发、芯片设计(48 小时自主设计芯片)、科研复现(2 小时完成通常 1-2 周的工作)等场景的案例。Kimi K3 即日起可通过 Kimi.com、Kimi Work、Kimi Code 和 API 使用,完整模型权重将于 7 月 27 日开源。适合 AI 系统工程师、模型开发者、以及需要长周期代理工作能力的研究人员。

www.kimi.com · 19 min · Agent Engineering · Coding · Kimi K3