06:00
从GPT-2到KimiK3:七年规模增长22,580倍的架构演进全解析
From GPT2 to Kimi3: A 22,580x Scale-Up with Architectural Evolution
本文以代码和架构图为线索,系统回顾了从GPT-2(2019)到KimiK3(2026)的七年LLM架构演进。核心论点:进步不只是规模扩大,更是状态管理与检索机制的不断创新。文章依次讲解了标准Transformer的KV缓存瓶颈、线性注意力以固定状态交换精确检索、DeltaNet通过delta规则实现精确擦写、Gated DeltaNet结合衰减机制、KDA/Kimi Linear引入细粒度通道级门控,最终KimiK3通过混合KDA与MLA层、MoE、SiTU激活、以及块级Attention Residual(AttnRes)实现深度残差选择。适合对LLM内核架构感兴趣的一线工程师。