Glean 拾遗
最近收录

1 条 · 按时间

07-30

从GPT-2到KimiK3:七年规模增长22,580倍的架构演进全解析

本文以代码和架构图为线索,系统回顾了从GPT-2(2019)到KimiK3(2026)的七年LLM架构演进。核心论点:进步不只是规模扩大,更是状态管理与检索机制的不断创新。文章依次讲解了标准Transformer的KV缓存瓶颈、线性注意力以固定状态交换精确检索、DeltaNet通过delta规则实现精确擦写、Gated DeltaNet结合衰减机制、KDA/Kimi Linear引入细粒度通道级门控,最终KimiK3通过混合KDA与MLA层、MoE、SiTU激活、以及块级Attention Residual(AttnRes)实现深度残差选择。适合对LLM内核架构感兴趣的一线工程师。

x.com · 27 min · DeltaNet · Kimi K3 · Linear Attention