💬 观点Sebastian Raschka
Recent Developments in LLM Architectures: KV Sharing, — Sebastian Raschka 详解近期开源大模型架构新趋势:KV共享、mH
Sebastian Raschka 详解近期开源大模型架构新趋势:KV共享、mHC与压缩注意力如何提升长上下文效率
2026-05-16原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
开源LLM长上下文架构新趋势
Gemma 4 跨层复用 KV 张量,约省一半 KV 缓存
- E2B 35层仅前15层算KV,省2.7GB@128K
- E4B 42层仅24层算KV,省约6GB@128K
- 同类型层间共享:滑窗配滑窗、全注意力配全注意力
🔗 涉及的概念与玩家
- Sebastian Raschka人物
- Gemma 4模型
- DeepSeek V4模型
- ZAYA1-8B模型
- Laguna XS.2模型
- KV sharing方法
- GQA方法
- compressed attention方法
- Gemma 4—采用→KV sharing
- Gemma 4—采用→GQA
- DeepSeek V4—采用→compressed attention
- ZAYA1-8B—采用→compressed attention
- Sebastian Raschka—分析→Gemma 4
本文系统梳理了2024年4-5月开源大模型在架构层面的关键创新,聚焦于解决长上下文场景下KV缓存膨胀、内存流量与注意力计算成本等核心瓶颈。
- Gemma 4 采用跨层KV共享:后续层直接复用前序层的键值(KV)状态,而非每层独立计算。这能将长上下文(如128K)的KV缓存内存占用减少约一半,意味着在同等硬件下,Agent或推理工作流可以处理更长的历史对话或文档,降低部署成本。
- Laguna XS.2 引入分层注意力预算:模型在不同层动态分配注意力计算资源。这为工具链开发者提供了更精细的推理优化切入点,可通过感知层间计算差异来设计更高效的批处理或调度策略。
- DeepSeek V4 结合mHC与压缩注意力:通过多头压缩(mHC)等机制减少注意力头的冗余计算。这表明模型架构正从“堆参数”转向“提效率”,开发者需关注这些内置优化,而非仅追求参数量。
原文:Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention · 作者 Sebastian Raschka
🕸 顺着图谱继续读
- A Visual Guide to Attention Variants in Modern LLMs — Sebastian Raschka 系统梳理了现代大语言模型中的注意力机制变体,2026-03-22 · 共同涉及 Sebastian Raschka、DeepSeek V4
- Latest open artifacts (#21): Open model bonanza! Gemma — 分析最新开源模型与闭源前沿的评估差距,揭示基准测试的局限性2026-05-16 · 共同涉及 DeepSeek V4、Gemma 4
- Meta is back with Muse Glimmer: local, agentic, — Meta 发布 Muse Glimmer:本地、智能体、多模态、开源,一文看懂其2026-08-10 · 共同涉及 GQA
- 5 useful things you'll learn in my new post-training — Nathan Lambert 新书发布,提炼 RLHF 与后训练的核心直觉、历史2026-08-10 · 共同涉及 DeepSeek V4