最新动态

  • Home
  • 小米新型注意力架构显著降低内存需求

小米新型注意力架构显著降低内存需求

2026-09-29 1505

小米的 MiMo 团队正在为即将发布的 MiMo-V3 研发一种名为 HySparse2的新型注意力架构,测试表明其在效能上的提升非常显著。以 80B-A3B MoE 模型为例,相比于 MiMo-V2 系列的 Hybrid SWA,HySparse2 在 prefill FLOPs 上减少了 5.02 倍,而与 HySparse 相比则减少了 2.92 倍。在 KV cache 的使用上,内存从 12.09 GB 降低到 2.69 GB。集中在 prefill 和 KV cache 的原因在于,prefill 阶段需要计算完整的输入,算力开销会随着上下文长度的增加而快速增加;而 KV cache 必须常驻显存,随着上下文的延长,它占用的空间也会增大。压缩这两个部分的资源使用,将直接影响能在同一硬件上处理的上下文长度和承载的并发量。HySparse2 的降幅数据明确反映了这两点的改进。5.02 倍和 2.92 倍的提升基于不同的对比基线,而 KV cache 从 12.09 GB 减少到 2.69 GB 则是绝对值的变化。这一架构的演变从命名可见,HySparse2 是 HySparse 的下一版,而 MiMo-V2 则采用 Hybrid SWA。三代方案对应各自的效果,团队对比了这些基线数据,以展示这条技术路线上的每一步进展。这一新架构的设计明显是为即将推出的 MiMo-V3 服务,尽管目前的数字仅为架构测试结果,最终的实现形式还需等待后续发布。

发表评论