跳到正文
原文
DAIR.AI· @dair_ai · X·· 11 天前AI 评分39
AI 导读

小米 MiMo 团队为即将推出的 MiMo-V3 打造了注意力架构 HySparse2,在 80B-A3B MoE 模型上把 prefill FLOPs 较 MiMo-V2 系列的 Hybrid SWA 降低 5.02x、较 HySparse 降低 2.92x,KV cache 从 12.09 GB 降至 2.69 GB。

整理与数据来源:AIHOT

来源:DAIR.AI · x.com