HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分52
Random Attention 提出随机驱逐 KV cache 以提升长推理效率
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
AI 导读
Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org