跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分52

Random Attention 提出随机驱逐 KV cache 以提升长推理效率

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

AI 导读

Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org