跳到正文
原文
Rohan Paul· @rohanpaul_ai · X·· 2026-09-08AI 评分69
AI 导读

一篇 Microsoft 论文研究 LLM Agent 长程衰减,跨 9 个模型发现依赖步骤越多成功率越低,ToolQA 上短程近乎满分的模型到 16 步仅剩 0-33% 成功率。实验显示缩短上下文反而使衰减更糟,说明问题主要由步数而非上下文长度驱动;作者建议按真实工作流长度测试、度量每步可靠性并在错误扩散前加入检查点。

整理与数据来源:AIHOT

来源:Rohan Paul · x.com