Rohan Paul· @rohanpaul_ai · X·· 2026-09-02AI 评分42
AI 导读
普渡大学论文提出 Naive Prompt Optimization(NPO),只保留一条提示词谱系,由教师模型根据近期 rollout 轨迹和奖励迭代修改。在 IFBench 和 HotpotQA 上,NPO 以更少的 rollout 达到与基于 Pareto 选择维护多候选的 GEPA 相当或更好的结果:3,500 vs 3,593 和 6,800 vs 6,871。
整理与数据来源:AIHOT
来源:Rohan Paul · x.com