跳到正文
原文
Perplexity· @perplexity_ai · X·· 16 天前AI 评分33
AI 导读

新研究:我们通过提示引导的自蒸馏,对一个 Computer 模型进行后训练,让它从自身错误中学习。 在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率降低了 21.2%。

整理与数据来源:AIHOT

来源:Perplexity · x.com