Epoch AI:研究、数据与评测·· 2026-09-09AI 评分44
PostTrainBench v1.1 基准评测:LLM 自主后训练能力
PostTrainBench v1.1 - Benchmark Review
AI 导读
PostTrainBench v1.1 用于衡量 LLM 自主完成后训练的能力,每个智能体拿到 4 个基座模型,需在 7 个目标基准上最大化得分。评测用 LLM 裁判标记污染、外部 API 或蒸馏、查询榜单历史等违规行为,被标记的运行按基座模型成绩计分。
整理与数据来源:AIHOT
来源:Epoch AI:研究、数据与评测 · epoch.ai