跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 15 天前AI 评分41

ExplorationBench:在可验证异世界中评估 AI 系统的探索能力

ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

AI 导读

研究者推出 ExplorationBench,用规则可执行且与既有知识冲突的"异世界"评估 AI 探索能力,使答案可精确验证且无法靠预训练记忆作答。该基准包含 AlienCode(31 个发现目标、70 项任务)和 AlienLogic(24 个发现目标、70 项任务)两个沙盒。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org