HuggingFace Daily Papers(社区热门论文)·· 15 天前AI 评分41
ExplorationBench:在可验证异世界中评估 AI 系统的探索能力
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
AI 导读
研究者推出 ExplorationBench,用规则可执行且与既有知识冲突的"异世界"评估 AI 探索能力,使答案可精确验证且无法靠预训练记忆作答。该基准包含 AlienCode(31 个发现目标、70 项任务)和 AlienLogic(24 个发现目标、70 项任务)两个沙盒。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org