跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 28 天前AI 评分56

T1:面向长程任务的终端智能体强化学习,122B MoE 在 Terminal-Bench 2.1 达 64.0%

T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

AI 导读

腾讯 Hy 基础模型团队联合新加坡国立大学等机构发布 T1,基于 Qwen3.5-122B-A10B 用强化学习训练终端智能体,在云沙箱中每任务最多执行 300+ 次工具调用,以任务自身验证器给奖励。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org