HuggingFace Daily Papers(社区热门论文)·· 28 天前AI 评分56
T1:面向长程任务的终端智能体强化学习,122B MoE 在 Terminal-Bench 2.1 达 64.0%
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
AI 导读
腾讯 Hy 基础模型团队联合新加坡国立大学等机构发布 T1,基于 Qwen3.5-122B-A10B 用强化学习训练终端智能体,在云沙箱中每任务最多执行 300+ 次工具调用,以任务自身验证器给奖励。
整理与数据来源:AIHOT
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org