跳到正文

#Agent

今日 19 条
9月2日周三
  1. 公众号:数字生命卡兹克65

    UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验

    UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。

    推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。

  2. Anthropic:Newsroom(网页)87

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。

    推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。

  3. HuggingFace Daily Papers(社区热门论文)59

    Harness-of-Harness 论文提出多天自主软件开发框架,平均相对提升 52.25%

    论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在无人工干预的自主开发中持续改进软件。HoH 运行在现有 coding-agent harness 之上,将执行组织为规划-编码-测试的迭代循环,平衡修复与能力增长,并把开发拆成小而可验证的增量。

  4. IT之家(RSS)35

    OPPO 联合多所高校推出端侧 AI 记忆评测基准 MobileMem

    OPPO 联合 OpenKG 及浙江大学、同济大学、东南大学等高校团队推出端侧 AI 记忆评测基准 MobileMem,技术白皮书已公开,数据集和相关工具将陆续开源。OPPO 首席产品官刘作虎称,端侧 AI 记忆是 AI 手机从一问一答走向主动服务智能体的基础能力,此前行业缺少统一评价标准;ColorOS 17 发布暨开发者大会将于 2026 年 9 月 17 日在珠海举行。

  5. HuggingFace Daily Papers(社区热门论文)37

    多智能体 LLM 提示词优化新方法:控制-数据流分离

    论文提出控制-数据流分离方法,将消息路由、输出格式、终止信号等执行关键协议表示为类型化、经验证的程序对象,任务相关语言作为可优化的数据流,避免提示词优化破坏协议导致智能体流水线失败。在合成推理、协作评审生成和保险评级工作流中,框架实现 100% 的最终协议有效性,同时持续提升任务性能。

  6. HuggingFace Daily Papers(社区热门论文)45

    DroneCATS:评测多模态大模型作为无人机通用视觉-语言-动作智能体

    论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。

  7. HuggingFace Daily Papers(社区热门论文)47

    StudentSim:训练基于 LLM 的学生模拟器框架

    论文提出 StudentSim,通过池化训练加按学生专门化,把稀疏的学生个人数据转化为能模拟学生应答并在辅导下更新的个性化学生模拟器。配套发布 StudentSimEval 评测协议,覆盖国际象棋、英语二语写作和数学 3 个领域的 60 名学生,衡量行为保真度 F 和指导响应度 R。

  8. HuggingFace Daily Papers(社区热门论文)54

    论文提出评估框架:防护手段本地测试通过不等于部署后的 LLM 系统更安全

    Hefei AiDA Lab 等机构的研究者提出一套将 LLM 防护评测结果转换为部署安全结论的分析框架,并对其编码的 198 篇论文进行分析。152 个宽编码声明中有 108 个建立了正向残余有害协助,没有一个建立零残余证书;24 个深度编码实例中仅 5 个报告了检查成功后的可达残余,仅 Fides 一个实例通过覆盖、条件失败与后续可达三项证明给出零残余证书。

  9. HuggingFace Daily Papers(社区热门论文)43

    VeriPhy 提出面向世界模型评估与改进的智能体物理推理系统

    论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。

  10. Rohan Paul51

    Fable 5.1 的缓存读取成本比 Fable 5 低 75%,随着负载越偏智能体化,节省越大,一项组件的降价可带来整个工作负载约 45% 的成本下降。作者转发分析称,智能体反复回访相同的上下文、计划、工具输出与工作状态,因此更便宜的缓存读取大幅降低持续推理的开销;企业现在面临的经济问题是智能体能持续工作多久才在财务上合理。

  11. TechCrunch:AI(RSS)55

    AfterQuery 传闻以 32 亿美元估值成为 Y Combinator 史上最快独角兽

    AI 训练数据创业公司 AfterQuery 传闻完成一轮融资,估值达 32 亿美元,距其 4 月以 3 亿美元估值完成 3000 万美元 A 轮仅五个月。Y Combinator 合伙人 Gustaf Alströmer 称这是该加速器史上从创立到独角兽最快的公司,两位创始人为 22 和 23 岁,来自 Y Combinator 2025 年冬季批次。