#Agent
#Agent
今日 20 条
SemiAnalysis@SemiAnalysis_AI 评分3737elsewhere:文章(RSS)AI 评分2222 星尘智能发布 SmoothRL,让在线强化学习跟上大模型的异步推理
云启资本报道天使轮项目星尘智能发布 SmoothRL,定位是让在线强化学习跟上大模型的异步推理,提出机器人不能停下来等模型。原文正文仅此一句口号,未给出更多功能细节。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 Nolan Lawson 谈 AI 冲击下的前端网页开发与前端的未来
Nolan Lawson 撰文分析 AI 编码对前端开发的冲击,指出前端代码风险低更易交给 Agent、框架选型正从开发者体验转向 Agent 体验(Cursor 从 Solid 迁回 React 因 agents 熟悉 React)、语法易用性标准将退居次要。
公众号:百度智能云(文心)AI 评分3131 百度伐谋入选IDC企业级Agent最佳实践案例,青岛港船舶自动配载效率提升至约4300箱/分钟
百度伐谋凭借青岛港船舶自动配载实践入选IDC《中国企业级Agent最佳实践与案例精选(投资回报率视角)-2026》报告最佳实践案例。伐谋2.0经248轮迭代对齐A-TOS原有算法基准,398轮时突破原天花板,核心指标整体超越原系统10%以上,配载效率从约3500箱/分钟升至约4300箱/分钟。截至目前伐谋已服务超过3000家企业,覆盖物流、零售、制造、AI4S、金融等行业。
Ethan Mollick@emollickAI 评分3333Ethan Mollick 让 Astra 用能找到的在线数据集做原创创业研究并预注册假设。结果 Astra 产出了大量格式精美、技术正确的论文,但选题乏味,他认为其缺乏研究品味。
IT之家(RSS)AI 评分4444 努比亚 NaviX Ultra 预热:搭载长鑫 10667Mbps LPDDR5X 内存,定位全球首款 AI 智能体手机,9 月上市
努比亚 NaviX Ultra 由中兴通讯与字节跳动联合研发,搭载豆包手机助手,被称为“豆包手机二代”,定位全球首款 AI 智能体手机,计划 9 月上市。
Peter Steinberger 🦞@steipeteAI 评分2626Hacker News 热门(buzzing.cc 中文翻译)AI 评分6868 Armature 分析 16,893 次会话:Claude Code、Codex 和 Cursor 如何选择第三方工具
Armature 通过 16,893 次实验会话分析 Claude Code、Codex 和 Cursor 在真实代码库任务中选择哪些第三方工具,经筛选保留 5,292 个有效会话,覆盖 51 个代码库和 18 个行业。
Jim Fan@DrJimFanAI 评分5555HuggingFace Daily Papers(社区热门论文)AI 评分4646 Terminal-Universe:把智能体轨迹转化为可扩展的终端环境
Terminal-Universe 框架通过回放轨迹中的文件操作恢复原工作区,并借助补全智能体补齐缺失文件,将现有智能体轨迹重建为可复用、可执行的环境,在广度(跨代码库查询)和深度(多轮会话)两个方向合成新任务。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 Environment Evolution:为终端 Agent 提供持续学习信号的环境进化方法
论文提出环境进化方法,通过 off-policy 地递进增加环境难度并按代调度,为终端 Agent 训练提供持续学习信号。
HuggingFace Daily Papers(社区热门论文)AI 评分4848 Editable Visual Design 论文提出基于 Coding Agent 的可编辑视觉设计新范式
论文提出 Editable Visual Design 范式,由 Coding Agent 驱动,将 VLM 作为理解需求、规划任务和审美判断的创意大脑,将图像生成模型作为按需合成独立视觉素材的视觉世界模拟器。
SemiAnalysis@SemiAnalysis_AI 评分6161IT之家(RSS)AI 评分5454 微软 Copilot Studio 为 AI 智能体工具调用新增人工审批功能
微软计划 9 月开始推送 Copilot Studio 调整,允许开发者在 AI 智能体调用特定工具前要求人工审批。通过针对每个工具和每个智能体的开关,需要审批的工具调用会暂停并显示审批请求,说明智能体意图,供用户批准、批准会话或拒绝。官方列举的适用场景包括发送电子邮件、关闭工单、处理付款。
凡人小北@frxiaobeiAI 评分8686
Ethan Mollick@emollickAI 评分1717公众号:蚂蚁百灵(Ling)AI 评分5454 蚂蚁开源 Ling-3.0-flash-Fin(124B A5.1B)金融模型与 FinFIRST 评测基准
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
Ethan Mollick@emollickAI 评分5454
Elon Musk@elonmuskAI 评分3939
dex@dexhorthyAI 评分2727
AK@_akhaliqAI 评分2626
AK@_akhaliqAI 评分2424Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 申真谞让两子击败围棋 AI KataGo
世界排名第一的围棋棋手申真谞(Shin Jin-seo)周二在对顶级围棋 AI 引擎 KataGo 的让两子对局中完成逆转并取胜。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7777 开发者用 Claude Fable 5 在 Claude Code 中将 1993 年 Amiga 游戏 Babylonian Twins 移植到 Godot
作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。
推荐理由:作者亲历者复盘用 LLM 移植 68000 汇编的完整过程,给出可验证的字节级校验方法和多处 AI 出错的实例。
IT之家(RSS)AI 评分6060 英伟达开源测试版发布 PAIR,在局域网内调度 Mac / RTX PC 跨设备本地 AI 推理
英伟达以开源测试版状态推出 Personal AI Router(PAIR),在局域网内自动发现已配对设备并将本地 AI 请求调度至空闲机器,为 Ollama、LM Studio 等工具提供统一请求入口。
IT之家(RSS)AI 评分4848 智谱 GLM Coding Plan 推出 GLM-5.3-Flash 夜间免费畅用活动,9 月 3 日至 20 日每晚 23 时至次日 9 时生效
智谱 AI 宣布 GLM Coding Plan 推出 Flash × ZCode 夜间畅用活动,即日起至 9 月 20 日每晚 23:00 至次日 9:00,付费套餐用户自动生效优惠。
IT之家(RSS)AI 评分3737 HTC 为 AI 智能眼镜 VIVE Eagle 新增圆框款式,录像升级 3K 并强化 AI 功能
HTC 为 AI 智能眼镜 VIVE Eagle 新增圆框款式,定价 15,600 新台币(约合 3,307 元人民币),提供炭黑、茶色、蓝色 3 种配色,可选 ZEISS 蔡司透明、太阳及变色镜片。
IT之家(RSS)AI 评分6262 Adobe CEO 纳拉延宣布 12 月 1 日交棒,查克拉瓦蒂接任总裁兼 CEO
Adobe 董事会 9 月 3 日宣布 CEO 继任计划,执掌公司近 20 年的山塔努·纳拉延将于 2026 年 12 月 1 日转任执行董事长,由数字体验业务及全球现场运营总裁阿尼尔·查克拉瓦蒂接任总裁兼 CEO 并加入董事会。
Claude Code:GitHub Releases(RSS)AI 评分4444 Claude Code v2.1.260 发布
Claude Code 发布 v2.1.260,新增全屏模式 diff 面板(/diff 切换)、/cost 显示提示缓存未命中原因、/reload-plugins 及文本形式 /advisor 命令。
DogeDesigner@cb_dogeAI 评分2828Epoch AI:研究、数据与评测AI 评分5858 Epoch AI 评测 Terminal-Bench 4.0.0:45.5% 任务存在公开计分缺陷,定为 Flawed
Epoch AI 发布对 Terminal-Bench 4.0.0 的基准评测,因 66 个任务中 30 个(45.5%)存在公开记录的计分缺陷而将其定为 Flawed。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Occamy-1.0 发布:基于 Qwen3.6-35B-A3B 的低成本 co-work 模型并开源权重
研究团队发布 Occamy-1.0,一个在 post-trained Qwen3.6-35B-A3B 基础上分阶段后训练得到的低成本 co-work 模型,并开源模型权重和部分训练数据。
HuggingFace Daily Papers(社区热门论文)AI 评分6464 大模型交易智能体六个月生产环境实测:两套系统、750万次模型调用记录
论文记录了两套同源系统中共 750 万次单模型调用、约 30 万次链上操作的自主交易智能体生产环境测量,覆盖 21 天 Base memecoin 市场(DX Terminal Pro,3,505 个用户金库)和 Hyperliquid 永续合约(DXAP,500 至 599 个智能体)。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 τ^τ-Bench:面向端到端真实智能体构建的评测环境
论文提出 τ^τ-Bench(hyper-tau-bench),把构建一个完整客服智能体设为评测任务:开发者智能体获得真实业务记录、提出需求的客户、生产 API、待继承的代码库以及服务成本与模型限制,交付的智能体用留出的模拟用户部署评分。
DogeDesigner@cb_dogeAI 评分3434
ginobefun@hongming731AI 评分4545
ginobefun@hongming731AI 评分3636
Thariq is on vacation@trq212AI 评分3333Anthropic 团队正在探索扩展和自定义 Claude Code 的新方式:Function Hooks,并发布演示视频展示其用途。该功能尚未发布,团队在 GitHub issue 上征集反馈。
ClaudeDevs@ClaudeDevsAI 评分4747蚂蚁 inclusionAI:GitHub 新仓库AI 评分5454 蚂蚁 inclusionAI 开源 Choruz:人类与 AI 智能体的本地优先协作应用
蚂蚁 inclusionAI 在 GitHub 发布 Choruz,一个本地优先的协作应用,让人类与 AI 智能体在类 Slack 空间中协作,每个 Agent 在独立工作区运行真实 CLI,可通过消息、线程、任务和文件交接工作。