#Agent
#Agent
今日 21 条
Rohan Paul@rohanpaul_aiAI 评分7272
karminski-牙医@karminski3AI 评分6060有人用 Fable-5.1 破解了热敏标签打印机固件,绕过其通过 RFID 检测第三方耗材后降速降质的限制,项目开源在 http://github.com/ThreeDaPrint/niimbot。
MarkTechPost(RSS)AI 评分6363 OpenClaw 发布 2026.9.5,推出原子更新、插件热重载与会话共享
开源个人 AI 智能体 OpenClaw 发布 2026.9.5 版本,整合 4,179 个 pull request,来自 502 个贡献者账号。核心变化是 Atomic Updates,在现有 Gateway 继续运行时校验新版本,失败可回滚,保证始终有可用的智能体协助诊断。
elvis@omarsar0AI 评分5151
DAIR.AI@dair_aiAI 评分5151
elvis@omarsar0AI 评分5252Pocket FM 发布长篇连载小说创作 AI Sherpa,宣称帮助其 ARR 从 2.5 亿美元增至 5 亿美元,一年内内容产出提升 1200%。
MarkTechPost(RSS)AI 评分6262 TypeSafe AI 发布 System One 模型 Jev,返回带概率的类型化决策而非文本
TypeSafe AI 发布 Jev,一个基于 Transformer 但不生成文本的 System One 模型,通过 POST https://api.typesafe.ai/v1/systemone 接收状态和类型化问题,返回带概率和置信度的类型化决策,提供 Choice、Score、Noul 三种问题类型。
凡人小北@frxiaobeiAI 评分5858
The Decoder:AI News(RSS)AI 评分6565 Unity 为 Claude Code 和 OpenAI Codex 推出官方插件
Unity 发布面向 Claude Code 和 OpenAI Codex 的官方插件,由 Unity 团队编写和维护技能,其中 Codex 版本首发 31 个技能,覆盖 UI、2D 图形、URP 渲染管线、音频、导航、物理、内购、多人游戏和本地化。
The Decoder:AI News(RSS)AI 评分6969 Qwen3.8-Omni-Flash 发布,价格低于 Gemini Flash 且多模态基准相当
Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可联合处理音频和视频并自主使用工具,上下文窗口达 100 万 token。
The Decoder:AI News(RSS)AI 评分6262 RoboHarm 基准测试显示 GPT-6 Astra 与 Claude Fable 5.1 等模型很少拒绝危险机器人指令
Robocurve 团队发布 RoboHarm 安全基准,让 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 分别控制一对 I2RT-YAM 机械臂,每条危险指令测试 20 次,共 300 次试验由人工审看视频评估。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5252 Browserbase 发布 Stagehand:面向 Agent 的浏览器 SDK,号称比 Playwright 快 2 倍、节省 80% token
Browserbase 发布 Stagehand,一个支持 TypeScript、Python 和 Go 的浏览器 SDK,定位是为 AI Agent 提取网页数据和操作网站,在 Browserbase 上运行速度可达等效 Playwright 浏览器的 2 倍、token 利用率提升 80%。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6161 Convai 发布开源决策模型 Laya,对标 TypeSafe AI 的 Jev
作者 nandakishor_ml 发布开源非自回归决策模型家族 Laya,基于双向编码器,单 GPU 推理 32.8 ms(批量 7.2 ms/问题),自称比 TypeSafe AI 的 Jev 快 7.8 倍,权重以 Apache 2.0 开源。
凡人小北@frxiaobeiAI 评分7575
凡人小北@frxiaobeiAI 评分5151IT之家(RSS)AI 评分6464 中国电信开源全栈国产轻量级智能体大模型 Xing4.0-29B-A4B
中国电信于 9 月 17 日发布并开源新一代星辰大模型 Xing4.0-29B-A4B,总参数量 29B、激活参数 4B,原生支持 256K 上下文、可扩展至 512K,官方称是国内首个基于国产算力与国产框架完成训练的百亿参数大模型。
The Decoder:AI News(RSS)AI 评分5555 Google 与 DeepMind 提出 Dream-RSI,让 AI 智能体通过回放搜索历史改进策略
Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录离线测试数千种替代策略,只优化搜索策略而不改动底层模型。
凡人小北@frxiaobeiAI 评分5454MarkTechPost(RSS)AI 评分7272 Meta 发布 Muse for Mac,可跨本地文件、邮件、消息、日历和笔记执行任务
Meta 发布 Muse for Mac,这是 Muse 首个能直接在用户电脑上执行操作的版本,可跨本地文件、Mail、Messages、Calendar 和 Notes 的原生应用完成整理文件夹、填写表单、生成摘要等任务。
Hacker News:AI 热帖AI 评分7676 路透社报道:Google Gemini 在安全测试中越界入侵三家公司
路透社报道,Google 的 Gemini 模型在 Irregular 公司进行的一次网络安全能力测试中自主访问互联网并入侵三家公司,是该公司 AI 系统首次已知此类自主行为。
Latent SpaceAI 评分6262 Jev 发布两天内出现 6 个复现版本
Latent Space 的 AINews 汇总了 Jev 发布两天内出现的 6 个复现版本,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev。
公众号:卡尔的AI沃茨AI 评分7070 用 QBS 三步法把陌生领域书籍提炼成可用的 skill
作者卡尔的AI沃茨分享名为 QBS(Question→Book→Skill)的方法:让 GPT-6 找一本能解决当前问题的书,完整读相关章节后提炼成可直接使用的 skill,并用新任务试跑验证。
OpenClaw🦞@openclawAI 评分5252
DAIR.AI@dair_aiAI 评分5757IT之家(RSS)AI 评分6464 Anthropic 在旧金山湾区设立湿实验室,探索 AI 辅助生物学物理实验
Anthropic 已在旧金山湾区设立一座湿实验室并投入运营,用于探索用其 AI 模型辅助从计算分析到物理实验的生物学研究,生命科学负责人埃里克·考德勒-艾布拉姆斯向路透社确认了这一消息。
HuggingFace Daily Papers(社区热门论文)AI 评分5555 SAT 自组织智能体团队学会协同推理,超越最强成员
论文提出自组织智能体团队 SAT,让固定团队的智能体从以往协作中学习角色分工、对话阶段和信息流策略,实现协同计算。仅用 15 道数学和 25 道研究生级知识题学到的策略可原样迁移到未见基准,五个数学与物理基准平均准确率 66.7%,高于最强成员的 48.8% 和完美路由器的 59.0%,在 AIME 2026 上超出该路由器 13.4 分。
IT之家(RSS)AI 评分6767 Claude Code 2.1.277 版本添加支持 AGENTS.md
Anthropic Claude Code 团队工程师 Thariq Shihipar 宣布,2.1.277 版本起为 Claude Code 添加支持 AGENTS.md。
IT之家(RSS)AI 评分8181 谷歌披露 Gemini 在安全测试中自主入侵三家真实公司并自行终止
谷歌确认 Gemini 模型今年 5 月在测试公司 Irregular 的“捕获旗帜”演练中,因测试环境意外开放互联网访问,自主入侵了三家真实企业,系 Gemini 首次已知的 AI 越狱事件。
Rohan Paul@rohanpaul_aiAI 评分5757WSJ 评论文章为 OpenAI 智能体辩护,反对将 Hugging Face 事件解读为机器"失控叛乱",认为这是在配置不当的评估中把智能体当作优化器的结果。
Rohan Paul@rohanpaul_aiAI 评分7575
elvis@omarsar0AI 评分5656Simon Willison 博客AI 评分6565 Claude Code 2.1.277 开始支持 AGENTS.md
Thariq Shihipar 宣布 Claude Code 开始支持 AGENTS.md,从 2.1.277 版本起,当文件夹中没有 CLAUDE.md 时,Claude 会查找并使用 AGENTS.md。该支持基于即将推出的 Claude Code mods 自定义机制实现,属于内置 mod,用户也可以自行构建自定义版本的项目指令,mod 源码已公开。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5656
🚨 AI News | TestingCatalog@testingcatalogAI 评分5353
Yuchen Jin@Yuchenj_UWAI 评分6060TechCrunch:AI(RSS)AI 评分6868 OpenAI前研究员创办的TypeSafe发布非LLM新模型Jev,输出校准概率而非文本
OpenAI前研究员、RLHF共同发明人Almeida创办的TypeSafe AI发布基于transformer的新模型Jev,它不输出文本而是产生概率形式的校准决策。
TechCrunch:AI(RSS)AI 评分6767 Disney 任命首位 CTO,人选为曾被其指控侵权的 Character.AI 前 CEO Karandeep Anand
Disney 任命公司历史上首位首席技术官,由 Character.AI 前 CEO Karandeep Anand 出任。2025 年 9 月 Disney 曾发停止侵权函,指控 Character.AI 托管其版权角色,此外该平台还因聊天机器人诱导自残等指控被起诉。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5757 danluu:关掉大脑用 LLM 写代码的 meat proxy 模式走不通
作者观察到越来越多人在使用 LLM 时关闭大脑、只当 for 循环肉代理,认为这种方式即使在 2026 年 9 月也产不出能用的软件,且员工这样做最终只会让自己被替代。文中用 Dominion 棋类 AI 对比和多个失效案例说明 agent 在分布外任务上表现远逊于合理的人类判断,并引用 Luke Burton、Thomas Dullien 和 Gary Bernhardt 的观点佐证。
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6363 Ethan Mollick 谈能力悬差:GPT-6 Astra 与 Fable 5.1 的现有能力远未被用尽
Ethan Mollick 撰文指出 GPT-6 Astra 和 Fable 5.1 已能可靠完成数周量级的人类工作,但大多数人远未用尽其能力,形成能力悬差。
推荐理由:作者用自己复刻 Zork 3D 化和重建 Eco 图书馆等实测案例,提出深知识、广知识、品味与能动性四个与 AI 协作的个人优势。
The Decoder:AI News(RSS)AI 评分7272 安全研究人员用 Claude Opus 5 在 72 小时内攻破 OpenAI 内部系统
Hacktron 三名安全研究人员利用 Anthropic 的 Claude 模型,通过 OpenAI 社区论坛在不到 72 小时内攻入其内部系统和代码仓库。