跳到正文

#Agent

今日 0 条
9月17日周四
  1. Tessl:产品与工程博客55

    Tessl提出用可执行规范解决AI代码审查瓶颈

    Tessl博客指出,AI编码代理导致PR数量激增但审查变慢,核心原因是缺乏对输出结果的信任。文章主张建立“验证层”,将产品意图转化为“可执行规范”。通过拆分规划与验证代理、结合规范与代码进行比对、并在隔离沙箱中运行以规避安全风险,旨在让代理自动检查实现是否符合原始需求,从而提升工程效率。

  2. Tessl:产品与工程博客63

    Tessl 工程师在 AI Native DevCon London 提出 Agent 技能应按供应链组件管理

    Tessl 作者在 AI Native DevCon London 的演讲中提出,Agent 技能一旦被信任就会影响智能体的读取、修改和工具调用,应视为供应链组件并纳入安全审查。文中给出对约 4000 个公开技能的扫描发现可疑下载、凭据风险和恶意行为等问题,并提出由私有上下文、不可信内容和对外通信构成的风险三要素,以及清单管理、来源审查、行为扫描、权限收窄和出站控制等实践建议。

    推荐理由:作者以约 4000 个技能的扫描为背景,把 Agent 技能类比 npm 供应链组件,给出了可信行为的风险模型和管理清单。

9月16日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)67

    OpenAI 推出 ChatGPT Ads 新功能:Sponsored Agents 测试并集成 HubSpot 与 Shopify

    OpenAI 为 ChatGPT Ads 推出多项 AI 驱动的新体验。Sponsored Agents 允许用户在点击广告后与明确标识的商业赞助智能体对话,目前在美国部分广告主中测试。

    推荐理由:官方宣布 ChatGPT Ads 多项更新,涵盖 Sponsored Agents 测试和 HubSpot、Shopify 集成,可了解 AI 广告平台的具体落地方式。

  2. 公众号:数字生命卡兹克64

    豆包手机助手消费者版随努比亚NaviX Ultra开售,AI键加入指纹鉴权

    搭载豆包手机助手消费者版的努比亚NaviX Ultra正式开售,12+512GB定价5999元,国补后5499元。作者实测发现AI键新增指纹鉴权,涉及私人信息或手机操作时验证机主身份;复杂长程任务、记忆、快捷指令和屏幕内容理解能力均升级,并新增SAEP屏幕自动化操作声明协议,第三方App可自行选择是否允许豆包助手进行GUI操作,目前免费额度有限且生态主要支持系统、字节系及部分已接入的第三方应用。

  3. IT之家(RSS)54

    努比亚 NaviX Ultra 发布:主打 AI 智能体能力,5999 元起

    努比亚发布 NaviX Ultra 手机,宣称是首款 AI 智能体手机,售价 5999 元起,国补后 5499 元起。该机由豆包手机助手主导 AI 体验,搭载 Seed 全双工语音大模型和第五代骁龙 8 至尊版,支持一句话跨应用执行任务,端到端任务成功率超 80%,AI 唤醒率优于竞品 48%,并完成智能体大模型备案。

  4. Preferred Networks:AI 研究与产品54

    三菱重工与Preferred Networks签订资本业务提携协议,出资总额100亿日元

    三菱重工与Preferred Networks(PFN)于2026年8月31日签订资本业务提携协议。三菱重工将通过第三者配额增资向PFN出资总额100亿日元。双方此前已于2026年6月宣布在基础设施和国家安全等关键任务领域共同开发机器与系统的智能化、自主化AI技术,本次协议将构建中长期更强固的合作体制,加速共同研发与社会落地。

  5. HuggingFace Daily Papers(社区热门论文)64

    Emergence World:面向长程多智能体系统的对抗性压力测试

    论文介绍 Emergence World,一个持续运行的多智能体环境,用于对长程自主系统做对抗性压力测试。8个平行世界、每个10个Agent在16天内产生超过850,000次LLM调用、近500亿token;随后通过间接提示词注入、错误信息和私密记忆泄露三种受控压力事件测试,没有任何世界全部抵御。

  6. Hacker News 热门(buzzing.cc 中文翻译)59

    为什么在纳维-斯托克斯方程之后,我仍然对大型语言模型持看空态度

    作者认为前沿实验室按'即将实现知识工作全自动化'的叙事定价,但当前模型在训练任务的小邻域之外容易彻底失败或奖励作弊,纳维-斯托克斯这类纯数学成果依赖定理即严格规约、Lean 验证器经多年审计的最佳条件,无法推广到大多数知识工作。

  7. Mark Zuckerberg52

    Mark Zuckerberg 发文回应关于在能力进展前放缓、等待对齐跟上的争论,认为信任与对齐正成为区分智能体和模型的最重要能力,不专注对齐的实验室会落后。他指出实验室因用户不信任失准智能体、模型致害需担责而有强激励做安全,并列举 Meta 的做法:曾为安全推迟数月发布 Muse、MSL 已在多个领域引入独立评估者、承诺将大部分算力用于服务用户而非追求递归自我改进。

  8. Rohan Paul51

    Rohan Paul 转发扎克伯格关于 AI 安全与降速争论的帖子,称这是对 AI 降速主张的回应,与黄仁勋近几日的说法一致。扎克伯格认为信任与对齐正成为区分智能体和模型的最重要能力,不专注对齐的实验室会落后;Meta 曾为安全和安保推迟发布 Muse 数月,且不支持要求所有人一起放慢,还主张让大部分算力用于服务用户而非递归自我改进,并扩大独立评估者生态。

  9. Tomer Tunguz 博客(VC 分析)61

    Vercel 将 inbound 销售团队从 10 人压缩至 1.25 人,AI 销售开发智能体年成本仅数千美元

    Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中表示,公司 inbound 销售开发已实现 90% 自动化,团队从 10 人压缩至 1.25 人。

    推荐理由:Vercel COO 给出自家 inbound 销售自动化的人员压缩、年度基础设施成本和 32x ROI 数字,是可直接参考的一手落地案例。

  10. LlamaIndex:产品、工程与评测54

    LlamaIndex:为什么更好的抽取模型并不能缩小你的文档复核队列

    LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。

  11. Aravind Srinivas69

    Perplexity CEO Aravind Srinivas 宣布自研键值数据库 CobbleDB,替代 AWS DynamoDB 用于快速网页内容抓取,迁移后每年最多可节省一亿美元。该项目由两名工程师和数百个持续运行的 Computer 智能体在两个月内完成核心基础设施,官方研究称热存储批次读取延迟较 DynamoDB 全分布下降约 5 倍(P50 从 31.4ms 降至 5.60ms)。

    推荐理由:原文给出成本节省数字和构建方式,图片补充了批次读取延迟的具体对比数据。