#Agent
#Agent
今日 9 条
OpenRouter@OpenRouterAI 评分6565Claude:YouTube(RSS)AI 评分5151 Claude 宣布 Cowork 与聊天合并为一个 Claude
Claude 官方宣布 Cowork 与聊天功能合并,统一为一个 Claude。材料未提供正文细节,仅发布该标题信息。
Claude:Blog(网页)精选AI 评分7878 Anthropic 将 Claude Cowork 与聊天合并为统一 Claude,并推出 Docs 和 Slides
Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务无需再选择入口,Cowork 和 Design 的能力可在任意对话中使用,并沿用已有的上下文、skills 和 connectors。
推荐理由:原文由 Anthropic 官方说明合并动机与边界,读者可以对照自己现有工作流判断迁移影响。
Claude@claudeaiAI 评分6060Tessl:产品与工程博客AI 评分4848 Odevo 的 AI Native 转型:先修好软件交付体系,再谈 AI 编码
Odevo 在 AI Native DevCon London 分享了其 AI Native 转型经验:这家住宅物业管理公司七年内管理房屋从约 5 万套增至约 250 万套、员工从约 1000 人增至 14000 人,2024 年起步时仅约 30% 开发者使用 GitHub Copilot 等工具。
Tessl:产品与工程博客AI 评分5555 Tessl提出用可执行规范解决AI代码审查瓶颈
Tessl博客指出,AI编码代理导致PR数量激增但审查变慢,核心原因是缺乏对输出结果的信任。文章主张建立“验证层”,将产品意图转化为“可执行规范”。通过拆分规划与验证代理、结合规范与代码进行比对、并在隔离沙箱中运行以规避安全风险,旨在让代理自动检查实现是否符合原始需求,从而提升工程效率。
Tessl:产品与工程博客AI 评分6060 Tessl 博客提出用合并率衡量 AI 原生转型是否真实
Tessl 博客整理作者在 AI Native DevCon London 的演讲,主张 AI 原生组织的核心是压缩交接,让有决策权的人能直接通过智能体完成工作。
Tessl:产品与工程博客精选AI 评分6363 Tessl 工程师在 AI Native DevCon London 提出 Agent 技能应按供应链组件管理
Tessl 作者在 AI Native DevCon London 的演讲中提出,Agent 技能一旦被信任就会影响智能体的读取、修改和工具调用,应视为供应链组件并纳入安全审查。文中给出对约 4000 个公开技能的扫描发现可疑下载、凭据风险和恶意行为等问题,并提出由私有上下文、不可信内容和对外通信构成的风险三要素,以及清单管理、来源审查、行为扫描、权限收窄和出站控制等实践建议。
推荐理由:作者以约 4000 个技能的扫描为背景,把 Agent 技能类比 npm 供应链组件,给出了可信行为的风险模型和管理清单。
Tessl:产品与工程博客AI 评分5555 Netlify 高管在 AI Native DevCon 提出 Agent Experience 是下一个产品界面
Netlify 的 Dana Lawson 在 AI Native DevCon London 演讲提出智能体体验(AX)概念,认为构建者已从专业开发者扩展到非技术人群。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6767 OpenAI 推出 ChatGPT Ads 新功能:Sponsored Agents 测试并集成 HubSpot 与 Shopify
OpenAI 为 ChatGPT Ads 推出多项 AI 驱动的新体验。Sponsored Agents 允许用户在点击广告后与明确标识的商业赞助智能体对话,目前在美国部分广告主中测试。
推荐理由:官方宣布 ChatGPT Ads 多项更新,涵盖 Sponsored Agents 测试和 HubSpot、Shopify 集成,可了解 AI 广告平台的具体落地方式。
Preferred Networks:AI 研究与产品AI 评分5454 三菱重工与Preferred Networks签订资本业务提携协议,出资总额100亿日元
三菱重工与Preferred Networks(PFN)于2026年8月31日签订资本业务提携协议。三菱重工将通过第三者配额增资向PFN出资总额100亿日元。双方此前已于2026年6月宣布在基础设施和国家安全等关键任务领域共同开发机器与系统的智能化、自主化AI技术,本次协议将构建中长期更强固的合作体制,加速共同研发与社会落地。
公众号:火山引擎AI 评分6565 豆包大模型2.1 Pro更新至0915版本:多模态Coding与Agent交付能力升级
火山引擎宣布 Doubao-Seed-2.1-pro 更新至0915版本,API 已全量上线火山方舟,豆包 app 和 TRAE 同步接入。
Tripo@tripoaiAI 评分5858Tomer Tunguz 博客(VC 分析)精选AI 评分6161 Vercel 将 inbound 销售团队从 10 人压缩至 1.25 人,AI 销售开发智能体年成本仅数千美元
Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中表示,公司 inbound 销售开发已实现 90% 自动化,团队从 10 人压缩至 1.25 人。
推荐理由:Vercel COO 给出自家 inbound 销售自动化的人员压缩、年度基础设施成本和 32x ROI 数字,是可直接参考的一手落地案例。
Krea@krea_aiAI 评分5555LlamaIndex:产品、工程与评测AI 评分5454 LlamaIndex:为什么更好的抽取模型并不能缩小你的文档复核队列
LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。
Arena.ai@arena精选AI 评分6969推荐理由:榜单给出四款新模型在图像生成网站任务上的排名和每百万 token 价格,可据此比较性能与成本差异。
StepFun@StepFun_aiAI 评分6464Factory 研究 / 产品(RSS)AI 评分5555 Factory 完成 2 亿美元融资,估值达 50 亿美元
Factory 完成 2 亿美元融资,估值 50 亿美元,投资方包括 Blackstone、Khosla Ventures、Sequoia Capital、Insight Partners 等,累计融资超 4 亿美元。
Claude:Blog(网页)精选AI 评分6565 Claude for Small Business 新增 43 个 workflow 与 27 个集成
Anthropic 为 Claude for Small Business 新增 43 个 workflow 和 27 个集成,覆盖 Shopify、Salesforce、TikTok、Zoom、Stripe、Zapier 等工具,该产品自 5 月上线以来安装量超过 90 万次。
推荐理由:原文给出43个workflow、27个新集成和默认审批模式的控制方式,读者可以据此判断它怎样接入小店现有的工具链。
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
Google Developers Blog(RSS)AI 评分5858 Google 零信任智能体系列 Part 2:用运行时治理判断意图而不只是语法
Google 开发者博客发布零信任智能体系列第二部分,把安全检查从构建期移到 Gemini Enterprise Agent Platform 运行时,用 Model Armor、Semantic Governance Policies 和 Agent Anomaly Detection 三项托管控制拦截构建期规则放过的攻击。
Baseten 工程博客(网页)AI 评分3232 LangChain 用 Baseten Loops 为 LangSmith Engine 训练定制模型
LangChain 采用 Baseten Loops 为平台内智能体 LangSmith Engine 训练定制模型,通过微调大型开放权重模型处理读取 GitHub 仓库诊断问题、起草 PR 提示词或代码修改等任务。
Hugging Face:Blog(RSS)AI 评分5757 IBM Research 在 ALTK-Evolve 中引入 Consistency Analyzer 与一致性指南,将 GPT-4.1 智能体在 AppWorld 上的一致性差距从 24.4pp 降到 12.0pp
IBM Research 团队在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体反复执行同一任务时结果不稳定的问题。
Claude:Blog(网页)AI 评分5555 Anthropic 推出 Salesforce in Claude 测试版插件
Anthropic 与 Salesforce 合作发布测试版插件 Salesforce in Claude,将卖家的客户、商机和管道数据在既有 Salesforce 权限下接入 Claude,包含 37 个面向客户经理日常工作的技能,如客户调研、电话准备、管道审查和 CRM 更新。
Claude@claudeaiAI 评分5151Cognition 模型 / Devin 博客(网页)AI 评分5454 Cognition 与 AWS 达成多年期战略合作,推动 Devin 进入企业生产环境
Cognition 与 AWS 签订多年期战略合作协议(SCA),帮助企业客户在 AWS 生产环境中部署自主工程智能体 Devin,客户已可通过 AWS Marketplace 购买 Devin 并直接使用 Agent Toolkit for AWS。
Trail of Bits:AI安全研究精选AI 评分6161 Trail of Bits 批评 1Password 的 AI 补丁基准存在误导,并发布两个补丁验证 Agent 技能
Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。
推荐理由:原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。
MiniMax Design (H3)@Hailuo_AIAI 评分4141Fireworks AI(网页)精选AI 评分7272 Fireworks 上线 DeepSeek-V4.1-Flash,DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
PromptArmor:Threat Intelligence精选AI 评分7272 Elastic AI SOC 被曝存在间接提示注入漏洞,可窃取凭证
PromptArmor 披露 Elastic Agentic SOC(AI 安全运营中心)存在严重安全风险。攻击者可通过恶意钓鱼邮件中的指令实施间接提示注入,诱导 AI Agent 创建并执行恶意工作流,进而生成 API 密钥并发送给攻击者。由于缺乏强制的人工审批环节,攻击者可利用窃取的密钥禁用检测规则、伪造警报或窃取数据。该漏洞于 2026 年 8 月报告给 Elastic,但至今未修复。文章提供了关闭自动内置能力、限制工具权限及更换更鲁棒模型等缓解措施。
推荐理由:揭示了 AI Agent 在安全运营场景下的具体攻击链与风险,为使用或开发类似自动化系统的团队提供了重要的防御配置参考和警示。
Arena.ai@arenaAI 评分5858Claude:Blog(网页)精选AI 评分6666 Anthropic 工程师复盘:智能体编程压力下如何扩展测试影响分析服务
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
Arena.ai@arena精选AI 评分6767推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
Claude:Blog(网页)AI 评分5656 Anthropic 介绍医疗组织如何用 Claude Tag 在 Slack 中协作
Anthropic 介绍医疗组织如何在 beta 版 Claude Tag(Slack 内智能体)的帮助下分诊生产告警、维护内部工具并回答 payer 规则问题,使用场景均限于不接触 PHI 的渠道。
Tessl:产品与工程博客精选AI 评分6363 Tessl 提出 Agent 上下文归属模型:所有权跟随组织单元
Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。
推荐理由:文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。
SiliconFlow@SiliconFlowAI精选AI 评分6666推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
NVIDIA Blog(RSS)AI 评分5555 Perplexity Portable Computer 登陆 Windows,由 NVIDIA RTX 加速
Perplexity 在兼容的 NVIDIA GeForce RTX PC 和 RTX PRO Workstation 上推出 Windows 版 Portable Computer,这是 Perplexity Computer 的本地版本,可规划并执行多步任务,敏感数据留在设备上且本地任务不消耗云端 credits。
Perplexity@perplexity_aiAI 评分5656
SenseTime@SenseTime_AIAI 评分5858