#Agent
#Agent
今日 9 条
AI at Meta@AIatMetaAI 评分4242
OpenAI Developers@OpenAIDevsAI 评分2323
ClaudeDevs@ClaudeDevsAI 评分6060Anthropic 宣布开源 Claude Commerce Agents。这是一套构建购物与商户智能体的蓝图,提供覆盖零售、旅行、电信和娱乐场景的参考实现。
Claude@claudeai精选AI 评分7272Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
推荐理由:官方宣布 Claude 可在后台操作电脑,说明其点击、输入、打开应用的具体使用方式,读者可判断是否纳入自己的工作流。
ClaudeDevs@ClaudeDevsAI 评分5555
Replit ⠕@ReplitAI 评分4545GitHub Blog精选AI 评分6262 GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
Cursor Blog精选AI 评分6868 Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
Databricks:Blog(RSS)AI 评分3030 Databricks 扩展 Genie Agents:新增深度分析与文件推理能力
Databricks 宣布扩展 Genie Agents 能力,新增深度分析、文件推理等功能。此前公司在 Data and AI Summit 上宣布 Genie Spaces 演进为 Genie Agents。
Claude:Blog(网页)精选AI 评分6464 Anthropic 发布 Claude 商务智能体蓝图,含购物与商家智能体参考实现
Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。
推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。
Claude:Blog(网页)精选AI 评分7979 Anthropic 发布 Claude 电商智能体构建指南及参考实现
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
Google AI:DEV 作者专属(RSS)精选AI 评分6666 Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。
Google DeepMind:Blog(RSS)精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
Google DeepMind:Blog(RSS)AI 评分4747 Google DeepMind 推出 Fairwind Program,用 Gemini 3.8 Flash Cyber 与 CodeMender 主动防御网络威胁
Google DeepMind 推出 Fairwind Program,一项面向政府和可信合作伙伴的有限准入计划,提供 Gemini 3.8 Flash Cyber 网络安全模型与 CodeMender,可自主发现、验证并修复漏洞,在组织安全云环境中数分钟内生成可部署补丁。
Google Developers Blog(RSS)精选AI 评分6464 Google 复盘 AI Agents Challenge:最强参赛作品背后的 4 种工程模式
Google for Startups AI Agents Challenge 评审团队从各赛道头部参赛作品中提炼出 4 种共同工程模式。
推荐理由:从获奖参赛代码中提炼出四个可直接套用的工程模式,涵盖 MCP 双向暴露、事件驱动并发、回退校验和分层路由。
Google Blog:AI(RSS)AI 评分4545 Google 推出 Fairwind Program,提供 Gemini 3.8 Flash Cyber 与 CodeMender 自主漏洞防御
Google 发布 Fairwind Program,面向政府机构和可信合作伙伴开放限制访问的先进网络防御能力,首批提供专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用来自主查找、验证和修复漏洞,可在几分钟内生成可部署补丁而非耗时数周的人工修复。
Google AI@GoogleAIAI 评分6262ARC Prize:官方博客精选AI 评分7979 ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
LlamaIndex:产品、工程与评测AI 评分5656 LlamaIndex 发布 Turbo 抽取档位,中位速度每页 3.7 秒
LlamaIndex 在 LlamaParse 平台以 beta 形式推出抽取档位 Turbo,主打低延迟实时工作流。在自建开放基准 ExtractBench 上,其速度约为 Cost Effective 模式的 4 倍,中位处理时间每页 3.7 秒,F1 为 0.84;中等及以上长度文档因页面并行处理降至每页约半秒。定价为每页 35 credits,目前支持的输入类型和配置选项少于其他抽取档位。
Cohere Labs:官方研究博客精选AI 评分6565 Cohere Labs 发布 ATE 数据集:69.6 万 MCP 工具中仅 2.6% 能完整执行职业任务
Cohere Labs 聚合七个公开目录,构建含 696,291 个工具、123,069 个 MCP 服务器的 Agentic Task Ecosystem 数据集并对外开放。
推荐理由:研究用近 70 万个 MCP 工具构建供给侧数据集,给出自动化落在职业哪个环节的证据,可与曝光度研究互补阅读。
Google DeepMind@GoogleDeepMindAI 评分6262
Artificial Analysis@ArtificialAnlysAI 评分6565Google AI:DEV 作者专属(RSS)精选AI 评分6969 什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环
Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。
推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。
Runway:News(网页)AI 评分4747 Runway 发布 Runway Dev MCP 托管服务器,让编码 Agent 自动完成集成
Runway 发布 Runway Dev MCP,一个托管 MCP 服务器,将 Runway Dev 账户连接到编码工具,让 Agent 能研究可选模型及价格与能力、拉取请求 schema、配置 Model Router 和 Characters,并在生成失败时查询任务原因后重试。
Hugging Face:Blog(RSS)AI 评分3535 IBM 与 Confluent 发布 Granite 时间序列模型 Early Access,可在流数据上实时预测与检测异常
IBM 与 Confluent 宣布四款 IBM Granite 时间序列基础模型(PatchTST-FM、FlowState、TTM、TSPulse)以 Early Access 形式上线 Confluent Cloud。
OpenClaw🦞@openclawAI 评分5151
OpenBMB@OpenBMBAI 评分4242
Baidu Inc.@Baidu_IncAI 评分3131
Huawei Cloud@HuaweiCloud1AI 评分2828公众号:昆仑万维(天工)AI 评分5454 昆仑万维 SkyProduction 天工工作台新版本上线,打通剧本到成片流程
昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。
公众号:千问APP(阿里)AI 评分4141 天体物理学博士刘博洋用千问复现Druckmüller算法,日全食后3小时产出高清日冕图
8月12日西班牙出现欧洲大陆27年来首次日全食,全食持续101秒,天体物理学博士刘博洋在日食结束后不到3小时产出了高清日冕精细结构图。他此前把Druckmüller的五篇论文交给千问「工作助理」分析核心思路,悟出大师方法的本质是模拟人眼的局部差分视觉,并用过去日冕素材迭代100多个版本复现了整套算法。观测现场他还用千问根据低仰角与高仰角曝光数据推算补偿档数、写脚本测试新快门线的参数组合效率。
Meituan LongCat@Meituan_LongCat精选AI 评分6868推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
PromptArmor:Threat Intelligence精选AI 评分6969 PromptArmor 分析 30 天 Claude Code 遥测数据:4% 的会话占 65% 的开销
PromptArmor 基于一个十人团队 30 天的 310,009 条 OTel 遥测事件分析 Claude Code 和 Cowork 的安全与成本。
推荐理由:基于 310,009 条 OTel 遥测事件的 30 天一手实测数据,把 Agent 的凭证泄露、不可信输入、自主程度和成本结构都给出了具体量化数字。
Anthropic:Newsroom(网页)精选AI 评分8787 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。
推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。
公众号:面壁智能(MiniCPM)AI 评分2727 面壁智能 CTO 曾国洋四周年分享「面壁 AI Style」工作方式约定
面壁智能发布四周年分享,CTO 曾国洋提出名为「面壁 AI Style」的共同约定,包含五项个体素养和四项团队准则。文章以九张图、九句话形式呈现,强调「你的判断力,是 AI 无法替代的核心价值」,主张让 AI 成为每个人的能力放大器。
Huawei Cloud@HuaweiCloud1AI 评分2020
Qwen@Alibaba_QwenAI 评分6363Berkeley RDI:Blog(AI 安全与评测)AI 评分5454 UC Berkeley 等发布 Vero 基准:检验 AI 智能体能否构建形式化验证的完整软件仓库
UC Berkeley 联合多机构发布 Vero 基准,首个要求智能体在仓库级同时写实现与形式化证明,含 43 个 Lean 4 多模块实例、743 个 API 和 2,705 条形式化规范。
Databricks:Blog(RSS)AI 评分3232 Databricks 发布 AgentOps 大全(Big Book of AgentOps)
Databricks 官方博客发布 Big Book of AgentOps,将 AgentOps 定义为构建、部署和运营智能体的操作规范,面向 AI 智能体的工程实践。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3838 Gilbert + Tobin 如何用 OpenAI 治理并规模化应用 AI
澳大利亚律所 Gilbert + Tobin 通过 ChatGPT Enterprise 和 Codex 将 AI 融入运营,截至 2026 年 6 月 87% 的启用席位处于活跃使用状态,是其其他工具采用率的两倍以上。