#Agent
#Agent
今日 19 条
Boris Cherny@bchernyAI 评分3131Meta Engineering Blog(RSS)AI 评分5353 Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
Rohan Paul@rohanpaul_aiAI 评分5252GitHub BlogAI 评分5454 GitHub 播客解读 AI 开发新术语:loop engineering、Ralph loops、squads、harness 与 hill climbing
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
Ethan Mollick@emollickAI 评分2121
DAIR.AI@dair_aiAI 评分4141
Artificial Analysis@ArtificialAnlysAI 评分6969Tomer Tunguz 博客(VC 分析)AI 评分5757 Tomer Tunguz:AI 生产力不是减少工作量,而是抬高产出上限
Tomer Tunguz 分享其与 Agent 协作的写作流程:AI 秒级起草,他逐行审阅、下指令修改,从不直接碰原始文本。他发现行级编辑量中位数稳定在约 136 处,时间并未缩短;用评分量表让 AI 评审 2021 到 2026 每年 15 篇已发布文章,综合质量分各档位都上升,第 10 百分位从 2.59 升至 3.81,涨幅接近第 90 百分位的两倍。
The Verge:AI(RSS)AI 评分7373 Google 发布 Gemini 3.8 Flash,推理更努力但 token 用量可能更高
Google 发布 Gemini 3.8 Flash,称其比 3.7 Flash 在复杂任务上执行更多推理步骤并迭代调用工具,定价维持每百万输入 token $0.75、输出 $3.75,但警告模型可能消耗更多 token 导致实际成本上升。
DogeDesigner@cb_dogeAI 评分2323
Rohan Paul@rohanpaul_aiAI 评分6666
OpenRouter@OpenRouterAI 评分3737
AI at Meta@AIatMetaAI 评分4242
🚨 AI News | TestingCatalog@testingcatalogAI 评分6060Meta 官方宣布 Muse Spark 1.3 发布,已在 Meta 模型 API 和 Muse Code 上推出,官方称这是其在编码和智能体工作上的最大跃升,价格极低。
OpenAI Developers@OpenAIDevsAI 评分2323
ClaudeDevs@ClaudeDevsAI 评分6060Anthropic 宣布开源 Claude Commerce Agents。这是一套构建购物与商户智能体的蓝图,提供覆盖零售、旅行、电信和娱乐场景的参考实现。
elsewhere:文章(RSS)AI 评分3737 飞书有了新的工作搭子:「豆包工作」一手实测
作者对飞书中的「豆包工作」进行一手实测,称工作可以交给豆包工作了。原文信息有限,未给出更多功能或性能细节。
Claude@claudeai精选AI 评分7272Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
推荐理由:官方宣布 Claude 可在后台操作电脑,说明其点击、输入、打开应用的具体使用方式,读者可判断是否纳入自己的工作流。
ClaudeDevs@ClaudeDevsAI 评分5555
Replit ⠕@ReplitAI 评分4545MarkTechPost(RSS)AI 评分5454 NVIDIA 开源 Switchyard:用 Rust 代理在 OpenAI 与 Anthropic API 间路由和翻译 LLM 流量
NVIDIA 发布 Switchyard,一个 Apache 2.0 协议的 Rust 代理和库,用于在多个后端之间路由 LLM 流量,并双向翻译 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 三种格式,包括流式事件。
GitHub Blog精选AI 评分6262 GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
Cursor Blog精选AI 评分6868 Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
Elon Musk@elonmuskAI 评分4242Elon Musk 发文确认 Grok @Bot 现已登陆 Android,Grok Bot 现已可以在 Android 平台使用。
The Verge:AI(RSS)AI 评分5252 Amazon 为 Alexa for Shopping 推出消息真伪验证功能
Amazon 推出新功能,用户可询问 Alexa for Shopping 某封邮件、短信或电话是否真的来自 Amazon,AI 会将其与 Amazon 历来发送的所有消息记录比对,并分析内容、格式和发件人。
Databricks:Blog(RSS)AI 评分3030 Databricks 扩展 Genie Agents:新增深度分析与文件推理能力
Databricks 宣布扩展 Genie Agents 能力,新增深度分析、文件推理等功能。此前公司在 Data and AI Summit 上宣布 Genie Spaces 演进为 Genie Agents。
elvis@omarsar0AI 评分3232MarkTechPost(RSS)AI 评分7575 Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber:同一核心模型、两种访问方式
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,两者基于同一核心智能,区别在于安全包络和访问方式。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7070 AISLE 在 curl 发现 6 个 CVE,此前 Anthropic Mythos 与 OpenAI Codex Security 均报告零发现
AISLE 称其自主 AI 系统在 Anthropic Mythos 和 OpenAI Codex Security 对 curl 报告零发现后,分析 curl 并提交 29 份报告,其中 6 个被 curl 安全团队确认并授予 CVE 编号(CVE-2026-80229 等),全部为 Low 级别,已在 curl 8.22.0 修复。
Claude:Blog(网页)精选AI 评分6464 Anthropic 发布 Claude 商务智能体蓝图,含购物与商家智能体参考实现
Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。
推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。
Claude:Blog(网页)精选AI 评分7979 Anthropic 发布 Claude 电商智能体构建指南及参考实现
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
Demis Hassabis@demishassabisAI 评分5555Google 发布 Gemini 3.8 Flash 及新的 3.8 Flash Cyber,作者称后者推进网络防御前沿,这是 6 周内第 3 次 Flash 模型更新。
Google AI:DEV 作者专属(RSS)精选AI 评分6666 Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。
-Zho-@ZHO_ZHO_ZHOAI 评分2020
Rohan Paul@rohanpaul_aiAI 评分3535Google DeepMind:Blog(RSS)精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
Google DeepMind:Blog(RSS)AI 评分4747 Google DeepMind 推出 Fairwind Program,用 Gemini 3.8 Flash Cyber 与 CodeMender 主动防御网络威胁
Google DeepMind 推出 Fairwind Program,一项面向政府和可信合作伙伴的有限准入计划,提供 Gemini 3.8 Flash Cyber 网络安全模型与 CodeMender,可自主发现、验证并修复漏洞,在组织安全云环境中数分钟内生成可部署补丁。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 Google DeepMind 发布 Gemini 3.8 Flash 模型卡
Google DeepMind 发布 Gemini 3.8 Flash 模型卡,称其为 Gemini 3.7 Flash 的下一代迭代,在软件工程和智能体知识工作流方面提升性能,并继续支持自定义 effort 等级以平衡质量、成本和延迟。
TechCrunch:AI(RSS)AI 评分5353 Wonderful 融资 5.5 亿美元,估值半年内翻倍至 50 亿美元
以色列-荷兰 AI 创业公司 Wonderful 完成 5.5 亿美元 C 轮融资,估值达 50 亿美元,比近六个月前的 20 亿美元估值翻了一倍多。本轮由 Insight Partners 领投,Salesforce 首次参投;公司已从客服 AI Agent 平台扩展为可协调 Agent、工作流与 AI 应用的 Wonderful AI OS 平台,业务覆盖超过 35 个国家。
Google Developers Blog(RSS)精选AI 评分6464 Google 复盘 AI Agents Challenge:最强参赛作品背后的 4 种工程模式
Google for Startups AI Agents Challenge 评审团队从各赛道头部参赛作品中提炼出 4 种共同工程模式。
推荐理由:从获奖参赛代码中提炼出四个可直接套用的工程模式,涵盖 MCP 双向暴露、事件驱动并发、回退校验和分层路由。