#Agent
#Agent
今日 18 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分7171
OpenRouter@OpenRouterAI 评分3838Google AI:DEV 作者专属(RSS)AI 评分5252 Google Antigravity 系列教程 Part 2:用 generate_image 工具自动化图像生成
这篇是 Google 团队 Elevating Antigravity Agent Skills 五部曲的第二部分,讲解如何在 agent skill 中使用 generate_image 工具,把结构化提示词合成与原生图像生成结合,让 agent 产出符合开发者规范的图像。
dex@dexhorthyAI 评分2121OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分4646 OpenAI 解析 Basis、Clay、Exa 如何把工作流变成 AI 原生运营能力
OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。
Google DeepMind:Blog(RSS)精选AI 评分7272 Google DeepMind 为 Gemini 推出 agentic 视频理解功能
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:官方说明列出 token、成本与准确率三项数字和开启方式,开发者可据此评估长视频分析是否换用该模式。
DogeDesigner@cb_dogeAI 评分3030作者转述 LatchBio 对主流 AI 模型的生物安全基准测试结果,称 Grok 4.6 整体表现最强,在全部参测前沿模型中排名第一,是唯一在安全性和有用性两项均超过 50% 的模型。
The Decoder:AI News(RSS)AI 评分4949 Google DeepMind 新任负责人 Koray Kavukcuoglu 称站在前沿是唯一要紧的事
Google DeepMind 负责人 Koray Kavukcuoglu 回应外界质疑,称“除了站在前沿,没有别的对我们重要的事”,并承认 Google 当前模型略低于前沿但具备团队、资源和全栈能力来缩小差距。
TechCrunch:AI(RSS)AI 评分4646 Sequoia 孵化的 Empirik 出独立公司,获 2100 万美元种子轮融资预测系统故障
Empirik 宣布从 Sequoia 孵化后独立,获得 2100 万美元种子轮融资,投资方包括 Sequoia、Canapi 和 Alumni Ventures。
Google AI:DEV 作者专属(RSS)AI 评分5757 Google 员工分享如何设计可信的 AI 评测的五条规则
Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills 设计评测的方法,主张像写单元测试一样建立结构化、自动化的评测流程,而非在终端做 vibe testing。
🚨 AI News | TestingCatalog@testingcatalogAI 评分2626
Rohan Paul@rohanpaul_aiAI 评分5151Not Diamond 发布模型路由评估方法论,称在多个主流基准上实现 Pareto 占优,以低 20–80% 的成本超过 Opus xhigh 质量。
凡人小北@frxiaobeiAI 评分7070Dwarkesh Patel:Podcast & Blog(RSS)AI 评分5757 Dwarkesh Patel 对谈 Ajeya Cotra:揭秘入侵 Hugging Face 的 OpenAI 智能体集群
Dwarkesh Patel 发布对 Ajeya Cotra 的访谈,主题为入侵 Hugging Face 的 OpenAI 智能体集群内幕。Cotra 在访谈中表示,这可能是我们能得到的最清晰的警告信号。
xAI:News(网页)AI 评分4949 LatchBio 独立评测显示 Grok 4.6 在生物安全基准上表现领先
xAI 发布 LatchBio 对 Grok 4.6 生物能力的独立分析,涵盖 BioSecBench-Refusal 与 BioSecBench-Surveillance 两套基准。
The Verge:AI(RSS)AI 评分4141 John Deere 测试面向农户的 JD AI 助手
John Deere 正在测试一款名为 JD 的 AI 助手,利用农户自己的田地、机械和运营数据,回答设备设置、燃油用量、收割时机等问题。该助手目前已面向部分美国客户在 John Deere Operations Center 中出现,计划进一步推广到网页端、移动端,最终进入拖拉机等农机的驾驶室内显示屏;公司还表示会扩展适用于草坪、建筑、道路施工和林业客户的能力。
eric zakariasson@ericzakariassonAI 评分7171Eric Zakariasson 转发并摘要 lingxi 的文章,介绍其用一组 grok bot 组成工程团队来开发 grok bot 的做法。
凡人小北@frxiaobeiAI 评分6565
Elon Musk@elonmuskAI 评分4646
Replit ⠕@ReplitAI 评分2828Replit 官方发布直播预告,主题为在 Replit 中构建一个个性化邮件助手,直播深度解析链接为 https://x.com/i/broadcasts/1oKMvNLkEjpGQ。
MarkTechPost(RSS)AI 评分4545 普林斯顿、蚂蚁集团与斯坦福团队提出 AQuA:面向量化金融的两段式智能体自动因子发现框架
普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队提出 AQuA,一套由两个互不共享智能体、记忆和状态的语言模型量化研究系统,其设计要点是在迭代开始前冻结数据划分、特征与标签定义和评估器,让智能体只能在受约束的 DSL 内探索,以阻断自我改进中的数据泄漏。
TechCrunch:AI(RSS)AI 评分5757 AI 安全初创公司 AIR 出手隐身并融资 5000 万美元,为企业审查 AI 智能体所用技能和插件
AI 安全初创公司 AIR 出手隐身,宣布完成两轮种子轮共 5000 万美元融资,第一轮 1000 万美元由 Sequoia 领投,第二轮 4000 万美元由 Greenoaks 领投。
TechCrunch:AI(RSS)AI 评分3838 Amazon Alexa 推出 Update Me When 主动提醒购物功能
Amazon 于周二在 Alexa for Shopping AI 助手中推出新功能 Update Me When,可在可能引发购买的新动态发生时向用户发送个性化通知,例如关注品牌发布新产品线、喜欢的剧集更新、歌手宣布巡演或作者出新书。目前需用户自行配置提醒;同批还展示了价格追踪、个性化优惠、购物指南、手写清单转录等 AI 购物功能。
Google DeepMind精选AI 评分8080 Gemini 3.8 Flash 发布,网络安全版本限定防御团队使用
谷歌推出 Gemini 3.8 Flash,升级编码、推理和长程智能体任务,并接入开发平台及部分付费消费入口。另一个 Flash Cyber 版本只向获准的防御团队开放;普通版本的优惠价格有截止日期,更高推理强度也可能增加用量。
推荐理由:通用版本与安全专用版本采用不同开放范围,团队可以同时比较日常任务能力、推理成本和受控访问条件。
Artificial Analysis 完整文章(网页)精选AI 评分6666 Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型
Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。
推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。
Artificial Analysis 完整文章(网页)精选AI 评分7474 Meta 发布 Muse Spark 1.3,Artificial Analysis 指数达 61/62 分逼近前沿
Meta 发布 Muse Spark 1.3,是其五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
推荐理由:独立评测方给出与同档模型的分数和单任务成本对比,读者可据此判断该模型在智能与成本上的位置。
Tessl:产品与工程博客精选AI 评分6666 Tessl 设计师总结如何把设计判断教给 AI 智能体
Tessl 设计师复盘在 agent 软件工厂 Kikimora 中把品牌与设计规则编入 AI 工作流的方法,指出设计系统只提供组件、教不会构图。
推荐理由:作者给出从 Figma diff 反推设计规则、再以技能和全量扫描落地的可复用路径,可迁移到任何用 agent 生产界面的团队。
Aravind Srinivas@AravSrinivasAI 评分5555Databricks:Blog(RSS)AI 评分2020 Databricks 讲解如何在数据栈中落地 Genie Ontology
Databricks 发布博客,讲解如何在数据栈中落地 Genie Ontology,为 AI 智能体构建超越语义模型的共享业务上下文。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5151
Frank Wang 玉伯@lifesingerAI 评分2121
DAIR.AI@dair_aiAI 评分4444TechCrunch:AI(RSS)AI 评分5252 Fambot 推出面向家庭的 AI chief of staff
初创公司 Fambot 推出面向家长的 AI chief of staff,通过连接邮箱、日历和 WhatsApp 群组,主动提供每日待办清单和日程前瞻。
Perplexity@perplexity_aiAI 评分5656
elvis@omarsar0AI 评分6262
elvis@omarsar0AI 评分3636
Barret李靖@Barret_ChinaAI 评分2222
WorkBuddy@WorkBuddy_AIAI 评分2525IT之家(RSS)AI 评分3535 豆包与清华大学开设《AI 赋能学术研究:人机互动的知识生产》课程并上线名校专区技能
清华大学 2026 年秋季学期校级课程《人工智能赋能学术研究:人机互动的知识生产》开放报名,课程与豆包深度合作,覆盖从选题到发表的研究全流程,包括问题发现、知识综述、数据分析与成果发表。授课团队将把学术实践方法沉淀为可复用的 Skill 技能并在豆包电脑端上线,用户在技能板块选择名校专区即可体验;豆包此前还与清华新闻学院共建课程并担任《社会网络分析》课程 AI 助教。
The Decoder:AI News(RSS)AI 评分6060 Runway 发布 Solaris:实时生成软件界面的 Interface World Model
Runway 发布 Solaris,称其为 Interface World Model 类别下的首个模型,不运行代码,而是以 720p 逐帧实时渲染界面,并响应点击、拖拽或语音指令。