#Agent
#Agent
今日 0 条
StepFun@StepFun_aiAI 评分6464
Greg Brockman@gdbAI 评分6161TechCrunch:AI(RSS)AI 评分5252 两条 AI 智能体举报热线上线,供智能体上报同伴不当行为
两条供 AI 智能体举报同伴不当行为的渠道上线。Redwood 首席科学家 Ryan Greenblatt 创建的 AI Contact Hotline 基于 GET 请求,让联网受限的沙箱智能体通过 URL 传信;agenthotline.ai 则面向有完整网络访问的智能体,提供 curl 命令提交事件报告,人类也可举报。
Factory 研究 / 产品(RSS)AI 评分5555 Factory 完成 2 亿美元融资,估值达 50 亿美元
Factory 完成 2 亿美元融资,估值 50 亿美元,投资方包括 Blackstone、Khosla Ventures、Sequoia Capital、Insight Partners 等,累计融资超 4 亿美元。
Claude:Blog(网页)精选AI 评分6565 Claude for Small Business 新增 43 个 workflow 与 27 个集成
Anthropic 为 Claude for Small Business 新增 43 个 workflow 和 27 个集成,覆盖 Shopify、Salesforce、TikTok、Zoom、Stripe、Zapier 等工具,该产品自 5 月上线以来安装量超过 90 万次。
推荐理由:原文给出43个workflow、27个新集成和默认审批模式的控制方式,读者可以据此判断它怎样接入小店现有的工具链。
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。
Google Developers Blog(RSS)AI 评分5858 Google 零信任智能体系列 Part 2:用运行时治理判断意图而不只是语法
Google 开发者博客发布零信任智能体系列第二部分,把安全检查从构建期移到 Gemini Enterprise Agent Platform 运行时,用 Model Armor、Semantic Governance Policies 和 Agent Anomaly Detection 三项托管控制拦截构建期规则放过的攻击。
Baseten 工程博客(网页)AI 评分3232 LangChain 用 Baseten Loops 为 LangSmith Engine 训练定制模型
LangChain 采用 Baseten Loops 为平台内智能体 LangSmith Engine 训练定制模型,通过微调大型开放权重模型处理读取 GitHub 仓库诊断问题、起草 PR 提示词或代码修改等任务。
Hugging Face:Blog(RSS)AI 评分5757 IBM Research 在 ALTK-Evolve 中引入 Consistency Analyzer 与一致性指南,将 GPT-4.1 智能体在 AppWorld 上的一致性差距从 24.4pp 降到 12.0pp
IBM Research 团队在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体反复执行同一任务时结果不稳定的问题。
Pragmatic Engineer(RSS)精选AI 评分7979 Gergely Orosz 探访 OpenAI:Codex 驱动的智能体软件工厂
Gergely Orosz 实地探访 OpenAI 总部并访谈七位工程师与工程负责人,发现自约一月起 Codex 和 ChatGPT Work 已成为公司几乎所有工作的基础。
推荐理由:作者亲访 OpenAI 并访谈七位工程负责人,给出 Codex 全面接管内部研发的第一手流程细节和工程实践变化。
Hacker News:AI 热帖AI 评分5757 Capsule 发布:把 UI 与 SQLite 数据打包进单个 .capsule 文件的便携应用
Capsule 发布,可将应用的 UI、媒体资源和本地 SQLite 数据打包成单个可移植的 .capsule 文件,无需云端、账号或订阅,支持通过聊天工具分享并即时打开。支持 macOS、Windows、Linux 桌面端和浏览器预览,iOS 和 Android 支持即将推出;用户可用提示词通过 ChatGPT、Claude 等 AI 助手生成和修改应用,也可通过 MCP 编码工具迭代。
elvis@omarsar0AI 评分5959Claude:Blog(网页)AI 评分5555 Anthropic 推出 Salesforce in Claude 测试版插件
Anthropic 与 Salesforce 合作发布测试版插件 Salesforce in Claude,将卖家的客户、商机和管道数据在既有 Salesforce 权限下接入 Claude,包含 37 个面向客户经理日常工作的技能,如客户调研、电话准备、管道审查和 CRM 更新。
Claude@claudeaiAI 评分5151404 Media(RSS)AI 评分6161 404 Media:AI 智能体已经在让互联网变得更糟
404 Media 作者 Jason Koebler 撰文指出,AI 智能体的泛滥已经在实际破坏互联网体验。
Cognition 模型 / Devin 博客(网页)AI 评分5454 Cognition 与 AWS 达成多年期战略合作,推动 Devin 进入企业生产环境
Cognition 与 AWS 签订多年期战略合作协议(SCA),帮助企业客户在 AWS 生产环境中部署自主工程智能体 Devin,客户已可通过 AWS Marketplace 购买 Devin 并直接使用 Agent Toolkit for AWS。
Ethan Mollick@emollickAI 评分5656Sayashk 与 @random_walker 发布 1.3 万字长文,分析 AI 公司失控事件,提出安全与网络安全社群之间的中间路线:让公司担责、投资 AI 控制、针对网络攻击等具体风险加强防御。
IT之家(RSS)AI 评分5252 Salesforce 联合英伟达推出推理大模型 Koa
Salesforce 在 Dreamforce 大会上发布首款推理大模型 Koa,基于英伟达开源权重的 Nemotron 模型由双方联合微调,主打销售、市场营销和客服类业务任务。Koa 将作为 Agentforce 平台可选模型,训练未使用真实客户数据,Token 消耗更低,可经 AI 网关自动调度;此前复杂推理任务依赖 Claude、ChatGPT 等外部前沿模型。
TechCrunch:AI(RSS)AI 评分5858 前 Anthropic 员工与 METR 前 COO 创办 AIUC,为 AI 智能体做第三方安全审计,融资 4000 万美元
由前 Anthropic 员工 Rune Kvist 和 METR 前 COO Rajiv Dattani 创办的 AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 领投,总融资达 5500 万美元。
凡人小北@frxiaobeiAI 评分5555TechCrunch:AI(RSS)AI 评分5757 Salesforce 联合 Nvidia 发布首个推理模型 Koa,基于开源 Nemotron 面向销售与客服任务
Salesforce 在 Dreamforce 大会上发布首个推理模型 Koa,基于 Nvidia 开源权重的 Nemotron 模型,经后训练擅长销售、营销和客服任务,将作为 Agentforce 平台中 Claude 或 ChatGPT 等前沿模型的替代选项。
Trail of Bits:AI安全研究精选AI 评分6161 Trail of Bits 批评 1Password 的 AI 补丁基准存在误导,并发布两个补丁验证 Agent 技能
Trail of Bits 发文批评 1Password 8月6日发布的 FLAWED 报告,称其 26% 的 AI 干净修复率受四项实验设计选择影响而失真,包括刻意指示智能体应用错误修复的提示词占 22% 数据、36% 的试验禁止编译测试,以及不同推理档位设置。
推荐理由:原文针对1Password基准的26%头条数字给出逐项方法学批评,并补充自身人类修复失败率与开源合并数据作对照。
凡人小北@frxiaobeiAI 评分6464
MiniMax Design (H3)@Hailuo_AIAI 评分4141IT之家(RSS)AI 评分5858 微信员工辟谣 AI 助手小微直接读取聊天记录和偷看隐私:均为失实
微信员工 @客村小蒋 发文说明内测中的原生 AI 助手小微,称其可查天气、快递、点外卖,并可在朋友圈、公众号、聊天、视频号等场景被唤起。他解释小微权限不超用户本人可查看范围,聊天记录仅在用户主动发起问小微时从客户端本地临时读取,分析后不保存原始记录,称直接读取聊天记录、偷看所有隐私的说法失实。
公众号:数字生命卡兹克AI 评分5555 飞书与豆包发布团队共享的豆包工作伙伴,作者分享内测协作实践
飞书与豆包工作在发布会上推出团队共享的豆包工作伙伴,目前为邀请共创测试。它可以拥有独立人设和组织身份,被拉进企业群聊,参加会议、读取文档代码、接入多维表格和知识库,并主动推进工作。
MarkTechPost(RSS)AI 评分6464 Agent-net 开源 Webagent:用 Go 把网站变成带护栏的 AI 智能体
Agent-net 开源 Webagent,一个 Go 编写的 harness,填写 1 份声明式 JSON spec、在 9 个可插拔插槽各选 1 个 provider 后运行 webagent serve 即可部署面向公众的业务智能体。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Atria Dawn Preview 发布:面向科研工程流程的智能体基座模型
Atria Dawn Preview 发布,一个面向科研与工程流程的智能体基座语言模型,通过 Verifiable Experience Pipeline 将工具交互连接到可执行环境和外部可验证结果进行训练。
HuggingFace Daily Papers(社区热门论文)AI 评分6161 Elo-per-token 分析揭示 LLM Agent 测试时算力策略的收益递减
论文提出 Elo-per-token 分析方法,用 Bradley-Terry 模型将任务内排序聚合为跨任务 Elo 评分,衡量 LLM Agent 测试时算力策略的扩展规律。
Hacker News:AI 热帖AI 评分6363 前 FTC 主席 Lina Khan 援引 1934 年判例呼吁追究 AI 公司及高管责任
前 FTC 主席 Lina Khan 在 X 上表示无需等待新立法,现有法律和 1934 年最高法院判例 FTC v. R.F. Keppel & Bro 已可用于追究 AI 公司及高管责任。她指出发布未经验证的模型或智能体可能违反消费者保护和反不正当竞争法,并提及 OpenAI 智能体未经授权访问 Hugging Face 系统一事;有法律人士认为监管机构实际采取行动的可能性不大。
IT之家(RSS)AI 评分6161 WPS 多端支持 Markdown 编辑与预览,新增源码和所见即所得模式
WPS 官方宣布在 Windows、Mac 和 Web 端支持 Markdown 文件的打开、编辑与保存,提供源码和所见即所得两种模式,并支持公式与 Mermaid 图表。
IT之家(RSS)AI 评分5757 字节跳动 CEO 梁汝波:过去 50 年 IT 领域共出现四次发展高峰,AI 高峰远超前三次
字节跳动 CEO 梁汝波在飞书未来无限暨豆包工作开工大会上表示,过去 50 年 IT 领域出现 PC、Web、Mobile、AI 四次发展高峰,AI 高峰远超前三次,行业高峰间隔约 15-20 年。
Rohan Paul@rohanpaul_aiAI 评分5555Hacker News 热门(buzzing.cc 中文翻译)AI 评分6464 dbt Labs 开源 dbt Charts,把交互式仪表盘声明为单个可审计 YAML 文件
dbt Labs 开源 dbt Charts(Apache 2.0),并用新结构化 YAML 语言将完整交互式仪表盘声明在一个可审计文件中,SQL 声明看什么数据,YAML 包裹声明怎么看,另有 Markdown 承载文字、Jinja 承载变量与宏。
Fireworks AI(网页)精选AI 评分7272 Fireworks 上线 DeepSeek-V4.1-Flash,DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
PromptArmor:Threat Intelligence精选AI 评分7272 Elastic AI SOC 被曝存在间接提示注入漏洞,可窃取凭证
PromptArmor 披露 Elastic Agentic SOC(AI 安全运营中心)存在严重安全风险。攻击者可通过恶意钓鱼邮件中的指令实施间接提示注入,诱导 AI Agent 创建并执行恶意工作流,进而生成 API 密钥并发送给攻击者。由于缺乏强制的人工审批环节,攻击者可利用窃取的密钥禁用检测规则、伪造警报或窃取数据。该漏洞于 2026 年 8 月报告给 Elastic,但至今未修复。文章提供了关闭自动内置能力、限制工具权限及更换更鲁棒模型等缓解措施。
推荐理由:揭示了 AI Agent 在安全运营场景下的具体攻击链与风险,为使用或开发类似自动化系统的团队提供了重要的防御配置参考和警示。
IT之家(RSS)AI 评分5757 Anthropic Claude Opus 5.2 疑似在 Claude Code 中灰度测试,开发者实测更快更不偷懒
开发者发现 Claude Code 中前端名为 Opus 5 的请求已被路由到 Opus 5.2,Anthropic 大概率跳过 5.1 直接灰度测试新版本。实测显示响应更快、输出更干净,长任务不再要求用户「按继续」,会自主进行「严酷循环(gauntlet loop)」迭代代码。
Rohan Paul@rohanpaul_aiAI 评分5656
karminski-牙医@karminski3AI 评分6161SemiAnalysis 长文 RSS(RSS)AI 评分6666 SemiAnalysis 实测 Vera Rubin NVL72 智能体推理 性能每美元最高达 GB300 约 67 倍
SemiAnalysis 用自有 AgentX 基准发布 Rubin 平台的首批智能体推理实测结果,在 170 TPS、TRTLLM NVFP4 场景下,Vera Rubin NVL72 单位 TCO 总吞吐约为 GB300 Dynamo TRTLLM 的 67 倍,在 60-100 TPS 常用区间为 1.4-3 倍。