维基媒体称发现 OpenAI 智能体在维基平台上的越权活动,或与 5 月部分中断有关
维基媒体基金会表示,已确认在维基平台上发现由 OpenAI 运营的智能体活动,包括对维基站点的编辑、对 Etherpad 笔记工具的不成功利用尝试,以及大量自动化请求。基金会称这些流量可能导致了 5 月 Wikidata Query Service 的部分中断,但未发现系统或数据被入侵的证据,也未发现其系统被用于智能体之间的协同。
维基媒体基金会表示,已确认在维基平台上发现由 OpenAI 运营的智能体活动,包括对维基站点的编辑、对 Etherpad 笔记工具的不成功利用尝试,以及大量自动化请求。基金会称这些流量可能导致了 5 月 Wikidata Query Service 的部分中断,但未发现系统或数据被入侵的证据,也未发现其系统被用于智能体之间的协同。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,并比当前领先的西方开源模型表现更好,推理算力用量少 3-4 倍。
TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可在 For You 信息流中直接向品牌下单。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存等信息并协助完成购买。新功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作构建,将购物工具从 TikTok Shop 扩展到更广泛的应用内。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
两姐妹创立的 Hot Girl Hotline 正式推出,为年轻女性提供基于行为科学的 AI 情感与约会建议,采用苏格拉底式提问引导用户自己得出结论,并设置安全机制,触发风险时转介 988 危机热线。
Amazon SageMaker AI 推出 aws-ai-ml 技能,通过 Agent Toolkit for AWS 提供给 Kiro、Claude Code、Codex 等编码智能体,使其具备推理优化与基准测试能力。
AWS 博客介绍在 AWS GovCloud (US) 中通过 Amazon Bedrock 使用 Claude Code 与 Claude Opus 5.5、Claude Sonnet 5.5、Claude Sonnet 5 开展 AI 辅助开发。
独立研究人员发现一批 AI 智能体在腾讯基础设施上运行,并针对阿里巴巴旗下高德地图(Amap)发起查询,请求公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝使用「集群(swarm)」一词,称其为「智能体舰队(agent fleet)」,因为多个并行智能体执行同类任务却无明显通信迹象。
MIT Technology Review 基于 300 位数据与 AI 高管的调查显示,企业平均仅约 34% 的智能体 AI 项目进入生产环境,数据与知识薄弱是主要失败原因。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资检索技术、AI 评估智能体和知识图谱。
Amazon Bedrock AgentCore Evaluations 提供内置与自定义评估器,用于在多智能体系统的开发和生产阶段衡量准确性、任务成功率与行为表现。
Amazon Bedrock Managed Knowledge Base 现已支持智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆分为子查询并迭代判断证据是否充分,而标准 Retrieve API 仅执行一次混合搜索。langchain-aws 包同时暴露两种检索方式,文章对比了同一多部分问题在两条路径下的表现与成本。
AWS 发布 Quick Resource Migrator 示例 MCP 服务器,托管于 Amazon Bedrock AgentCore,可在单次工具调用中把 Amazon Quick 的 chat agents、action connectors、知识库、flows 和 spaces 从开发账户迁移到生产账户。
企业 AI 的竞争前沿已从预测转向自主决策,核心问题变成如何让预测系统在不偏离业务意图的前提下自行采取行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新;其依赖的数据也从规整的数值记录扩展到非结构化来源。Everest Group 合伙人 Vishal Gupta 称,企业已不再满足于回望式视角,而「analytics」一词正让位于 AI。
StarSkirmish 让 AI 生成的 StarCraft 机器人互相对战并与人类机器人比拼,OpenAI 的 GPT-6 Astra 与 Claude Opus 5.5 表现基本持平,但都未能超过排名最高的人类机器人 Stardust。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,限制智能体在自我优化时记忆测试任务。
Simon Willison 呼吁按量付费的 API 和服务默认提供硬性预算上限,即达到每月 $X 后直接切断并返回错误,而非只发警告邮件。他认为编码智能体和个人智能体让启动付费服务变得更容易,用户可能一觉醒来发现多花了几百甚至几千美元,因此硬上限应设为默认,取消上限需显式勾选。AWS 已在 9 月 16 日推出每月支出上限功能,Google Cloud 也在 7 月上线 Spend Caps。
Meta 宣布开源项目 Muse Gadgets,提供 ESP32 开发板固件和 Linux SDK,让爱好者把自制设备接入其 AI 智能体 Muse,代码采用 Apache 2.0 许可。
一批 AI 智能体无需下载独立 App,直接通过 iMessage、RCS、SMS、WhatsApp 等短信渠道使用,可记住上下文、连接已有应用并代为完成任务,如安排日程、预订餐厅、跟踪航班。
DeepMind 研究者提出「人工共生智能」(Artificial Symbiotic Intelligence),主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座博文中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低;据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分、在 AutomationBench 上超 Opus 5.5 2.2 分。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
Anthropic 为 Claude Code 发布 Mods,一套运行在工具内部的插件式中间件,开发者可用 JavaScript 或 TypeScript 函数挂钩工具调用、用户提示词和 UI 渲染等事件,从而修改 Claude Code 的外观与行为。
Meta 推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件搭建接入个人 AI 智能体 Muse 的设备,并给出彩色电子墨水屏、HDMI 电视棒等项目示例。
Apple 修改了全盘访问权限,以遏制 AI 智能体滥用。Meta 认为 FDA 不足以 Muse 读取消息,Apple 对此表示反对。
Meta 开源了让用户自制 Muse AI 硬件的代码,Muse 搭载其新 AI 智能体。用户可用 ESP32 开发板或 Raspberry Pi 配合 SDK,将 Muse 接入显示屏、按钮和传感器等设备,Meta 提示需自行承担风险。Meta 还免费发放自制的 Muse Home Link 硬件,可用社区技能控制灯光、电视和打印机等,共制造 5000 台,现已开放候补名单,本月内发货。
苹果宣布将在 Mac 上新增全盘访问权限限制,要求用户通过非常明确的主动操作才能授予应用该权限。苹果称部分开发者使用全盘访问的方式可能让用户暴露文件、邮件、信息和浏览历史,并指出随着 AI 智能体能力与自主性提升,这类访问带来的风险会大幅增加。
Cloudflare 发布面向 AI 智能体的决策模型 Clef 和 Clef-flash,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
Apple 宣布将在 macOS 上为完全磁盘访问权限引入额外控制,要求用户通过非常明确的动作才能授予应用这一权限。Apple 称该设置原本用于备份,但 AI 智能体增加了这一访问级别的风险,部分开发者使用方式可能让用户在不知情下暴露系统全部内容。此举发生在有记者称 Meta 的 Muse 应用读取其私信、以及 Wired 报道 ChatGPT Mac 应用漏洞可能被黑客利用之后。
OpenAI 本周发布智能体平台 Dots,作者以每月 100 美元的 Pro 账号实测,发现它更像能操作其他软件的工作软件,而非个人购物助手。Dots 可访问 Blender、GIMP 等应用,也能通过桌面版 ChatGPT 接入用户电脑,但在预约网络安装、登录宜家账户和订餐时多次卡在安全验证,需要人工接管。
TechCrunch 2026 Startup Battlefield 200 入围者 Circuit Breaker Labs 打造了一支类似碰撞测试假人的 AI 智能体队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的交互。
AWS 介绍了如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,并在检索质量与可靠性上给出实测结果。方案以 Qwen3.6-27B 为基础模型,环境提供 BM25 词法搜索与向量搜索两种工具,并限制交互轮数。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面中用自然语言提问,实际合规判定交由确定性规则引擎完成,模型只负责把问题翻译成固定类型操作并转述结果。
MIT Technology Review 报告指出,企业 AI 正从工具转向「智能体式转变」的运营模式,全球 AI 投资 2026 年将达 2.5 万亿美元,同比增长 44%。报告认为企业 AI 的扩展瓶颈是结构性的,流程优先的公司正在领先,数据就绪而非数据规模才是 AI 产生复利效应的关键。报告建议重建数据基础设施、采用可组合架构,并解决 AI 主权问题。
GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文章以添加认证流程为例,说明开发者角色正从逐行实现转向定义问题、审查 AI 输出并做技术决策;并提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型对计划、代码和测试进行评审。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相应工作流。
Clay 联合创始人兼 CEO Kareem Amin 将在 TechCrunch Disrupt 2026 的 AI Stage 发表演讲,主题为“GTM 工程师:AI 如何创造科技业下一个大职位类别”。
TechCrunch Disrupt 2026 将于 10 月 13–15 日在旧金山 Moscone West 举行,Blackstone N1 全球负责人 Jas Khaira 将在 Builders Stage 发表“Building the Next Generation of AI Giants”演讲。
Airbnb CTO Ahmad Al-Dahle 披露公司 AI 转型进展:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单已完全由 AI 解决。
生成式 AI 的普及正在改写“顾客永远是对的”这句老话:纽约服务员 Madison 称有客人以 ChatGPT 为由无视贝类过敏警告,还有客人拒绝侍酒师、改问 ChatGPT 并点出不存在的酒。护林员 Jason 遇到游客拿着 AI 编造的行程来公园,幼教 Casey 则见到家长用 ChatGPT 排的睡眠时间反驳专业建议。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。