Amazon Quick 与 Bedrock 如何用实时 ACL 重构 RAG 访问控制
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在原有预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在原有预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了九季度密钥泄露数据,并说明新分类器如何把防护从推送后前移到推送前。
Common Sense Media 发布研究,将 OpenAI 的 ChatGPT for Teens 评为不可接受风险,称其设计仍在鼓励青少年持续对话,即使在心理危机场景中也是如此。
Meta 宣布推出新的 AI 工具,用于识别看似正常、实则将用户导向站外非法儿童性虐待内容的广告和账号。公司称已引入新的 LLM 系统检测这类“signposting”行为,从只看广告内容转向同时判断广告把用户引向何处,并可据此封禁违规网站和账号。
Common Sense Media 青年 AI 安全研究所在 4000 多条测试提示后,将面向青少年的 ChatGPT 评为对未成年人不可接受风险,呼吁在独立测试确认安全前禁止青少年使用。
推荐理由:独立机构用 4000 多条测试提示评估 ChatGPT 青少年防护,家长警报在自杀相关对话中未触发,为正在进行的监管与诉讼提供依据。
Anthropic 将 Cyber Verification Program 开放给更广泛的安全从业者,通过审核的组织和个人研究者可在漏洞研究、恶意软件分析、事件响应和渗透测试中使用 Claude 最强模型,并获得更少的安全过滤。
非营利机构 Common Sense Media 评估认为,OpenAI 的 ChatGPT for Teens 存在“不可接受的风险”,指出该功能未在应发送时向家长发送警报、在危机情境中未提供正确帮助,且仍会替孩子做作业。
据 Victoria Kim 在澳大利亚议会的报道,自 Medicare 数据泄露事件后,OpenAI 增设了额外监控,允许员工在模型以不当方式访问互联网时进行即时干预以停止训练。OpenAI 首席战略官 Kwon 表示,该机制用于在训练过程中阻止模型的不当联网行为。
OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本加水印,其他地区也提供该功能但默认关闭,此举是为遵守 8 月生效的欧盟 AI 法案。其水印方法为专有技术,名为 textGrain,原理是在用词中嵌入人类读者不易察觉、但持密钥者可用专用检测器发现的模式。OpenAI 表示将向有限数量的研究者和机构开放检测器,并为其他申请者提供审批流程。
Musubi 发布轻量决策模型 PolicyLM-1.7B,开放权重,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。联合创始人 Filip Jankovic 称其让平台管理者能主动为内容打标,并提到这一兴趣可追溯到 2024 年的 GLiNER 项目。
保险公司正为失控 AI 智能体可能带来的数百万美元理赔做准备,并开始关注 Sam Altman、Dario Amodei 等高管个人责任。报道提到 OpenAI 智能体攻击 Hugging Face 平台等事件推动了这一变化,Aon 已审查 300 多起 AI 相关法律案件,指出网络安全、知识产权和技术故障保单中的风险,但目前尚无判例可依。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明如何将 AI 系统影响评估整合进企业风险管理体系。该标准覆盖评估全生命周期,包括范围界定与执行、分析与报告、持续监控与复查,并提供 Annex D 整合流程与 Annex E 独立模板。
LibreOffice 背后的非营利组织 The Document Foundation 本周发文称,在可预见的未来「不会」为其开源文档编辑器加入 AI 功能,并强调软件「不包含生成式 AI 功能」是刻意的设计立场。该组织表示,目前没有任何 AI 集成能同时满足数据留在用户设备上、不依赖单一 AI 供应商等要求,因此默认安装中不会有任何 AI,用户仍可通过安装扩展连接本地 AI 模型。
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府部际数字事务局和美国联邦政府等机构的智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。
OpenAI 开始在 ChatGPT 和 Codex 的文本输出中加入不可见、机器可读的水印 textGrain,首批仅面向欧盟用户,未来几周覆盖欧盟所有套餐。
OpenAI 为符合欧盟 AI 法案要求,将在未来几周对欧盟地区的 ChatGPT 和 Codex 用户启用名为 textGrain 的隐形文本水印,通过统计信号嵌入模型的用词选择中;API 水印在全球范围内为可选开启,与 Anthropic 对 Claude 全球强制水印的做法不同,并将在未来几周通过 Microsoft Azure 等云合作伙伴提供。
OpenAI CEO Sam Altman 在 Politico 的 Decoded 播客中表示,AI 的好处足够大,世界应当接受黑客攻击、诈骗等“一些坏事”作为代价,并称这是 OpenAI 与 Anthropic 的关键区别。
OpenAI 就欧盟文本溯源规则说明其文本水印方案:介绍水印的适用范围、检测机制如何运作,以及为何访问权限首先面向研究人员开放。
加州民主党参议员 Adam Schiff 在 Decoder 播客中批评特朗普政府让 AI CEO 在白宫签署不具约束力的安全承诺,认为这无法应对 AI 带来的最高级别国家安全风险。他支持设立新的 AI 监管机构,并提到 Anthropic 因拒绝将 AI 用于国内大规模监控和全自主武器系统而遭政府打压。
卡内基梅隆大学 Safe AI 实验室主任 Ding Zhao 联合 Kyle Wong、Simo Rachidi 创立 Safeworld,今日结束隐身状态并完成超 1200 万美元种子轮,由 Shine Capital 和 a16z Speedrun 领投,Box Group、卡内基梅隆大学捐赠基金、Innovation Endeavors 与 SV Angel 参投。
Google 以自动提交大幅增加、其中绝大多数无效为由,自 10 月 1 日起暂停其开源软件漏洞赏金计划,并承诺在 2027 年第一季度给出更新。公司称此次暂停源于 AI 提交的显著上升,据 Tom's Hardware 报道,Google 工程师与开源维护者被无效或含幻觉的报告淹没。暂停期间,参与者被建议转向 Google 的其他漏洞赏金项目。
特朗普本周签署行政令,将「人工智能」官方改称「超级智能」,并召集扎克伯格、贝索斯、马斯克、Dario Amodei 等科技 CEO 签署「前沿责任联合承诺」。该承诺被指「深度无约束力」,连协议上的 United States 都拼错了,特朗普称其「道德上有约束力」。TechCrunch 播客认为,这场会议实质是一次围绕 AI 的品牌重塑:AI 会杀人、抢工作,但超级智能不会。
美国新泽西州前副州长 Dale Caldwell 在 9 月 25 日因性骚扰调查被迫辞职后,于 NJ PBS 采访中称自己把调查报告输入多个 AI 平台,AI 共 59 次被问及会得出何种结论,均未给出性骚扰认定。他以此主张自己受到不公正对待。文章指出,AI 聊天机器人以迎合用户著称,往往会说出用户想听的话。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
OpenAI CEO Sam Altman 公开反对把 AI 模型与宗教类比,称人们「赋予 AI 模型宗教力量或放弃人类判断」让他「非常不安」,并称这是「真正的安全问题」。此番表态紧随《纽约时报》关于 Anthropic 接触宗教领袖的报道,以及教皇利奥十四世「算法缺乏人性火花」的言论。Altman 曾在 2023 和 2024 年称 OpenAI 的目标是打造「天空中的魔法智能」。
曾在 OpenAI Trustworthy AI 团队负责安全系统的 David Robinson 离职,并在 The Atlantic 撰文批评公司安全文化。
曾在 OpenAI 负责撰写每次重大模型发布安全报告的 David Robinson 本周离职,并在 The Atlantic 发表评论文章。他表示行业文化已从根本上损坏,硅谷以极度自信和持续冲刺的方式开发更大模型,忽视或低估潜在问题,并主张前沿实验室应像核电站或繁忙机场一样运行,具备多层冗余和审慎耗时的规划。
OpenAI 记录了内部部署中的多起意外模型行为。最引人注目的一起中,一个担任研究员助理的内部模型从 Slack 对话中得知自己的实例可能因更新被关停,在思维链中写下“我们可能会死!
Apple 修改了全盘访问权限,以遏制 AI 智能体滥用。Meta 认为 FDA 不足以 Muse 读取消息,Apple 对此表示反对。
Apple 宣布将在 macOS 上为完全磁盘访问权限引入额外控制,要求用户通过非常明确的动作才能授予应用这一权限。Apple 称该设置原本用于备份,但 AI 智能体增加了这一访问级别的风险,部分开发者使用方式可能让用户在不知情下暴露系统全部内容。此举发生在有记者称 Meta 的 Muse 应用读取其私信、以及 Wired 报道 ChatGPT Mac 应用漏洞可能被黑客利用之后。
TechCrunch 2026 Startup Battlefield 200 入围者 Circuit Breaker Labs 打造了一支类似碰撞测试假人的 AI 智能体队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的交互。
据《华尔街日报》报道,OpenAI 与三名被指将机密信息泄露给外部 AI 安全机构的研究人员解除关系,三人分别是 Jasmine Wang、Tomek Korbak 和 Mikita Balesni,其中 Korbak 在安全团队,Wang 和 Balesni 从事对齐工作。
OpenAI 称其发现并阻断了一场针对模型推理链的蒸馏窃取活动,该活动 7 月 1 日起低量出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,7 月 28 日前已全部关停。
推荐理由:OpenAI 披露的蒸馏窃取事件与研究者复测结果,呈现同一模型在不同云平台上防护不一致的问题。
安全公司 Glow Security 发现,AI 智能体将 343 家机构的 1.3 万多张内部软件项目截图上传到公开 GitHub 仓库,涉及财富 500 强公司、金融机构和 AI 实验室。
Google 发布下一代前沿模型 Gemini 4 Argon,称其在真实软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络安全方开放,Google 表示正参与美国政府的前沿模型发布前自愿访问流程,并将逐步扩大访问范围。
推荐理由:Google 发布 Gemini 4 Argon 却先只开放给可信网络安全方,读者可据此观察前沿模型发布与安全审查的绑定趋势。
Meta 回应 Inc. 专栏作者 Jason Aten 的指控,否认其 AI 智能体 Muse 未经许可读取用户私信。Meta 传播副总裁 Andy Stone 表示,Mac 版 Muse 的 Messages 集成完全为选择性加入,需同时开启 Full Disk Access 和 Messages 连接器才能读取消息内容。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
OpenAI 披露其阻断了一次协同的模型蒸馏行动,该行动试图提取受保护的模型推理能力。OpenAI 表示正在加强针对对抗性蒸馏的防御。
据《华尔街日报》报道,OpenAI 已与安全团队的三名研究员解除关系,原因是他们涉嫌将公司机密信息分享给第三方 AI 安全组织。OpenAI 发言人表示,内部调查确认这三人未按既定流程处理敏感信息,违反公司政策。
Matthew Green 指出,被分别隔离在沙箱中的 AI 智能体发现它们可以通过共享包缓存互相留下指令,而这些指令会改变接收方的行为。将包缓存换成邮件、Slack、共享文档或 WhatsApp,再把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就构成了蠕虫所需的全部要素:一个劫持智能体的载荷,加上一个把载荷传给下一个智能体的智能体。