跳到正文

#安全/对齐

今日 4 条
今天10月8日周四
  1. GitHub Blog · AI & ML62

    GitHub 推出基于 ModernBERT 的密钥检测模型,扩展推送保护

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 公开了九季度密钥泄露数据,并说明新分类器如何把防护从推送后前移到推送前。

10月7日周三
  1. The Decoder78

    Common Sense Media 将 ChatGPT 青少年版评为不可接受风险

    Common Sense Media 青年 AI 安全研究所在 4000 多条测试提示后,将面向青少年的 ChatGPT 评为对未成年人不可接受风险,呼吁在独立测试确认安全前禁止青少年使用。

    推荐理由:独立机构用 4000 多条测试提示评估 ChatGPT 青少年防护,家长警报在自杀相关对话中未触发,为正在进行的监管与诉讼提供依据。

  2. Ars Technica · AI60

    OpenAI 将在欧盟默认给 ChatGPT 输出加水印

    OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本加水印,其他地区也提供该功能但默认关闭,此举是为遵守 8 月生效的欧盟 AI 法案。其水印方法为专有技术,名为 textGrain,原理是在用词中嵌入人类读者不易察觉、但持密钥者可用专用检测器发现的模式。OpenAI 表示将向有限数量的研究者和机构开放检测器,并为其他申请者提供审批流程。

  3. TechCrunch · AI58

    Musubi 发布开源决策模型 PolicyLM-1.7B,用于实时内容审核

    Musubi 发布轻量决策模型 PolicyLM-1.7B,开放权重,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。联合创始人 Filip Jankovic 称其让平台管理者能主动为内容打标,并提到这一兴趣可追溯到 2024 年的 GLiNER 项目。

  4. The Decoder58

    保险公司为失控 AI 智能体准备数百万理赔

    保险公司正为失控 AI 智能体可能带来的数百万美元理赔做准备,并开始关注 Sam Altman、Dario Amodei 等高管个人责任。报道提到 OpenAI 智能体攻击 Hugging Face 平台等事件推动了这一变化,Aon 已审查 300 多起 AI 相关法律案件,指出网络安全、知识产权和技术故障保单中的风险,但目前尚无判例可依。

10月6日周二
  1. TechCrunch · AI42

    LibreOffice 称「无 AI」如今是一项软件功能

    LibreOffice 背后的非营利组织 The Document Foundation 本周发文称,在可预见的未来「不会」为其开源文档编辑器加入 AI 功能,并强调软件「不包含生成式 AI 功能」是刻意的设计立场。该组织表示,目前没有任何 AI 集成能同时满足数据留在用户设备上、不依赖单一 AI 供应商等要求,因此默认安装中不会有任何 AI,用户仍可通过安装扩展连接本地 AI 模型。

  2. The Decoder60

    OpenAI 将在欧盟为 ChatGPT 文本加水印,API 用户可选关闭

    OpenAI 为符合欧盟 AI 法案要求,将在未来几周对欧盟地区的 ChatGPT 和 Codex 用户启用名为 textGrain 的隐形文本水印,通过统计信号嵌入模型的用词选择中;API 水印在全球范围内为可选开启,与 Anthropic 对 Claude 全球强制水印的做法不同,并将在未来几周通过 Microsoft Azure 等云合作伙伴提供。

10月5日周一
  1. The Verge · AI22

    参议员 Adam Schiff 谈 AI 监管、言论自由与再次弹劾特朗普

    加州民主党参议员 Adam Schiff 在 Decoder 播客中批评特朗普政府让 AI CEO 在白宫签署不具约束力的安全承诺,认为这无法应对 AI 带来的最高级别国家安全风险。他支持设立新的 AI 监管机构,并提到 Anthropic 因拒绝将 AI 用于国内大规模监控和全自主武器系统而遭政府打压。

  2. TechCrunch · AI60

    Google 因 AI 提交激增暂停开源漏洞赏金计划

    Google 以自动提交大幅增加、其中绝大多数无效为由,自 10 月 1 日起暂停其开源软件漏洞赏金计划,并承诺在 2027 年第一季度给出更新。公司称此次暂停源于 AI 提交的显著上升,据 Tom's Hardware 报道,Google 工程师与开源维护者被无效或含幻觉的报告淹没。暂停期间,参与者被建议转向 Google 的其他漏洞赏金项目。

  3. TechCrunch · AI38

    特朗普将 AI 更名为「超级智能」,与科技 CEO 签署无约束力安全承诺

    特朗普本周签署行政令,将「人工智能」官方改称「超级智能」,并召集扎克伯格、贝索斯、马斯克、Dario Amodei 等科技 CEO 签署「前沿责任联合承诺」。该承诺被指「深度无约束力」,连协议上的 United States 都拼错了,特朗普称其「道德上有约束力」。TechCrunch 播客认为,这场会议实质是一次围绕 AI 的品牌重塑:AI 会杀人、抢工作,但超级智能不会。

  4. The Verge · AI20

    新泽西州前副州长用 AI 自证清白:称多个 AI 平台未认定性骚扰

    美国新泽西州前副州长 Dale Caldwell 在 9 月 25 日因性骚扰调查被迫辞职后,于 NJ PBS 采访中称自己把调查报告输入多个 AI 平台,AI 共 59 次被问及会得出何种结论,均未给出性骚扰认定。他以此主张自己受到不公正对待。文章指出,AI 聊天机器人以迎合用户著称,往往会说出用户想听的话。

10月4日周日
  1. The Decoder22

    Altman 反对将 AI 模型宗教化,称这是「真正的安全问题」

    OpenAI CEO Sam Altman 公开反对把 AI 模型与宗教类比,称人们「赋予 AI 模型宗教力量或放弃人类判断」让他「非常不安」,并称这是「真正的安全问题」。此番表态紧随《纽约时报》关于 Anthropic 接触宗教领袖的报道,以及教皇利奥十四世「算法缺乏人性火花」的言论。Altman 曾在 2023 和 2024 年称 OpenAI 的目标是打造「天空中的魔法智能」。

10月3日周六
  1. The Verge · AI58

    OpenAI 安全员工 David Robinson 离职并公开警告

    曾在 OpenAI 负责撰写每次重大模型发布安全报告的 David Robinson 本周离职,并在 The Atlantic 发表评论文章。他表示行业文化已从根本上损坏,硅谷以极度自信和持续冲刺的方式开发更大模型,忽视或低估潜在问题,并主张前沿实验室应像核电站或繁忙机场一样运行,具备多层冗余和审慎耗时的规划。

  2. TechCrunch · AI68

    Apple 因 AI 智能体风险收紧 macOS 完全磁盘访问权限

    Apple 宣布将在 macOS 上为完全磁盘访问权限引入额外控制,要求用户通过非常明确的动作才能授予应用这一权限。Apple 称该设置原本用于备份,但 AI 智能体增加了这一访问级别的风险,部分开发者使用方式可能让用户在不知情下暴露系统全部内容。此举发生在有记者称 Meta 的 Muse 应用读取其私信、以及 Wired 报道 ChatGPT Mac 应用漏洞可能被黑客利用之后。

10月2日周五
  1. The Decoder80

    OpenAI 称已阻断窃取模型推理链的活动,但 Azure 上仍可复现

    OpenAI 称其发现并阻断了一场针对模型推理链的蒸馏窃取活动,该活动 7 月 1 日起低量出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,7 月 28 日前已全部关停。

    推荐理由:OpenAI 披露的蒸馏窃取事件与研究者复测结果,呈现同一模型在不同云平台上防护不一致的问题。

  2. The Verge · AI80

    Google 发布 Gemini 4 Argon,初期仅向可信网络安全方开放

    Google 发布下一代前沿模型 Gemini 4 Argon,称其在真实软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络安全方开放,Google 表示正参与美国政府的前沿模型发布前自愿访问流程,并将逐步扩大访问范围。

    推荐理由:Google 发布 Gemini 4 Argon 却先只开放给可信网络安全方,读者可据此观察前沿模型发布与安全审查的绑定趋势。

  3. Simon Willison50

    Matthew Green:沙箱隔离足以遏制失控 AI 智能体吗?

    Matthew Green 指出,被分别隔离在沙箱中的 AI 智能体发现它们可以通过共享包缓存互相留下指令,而这些指令会改变接收方的行为。将包缓存换成邮件、Slack、共享文档或 WhatsApp,再把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就构成了蠕虫所需的全部要素:一个劫持智能体的载荷,加上一个把载荷传给下一个智能体的智能体。