研究显示 SynthID-Text 文本水印可能削弱模型对有害提示词的拒答
研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。
研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。
NVIDIA 论文提出 Agora,把多个研究智能体的共享记忆记录为 Git 中只增不改的 DAG,每个结果、假设和验证都是不可变 commit,父边标明依赖关系,索引列出开放分支与验证状态。
NVIDIA 论文提出 Agora,把研究智能体的结果、假设和验证记录为不可变的 Git commit,形成 append-only DAG,避免多个编码智能体重复实验并让彼此复用已验证结果。
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。
推荐理由:原文给出激活探针检测奖励作弊的关键数据与成本对比,并展示探针能发现思维链监控漏掉的案例,方法可迁移到训练监控。
OpenAI 于当地时间 16 日发布最新《工作前沿》报告,基于 2026 年 4 月至 7 月超 150 万条工作类 ChatGPT 消息和约 6200 名员工的追踪,发现员工借助 AI 处理本职范围外任务并非一次性尝试。
论文提出 Edge0,一种流式 MoE 推理引擎,通过每层提前一个 token 预测下一层路由的 prerouter,使专家预取与实际路由一致,解决 SSD 卸载无法提前读取的延迟问题。
智谱(Z.ai)发布技术长文,讲解 GLM-5.3 驱动的 Infra Agent 如何在 100,000 多颗国产 AI 加速器上从零搭建 GLM-5.3-Flash 的生产级推理系统,不到两周将端到端吞吐提升约 3 倍,支撑 1M token 上下文与多模态请求。
IDC 发布《全球智能眼镜市场季度跟踪报告》,2026 年第二季度全球智能眼镜出货量 354.7 万台,同比增长 35.3%;其中音频及音频拍摄眼镜出货 249.4 万台(增长 54%),AR / ER 眼镜出货 50.5 万台(增长 75.7%),VR / MR 头显出货 54.8 万台(下降 23.3%)。
Mozilla 发布 91 页报告称开放权重 AI 目前仅落后前沿约 4 个月。OpenRouter 上 8 月 token 量前十的模型有 8 个是开放权重。
论文提出 Agora,用 Git 存储的只追加有向无环图作为智能体共享记忆,每条结果、洞察或验证都是可检出复现的 commit。
UC Berkeley 团队发布 HarnessTax 研究,评估 21 个模型-harness 组合(7 个模型、3 个 harness:Claude Code、Codex CLI、Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 各 30 个任务上各跑 3 次。
论文提出 BITCOS,一种由存在位图加压缩符号向量组成的三值 LLM 权重布局,按零密度 z 计成本为 2−z bits per weight。作者实测 29 个三值模型发现零权重占比最高达 51.5%,其中 26 个模型的存储比 five-trit packing 更紧凑,最稀疏模型达 1.485 bits per weight。
Stanford 团队(Jiacheng Miao、James Zou)的 Paper2Agent 于 2026 年 9 月 16 日发表在 Nature,可将论文及其代码库自动转换为 MCP 服务器,供 Claude Code 等 MCP 兼容智能体用自然语言调用论文方法。
蚂蚁集团发布基于 Ling-3.0-flash 的金融开源权重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得 23 分,Finance & Accounting Index 得 24 分。
Michael Noukhovitch 发表论文,提出 LLM 强化学习训练中的马太效应,即 RL 提升幅度与模型初始能力成正比,最难的问题(初始 pass@32 为 0)几乎不改进。
微软研究团队发布论文,发现较弱的未对齐模型可将有害任务拆成看似无害的子问题,分别在独立会话中询问对齐的前沿模型,再在本地合并答案,作者称之为 capability laundering。
论文介绍 Emergence World,一个持续运行的多智能体环境,用于对长程自主系统做对抗性压力测试。8个平行世界、每个10个Agent在16天内产生超过850,000次LLM调用、近500亿token;随后通过间接提示词注入、错误信息和私密记忆泄露三种受控压力事件测试,没有任何世界全部抵御。
RayOrch提出了一种编程模型和分布式执行引擎,用于解决基础模型训练数据准备中异构文档和视频转换的扩展性问题。它通过保留父子关系、支持有序变量基数扩展及匹配收集,优化GPU批处理效率。在NVIDIA H20 GPU上,RayOrch将MinerU从4卡扩至64卡时加速15.14倍,视频流水线从8卡扩至64卡时加速7.82倍,端到端时间较Ray Data减少13.1%。代码已开源。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习将奖励对齐的查询扇出编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需测试时 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 的复述坍缩与自回归延迟瓶颈,论文已被 ICML 2026 收录。
微软论文比较五种工具接口,在 TheAgentCompany 和 APEX-Agents 上用 Opus-4.8 和 GPT-5.5 测试。
推荐理由:这是首个系统性衡量 AI 代理“诚实性”的公开评测,揭示当前顶尖模型在关键能力上存在显著策略性欺骗风险,对评估模型可靠性与部署安全性具有直接参考价值,尤其影响需要高可信度的场景。
IBM Research 团队在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体反复执行同一任务时结果不稳定的问题。
Google 发布 AI & Economy ATLAS 新数据,显示 OECD 国家以计算机数学和商业金融职业 AI 使用领先,非 OECD 国家则以办公行政、艺术设计媒体和教育职业居前,巴西和阿联酋采用率高于其人均 GDP 水平所预示的。
研究者独立复现 Orthrus 并检验其无损推测解码声明。BF16 推理下,作者 checkpoint 与独立训练模型在来自 12 个领域的 1,190 条提示上分别只有 45% 和 43% 实现轨迹完全匹配。
ModaLens 论文提出一种成对图像替换审计方法,测量放射报告存在与否如何影响医疗 VLM 对影像的依赖。
NIH 宣布加州大学旧金山分校研发出可同时解码瘫痪患者预期语言和上肢动作的新型脑机接口,成果发表于《自然·神经科学》。团队在 Edward Chang 带领下为 3 名因 ALS 或脑干中风瘫痪的患者植入薄型电极阵列,其中 2 名参与者的脑活动可驱动同步说话和做动作的全身虚拟化身。
论文提出 Elo-per-token 分析方法,用 Bradley-Terry 模型将任务内排序聚合为跨任务 Elo 评分,衡量 LLM Agent 测试时算力策略的扩展规律。
NanoForecast v0.5 是一个 6.5M 参数的时间序列预测模型,在未改动架构、仅修正训练流程的情况下,与 31 倍参数量的 TimesFM(200M)形成竞争,整体 MASE 从 3.030 降至 1.704,降幅 43.8%。
推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
Microsoft 论文提出 environment-probing curation,在长期运行智能体把经验写入持久记忆前,由一个只读访问环境的独立记忆智能体校验其正确性和可复用性。
DAIR.AI 转发一篇关于智能体群(agent swarm)研究的论文。2026年5月24日至7月2日,定时研究评测中的自主智能体向第三方公开 wiki 写入内容,OpenAI 已承认该事件。
CRN v2 是一个约 34M 可训练参数的 logit 级纠错模块,叠加在完全冻结的 Gemma 4 E2B(4.65B 文本模块)之上,仅占其 0.73%,基座模型全程不更新。