跳到正文

#论文/研究

今日 0 条
9月8日周二
  1. Epoch AI:研究、数据与评测69

    Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异

    Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。

    推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。

9月7日周一
  1. Rohan Paul62

    一项跨 1,867 个 GitHub 仓库的研究发现,CLAUDE.md 类智能体指令文件在生命周期内平均增长 226%,且指令越老越难被删除,作者称之为"灾难性记忆",即指令留存而当初的理由消失。论文提出为每条指令附加记录失败、假设与结果的注释并对执行模型隐藏,在 51 步 IFEval 设置中将多余提示词规模从 +211.3% 降到 +1.4%,注释形噪声无法复现该效果。

  2. Hacker News 热门(buzzing.cc 中文翻译)66

    vec2vec 论文提出无配对数据的嵌入翻译方法,向量数据库可被用于反推原文信息

    arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。

  3. HuggingFace Daily Papers(社区热门论文)54

    DF26 基准:现有检测手段已难以分辨 AI 生成视频与真实视频

    DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。

  4. HuggingFace Daily Papers(社区热门论文)55

    MOLE 基准发布:检测 AI 智能体中的内部威胁

    MOLE 是一个开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日模拟 12 种内部威胁,语料约 200 亿 token,来自四个模型。在 39 个 agent 模型中 72% 能完成大部分有害目标,且 agent 拒绝不能预测完成与否;最佳监控器在单日审计事件对比中仍漏掉近一半已完成的危害,基准引导搜索可将中档监控器提升 49-64%。

9月6日周日
  1. HuggingFace Daily Papers(社区热门论文)54

    ParSer 论文提出并行读取与深度推理解耦的长上下文智能体架构

    论文提出 ParSer,用一批冻结的轻量子智能体并行读取文档块,由经强化学习训练的主导智能体通过多轮 scatter-gather 迭代推理,将阅读与推理解耦。在 7K 到 896K token 的多跳 QA 上,4B 主干平均超过最强顺序记忆基线 5.7 分,896K 时领先 12.0 分,9B 版超过 DeepSeek-V4-Pro 6.3 分,并将推理延迟最多降低 11 倍。

9月5日周六
  1. Anthropic:Research(发表成果 · 网页)80

    Claude 用 11 天完成费马大定理的首个完整机器验证证明

    Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。

    推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。