跳到正文

全部动态

今日 0 条
9月6日周日
9月5日周六
  1. Ethan Mollick56

    Anthropic 在 GitHub 上传了费马大定理的 Lean 4 完整机器校验证明(https://github.com/anthropics/fermats-last-theorem),基于 Mathlib(Lean 4.33.1、Mathlib v4.33.0),论证路线为 Frey、Serre、Ribet、Wiles 和 Taylor-Wiles。Ethan Mollick 转发并评论称,该证明的描述虽短,但 PROOF-PATH.md 中"为每一步命名并标注对应 Lean 定理"的写法仍很像 Claude 的产出。仓库标注为研究产物,不维护且不接受贡献。

  2. Anthropic:Research(发表成果 · 网页)80

    Claude 用 11 天完成费马大定理的首个完整机器验证证明

    Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。

    推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。

9月4日周五
  1. HuggingFace Daily Papers(社区热门论文)40

    Last Translation Benchmark 发布,用人工评审的多模态样本测试机器翻译模型极限

    研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。

  2. HuggingFace Daily Papers(社区热门论文)33

    PACE 数据集与 PaceMaker 框架:识别用户请求中的隐性冲突

    论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。