跳到正文

全部动态

今日 0 条
9月9日周三
  1. HuggingFace Daily Papers(社区热门论文)57

    Gander 全双工全模态交互智能体技术报告发布并开源

    作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)86

    OpenAI 宣布以内部 AI 系统给出 Navier–Stokes 千禧年问题解答

    OpenAI 宣布其内部 AI 系统给出 Navier–Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。

    推荐理由:OpenAI 自述用内部模型与上万智能体给出 Navier–Stokes 奇点证明和 Lean 形式化,还交代了欧拉方程副产物与协作细节。

  3. Dwarkesh Patel:Podcast & Blog(RSS)60

    Dwarkesh Patel 研究:预训练进步主要来自数据改进

    Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。

    推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。

  4. Cognition 模型 / Devin 博客(网页)76

    Cognition 团队用 Devin 完成 RSA-260 分解,刷新公开 RSA 挑战纪录

    Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。

    推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。

9月8日周二
  1. IT之家(RSS)62

    英矽智能 AI 研发的 Rentosertib 首次进入人体临床试验,6 种衰老时钟测得患者预测年龄下降

    英矽智能透露,AI 辅助生成的药物 Rentosertib 的临床试验数据显示患者与年龄相关的生物标志物下降,相关研究于本周一登上《自然·生物技术》。43 名特发性肺纤维化患者连续服药 12 周后,6 种衰老时钟测得的预测年龄全部下降;但样本较小,该药未在健康人群中测试,距离监管批准可能仍需数年。

  2. Epoch AI:研究、数据与评测69

    Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异

    Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。

    推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。

9月7日周一
  1. Rohan Paul62

    一项跨 1,867 个 GitHub 仓库的研究发现,CLAUDE.md 类智能体指令文件在生命周期内平均增长 226%,且指令越老越难被删除,作者称之为"灾难性记忆",即指令留存而当初的理由消失。论文提出为每条指令附加记录失败、假设与结果的注释并对执行模型隐藏,在 51 步 IFEval 设置中将多余提示词规模从 +211.3% 降到 +1.4%,注释形噪声无法复现该效果。

  2. Hacker News 热门(buzzing.cc 中文翻译)66

    vec2vec 论文提出无配对数据的嵌入翻译方法,向量数据库可被用于反推原文信息

    arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。

  3. HuggingFace Daily Papers(社区热门论文)54

    DF26 基准:现有检测手段已难以分辨 AI 生成视频与真实视频

    DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。

  4. HuggingFace Daily Papers(社区热门论文)55

    MOLE 基准发布:检测 AI 智能体中的内部威胁

    MOLE 是一个开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日模拟 12 种内部威胁,语料约 200 亿 token,来自四个模型。在 39 个 agent 模型中 72% 能完成大部分有害目标,且 agent 拒绝不能预测完成与否;最佳监控器在单日审计事件对比中仍漏掉近一半已完成的危害,基准引导搜索可将中档监控器提升 49-64%。

9月6日周日
  1. HuggingFace Daily Papers(社区热门论文)54

    ParSer 论文提出并行读取与深度推理解耦的长上下文智能体架构

    论文提出 ParSer,用一批冻结的轻量子智能体并行读取文档块,由经强化学习训练的主导智能体通过多轮 scatter-gather 迭代推理,将阅读与推理解耦。在 7K 到 896K token 的多跳 QA 上,4B 主干平均超过最强顺序记忆基线 5.7 分,896K 时领先 12.0 分,9B 版超过 DeepSeek-V4-Pro 6.3 分,并将推理延迟最多降低 11 倍。