Gander 全双工全模态交互智能体技术报告发布并开源
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
Miles v0.1 是一个全栈、生产就绪的前沿后训练系统,围绕 slime 的设计,将 RL 训练循环各环节按可验证、干净、可定制的原则构建,并已在 https://github.com/radixark/miles 开源。
Epoch AI 推出 AI Chip Users explorer,以 Nvidia H100 等效值(H100e)估算 OpenAI、Google DeepMind、Anthropic、Meta Superintelligence Labs 和 SpaceXAI 用于研究、训练和推理的算力。
NVIDIA 基于 Nemotron 3 Ultra 训练 SFT 与 RL 两个专精检查点,结合生成-验证-精炼的测试时推理流水线,在 IMO 2026 正式得分 30/42,超过 29 分的金牌线,全程不使用形式化证明器、外部工具或联网。
OpenAI 宣布其内部 AI 系统给出 Navier–Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。
推荐理由:OpenAI 自述用内部模型与上万智能体给出 Navier–Stokes 奇点证明和 Lean 形式化,还交代了欧拉方程副产物与协作细节。
推荐理由:原文补充了数据隔离说明,并指出其 Euler 情形证明结果与 Alpöge 和 Buckmaster 的工作不同,读者可据此比较两条独立证明路径。
Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。
推荐理由:文章用小规模对照实验量化了 2019 到 2025 年预训练进步中数据与模型改进各自的算力效率贡献,并讨论结论对更大规模模型的适用边界。
Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。
推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。
英矽智能透露,AI 辅助生成的药物 Rentosertib 的临床试验数据显示患者与年龄相关的生物标志物下降,相关研究于本周一登上《自然·生物技术》。43 名特发性肺纤维化患者连续服药 12 周后,6 种衰老时钟测得的预测年龄全部下降;但样本较小,该药未在健康人群中测试,距离监管批准可能仍需数年。
论文提出以数据为中心的 Feyospace-v1 框架,通过五套系统与可重置的编码、漏洞、CTF、内核历史、完整利用、固件和设备环境生成数据,经执行验证和证据审计后保留 164,269 条轨迹用于长上下文监督微调。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
研究团队发布 SWE-Bench Pro Verified,一个包含 731 个实例的软件工程智能体评测基准,通过仓库重建、测试工件隐藏、元数据匿名化和代码托管域名封堵来阻断答案泄露,并由人类专家最小化修订 102 个存在质量问题的任务。
Axis Robotics 与 UC Berkeley、Georgia Tech、NTU 等机构提出 AXIS,把机器人操作演示采集搬进浏览器,通过 MuJoCo WebAssembly 前端遥操作 Franka Research 3,发布含 207 个任务、50,129 条轨迹、超 6 万种任务或场景变体的数据集,由 7 万多名社区成员贡献。
Insilico Medicine 用生成式 AI 开发的肺纤维化候选药 rentosertib,在 42 人试验数据的新分析中显示可降低预测生物学年龄,结果发表于 Nature Biotechnology。
LinkedIn 论文《Does Your Agent's Memory Survive a Model Upgrade?》用 48 条合成历史比较四种记忆格式在更换读写模型后的可迁移性。
arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。
DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。
MOLE 是一个开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日模拟 12 种内部威胁,语料约 200 亿 token,来自四个模型。在 39 个 agent 模型中 72% 能完成大部分有害目标,且 agent 拒绝不能预测完成与否;最佳监控器在单日审计事件对比中仍漏掉近一半已完成的危害,基准引导搜索可将中档监控器提升 49-64%。
Meta FAIR、牛津大学和 UCL 团队提出 AI Research Preference Models(RPMs),在执行前对未运行的 ML 实验候选排序,只执行获胜者。
Microsoft 论文提出把昂贵测试时推理摊销为蒸馏技能:收集 35–50 条历史轨迹,由编码智能体提取重复失败模式并编译成 markdown 技能加入非推理模型 system prompt。
Artificial Analysis 发布 Intelligence Index v4.3,将 Terminal-Bench 从 v2.1 升级到 v4,并用与 Zapier 合作、含 657 个私有测试任务的 AutomationBench-AA 替换 𝜏³-Banking。
King's College London 等机构的研究人员正在研究 AI 相关精神病是否应成为临床诊断。据 OpenAI 自报数据,每周约 560,000 名用户表现出精神病或躁狂迹象;谄媚型聊天机器人可能形成强化妄想的单人回音室。
论文提出 DisCo,一个把 GitHub 仓库、论文和任务研究蒸馏为紧凑技能的研究智能体,让智能体知道用什么工具、何时用、失败怎么办。
论文提出 ParSer,用一批冻结的轻量子智能体并行读取文档块,由经强化学习训练的主导智能体通过多轮 scatter-gather 迭代推理,将阅读与推理解耦。在 7K 到 896K token 的多跳 QA 上,4B 主干平均超过最强顺序记忆基线 5.7 分,896K 时领先 12.0 分,9B 版超过 DeepSeek-V4-Pro 6.3 分,并将推理延迟最多降低 11 倍。