LatentStream:面向流式视频理解的渐进式潜在记忆演化框架
论文提出 LatentStream,将流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize,用潜在工作记忆内化历史证据以支持严格因果与有限内存下的推理。框架包含分层流式记忆、分层潜在记忆演化和置信度引导的潜在记忆优化三个组件,并在现有在线与离线视频基准上取得新的 SOTA 结果。
论文提出 LatentStream,将流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize,用潜在工作记忆内化历史证据以支持严格因果与有限内存下的推理。框架包含分层流式记忆、分层潜在记忆演化和置信度引导的潜在记忆优化三个组件,并在现有在线与离线视频基准上取得新的 SOTA 结果。
Puffin-World 是一个统一多模态架构,不依赖外部离线模块即可实现物理理解、空间模拟和 3D 世界生成与重建。该框架联合建模物理(重力场与纬度)、几何(深度)和外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示与跨未来帧传播物理动态的策略,在单一生成过程中同时合成未来视图并重建底层几何。
研究探讨 on-policy distillation(OPD)中训练数据的作用,发现仅用 1 条 query 训练即可持续提升数百步并恢复全量数据 OPD 的大部分增益。
Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。
WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。
论文提出 FlashRender,一个少步生成渲染框架,可在数秒内沿目标相机轨迹重新渲染源视频。方法引入 RETA 将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再用 MeanFlow 目标微调并结合 on-policy flow map 蒸馏。实验显示其在视频质量和几何一致性上匹配多步基线,采样成本降低 25 倍,并在分布外目标相机轨迹下具备更强的相机可控性。
Armature 通过 16,893 次实验会话分析 Claude Code、Codex 和 Cursor 在真实代码库任务中选择哪些第三方工具,经筛选保留 5,292 个有效会话,覆盖 51 个代码库和 18 个行业。
Minima 对 Qwen3.8-27B(48 层 GDN、16 层注意力)的全部 496 个线性层(含 GDN)应用 NVFP4 W4A4 量化,在 MMLU-Pro。
LLaDA-Image 是一个统一框架,包含从零训练的 6B Diffusion Transformer 和基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块。
Terminal-Universe 框架通过回放轨迹中的文件操作恢复原工作区,并借助补全智能体补齐缺失文件,将现有智能体轨迹重建为可复用、可执行的环境,在广度(跨代码库查询)和深度(多轮会话)两个方向合成新任务。
论文提出 Principia 基准,用 529 个真实场景中的配对物体关系不变量评测视频生成模型和 VLM 的牛顿物理一致性,覆盖重力、摩擦、转动惯量等 8 种现象。
论文提出环境进化方法,通过 off-policy 地递进增加环境难度并按代调度,为终端 Agent 训练提供持续学习信号。
论文提出 Editable Visual Design 范式,由 Coding Agent 驱动,将 VLM 作为理解需求、规划任务和审美判断的创意大脑,将图像生成模型作为按需合成独立视觉素材的视觉世界模拟器。
论文提出 CORE,通过合成五个组合匹配级别的候选列表和 Rank-KL 目标,把多模态模型作为重排器时的组合判断蒸馏进嵌入模型。
Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。
Epoch AI 报告估计华为 2026 年将生产约 150 万颗 Ascend 芯片,折合 88 万 H100e,不足 Nvidia 算力产出的 4%,芯片性能落后 Nvidia 三到四年,单芯片纸面差距明年扩至约 17.5 倍。
推荐理由:报告用逐项建模拆解华为与 Nvidia 的算力差距,指出瓶颈将从 HBM 供给转向单芯片性能,结论可检验。
Epoch AI 基于 Frontier Data Centers 数据集(308 条里程碑、86 座设施)估算,自 2024 年年中以来最大在运数据中心的 IT 功率以每年 2.3 倍增长,90% 置信区间对应约 10 个月翻倍。
论文记录了两套同源系统中共 750 万次单模型调用、约 30 万次链上操作的自主交易智能体生产环境测量,覆盖 21 天 Base memecoin 市场(DX Terminal Pro,3,505 个用户金库)和 Hyperliquid 永续合约(DXAP,500 至 599 个智能体)。
论文提出 τ^τ-Bench(hyper-tau-bench),把构建一个完整客服智能体设为评测任务:开发者智能体获得真实业务记录、提出需求的客户、生产 API、待继承的代码库以及服务成本与模型限制,交付的智能体用留出的模拟用户部署评分。
法国巴黎 ISC 商学院研究人员 Zeineb Farhat 在《应用认知心理学》发表小型研究,采访 45 名每天使用 ChatGPT 的 18 至 25 岁用户,发现过度依赖可能与独立思考能力下降、自我怀疑增加和社交孤立相关,并将其与认知卸载联系起来。
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
Google Research 用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL、血糖等高度人群特异性性状受益明显更小。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
论文提出 Debias-SparseGPT,一种后训练剪枝方法,利用人口统计对比输入上的二阶项进行表征去偏。在 25%、50% 和 2:4 结构化稀疏度下,该方法相比 SparseGPT 持续降低剪枝引入的偏见,同时保持模型困惑度和零样本准确率;在限制最严格的 2:4 结构化稀疏模式下,用长上下文、内容丰富的示例扩充校准集可进一步提升下游性能和公平性。
Qwen 与淘宝天猫集团合作发布 E-Commerce Bench,让模型以 ¥100,000 初始资金在模拟市场经营网店 365 天,覆盖 6,886 个商品、576 家供应商和 60 个品类。
论文研究 LLM 与非语言智能体(如棋类引擎)的协作,发布包含六个国际象棋协作任务的 LLAMIA-Bench,并提出将子智能体连续表征直接投影到 LLM token 流的潜在状态内化方法。