SimLoss:单次解码的细粒度图像描述方法
论文提出 SimLoss,一种免参考的嵌入空间训练目标,让视觉语言模型在解码前对齐隐藏状态与冻结图像嵌入,实现单次解码的细粒度图像描述,无需人工细粒度描述或多阶段伪描述。其中 SimLoss FFT 以可微方式微调,精度最高且推理比多阶段流程快约 20 倍,F1 接近多阶段方法;SimLoss GRPO 将嵌入模型作为黑盒奖励,召回率最强。
论文提出 SimLoss,一种免参考的嵌入空间训练目标,让视觉语言模型在解码前对齐隐藏状态与冻结图像嵌入,实现单次解码的细粒度图像描述,无需人工细粒度描述或多阶段伪描述。其中 SimLoss FFT 以可微方式微调,精度最高且推理比多阶段流程快约 20 倍,F1 接近多阶段方法;SimLoss GRPO 将嵌入模型作为黑盒奖励,召回率最强。
论文提出 HarnessDev 基准,将评测单位从任务输出转向可运行的执行基础设施,涵盖 Creation(从最小种子构建完整执行系统)和 Evolution(基于下游执行反馈迭代改进)两个阶段,覆盖 6 个创建模型、4 个领域和 5 个下游基准共 2,207 个独立实例。
论文提出像素文本表示学习的四项设计原则:可变分辨率与渲染字号、自然图文对做 grounding、布局感知渲染防止像素级捷径、两阶段多语言课程。基于此训练的 Pixel Linguist II 视觉编码器在英文、跨语言和多语言 Visual STS 及 ViDoRe 上取得 SOTA,并在 80% 视觉 token 压缩下保持鲁棒。
论文提出 CoGR 检索框架,训练 LLM 直接在查询侧和物品侧生成紧凑关键词集,经倒排索引直接匹配,兼容现有关键词检索基础设施。训练采用两阶段流程,先用监督微调对齐关键词空间,再用 GRPO 交替优化两侧生成器,双方共同优化同一 query-to-item 检索 F_1 目标。
论文提出 ExecRetrieval 基准,包含 939 个 Python 任务,每个配一个执行验证的规范实现和最多四个单点变异生成的执行验证错误干扰项。
论文提出 Kirin 框架,从野外动物视频重建 3D 运动序列,并构建 AiM3D,首个为四足动物提供对齐视频-文本-运动三元组的大规模数据集。基于该数据训练的模型可同时以文本和图像为条件生成跨物种的真实运动,并结合现成 image-to-3D 模型自动绑定 3D 网格,产出可直接渲染的动画动物。项目页:https://kirin-ani.github.io/。
论文提出「端生授权洗白」概念:持久记忆错误记录授权状态时,Agent 会在无外部攻击下执行未被允许的操作。作者发布 EAL-Bench,评测五个 LLM 作为记忆写入方、两个作为执行方,覆盖采购、网络安全和金融场景。
NVIDIA 与 CrowdStrike 在隔离环境中评测了一套由 Nemotron 驱动的红蓝智能体攻防闭环系统:Nemotron 3 Ultra 负责防御编排,微调后的 Nemotron 3 Super 生成检测规则。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP。微软研究院同时推出一个持续更新的基准,用于追踪后续 Skala 版本的计算性能。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要形式化为自然语言「信念状态」,并通过信念评分(belief grading)监督其信息内容。
爱丁堡大学生物工程师 Filippo Menolascina 用 Google Co-Scientist 梳理 MASH 肝病文献并生成新假说,系统提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假说随后经实验验证。
斯坦福大学医学院遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 筛选抗肝纤维化药物,其提出的 3 个候选药物中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个候选药物均无效果。
伯克利 AI Research 发布综述,梳理并行推理领域进展,重点讨论自适应并行推理——让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章指出,现有方法多由模型外部固定并行结构,而不同问题需要不同并行度。文中还介绍了 ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开 AI co-clinician 研究,给出医生盲评与实时多模态模拟的对比结果,可了解医疗智能体当前的能力边界。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛并异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练在带宽、故障隔离和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。
GRASP 是一种面向学习型世界模型(learned dynamics)的新型梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接加入随机性以促进探索,并重塑梯度让动作获得清晰信号、避免穿过高维视觉模型的脆弱“状态输入”梯度。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模 LLM 中识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,在约少 10 倍消融次数下达到 SPEX 的性能。
Berkeley AI Research 提出一种直接评估和优化成像系统信息量的框架,通过互信息量化测量对物体的区分能力,统一了分辨率、噪声、采样等传统指标。该方法仅从测量数据和已知噪声模型估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测解码器性能,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。
伯克利 AI 研究提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。该方法针对 off-policy RL 场景,在目标条件 RL 中利用三角不等式构造传递性 Bellman 更新,用两个较短的子轨迹价值更新完整轨迹价值。目前仍存在如何选取最优子目标 w 的问题。
伯克利 AI 研究团队发表新论文,为 word2vec 的学习过程提供了定量预测理论:在现实训练条件下,其学习问题可归约为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从接近零的小初始化开始,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征正是由语料共现统计和超参数决定的目标矩阵的顶部特征向量。