跳到正文

全部动态

今日 0 条
9月1日周二
  1. HuggingFace Daily Papers(社区热门论文)40

    SimLoss:单次解码的细粒度图像描述方法

    论文提出 SimLoss,一种免参考的嵌入空间训练目标,让视觉语言模型在解码前对齐隐藏状态与冻结图像嵌入,实现单次解码的细粒度图像描述,无需人工细粒度描述或多阶段伪描述。其中 SimLoss FFT 以可微方式微调,精度最高且推理比多阶段流程快约 20 倍,F1 接近多阶段方法;SimLoss GRPO 将嵌入模型作为黑盒奖励,召回率最强。

  2. HuggingFace Daily Papers(社区热门论文)47

    Pixel Linguist II:像素文本表示学习的设计原则与新视觉编码器

    论文提出像素文本表示学习的四项设计原则:可变分辨率与渲染字号、自然图文对做 grounding、布局感知渲染防止像素级捷径、两阶段多语言课程。基于此训练的 Pixel Linguist II 视觉编码器在英文、跨语言和多语言 Visual STS 及 ViDoRe 上取得 SOTA,并在 80% 视觉 token 压缩下保持鲁棒。

  3. HuggingFace Daily Papers(社区热门论文)38

    CoGR:用强化学习共同进化查询与物品两侧的生成式检索器

    论文提出 CoGR 检索框架,训练 LLM 直接在查询侧和物品侧生成紧凑关键词集,经倒排索引直接匹配,兼容现有关键词检索基础设施。训练采用两阶段流程,先用监督微调对齐关键词空间,再用 GRPO 交替优化两侧生成器,双方共同优化同一 query-to-item 检索 F_1 目标。

  4. HuggingFace Daily Papers(社区热门论文)41

    Kirin:从野外视频生成动物运动并自动绑定 3D 动画

    论文提出 Kirin 框架,从野外动物视频重建 3D 运动序列,并构建 AiM3D,首个为四足动物提供对齐视频-文本-运动三元组的大规模数据集。基于该数据训练的模型可同时以文本和图像为条件生成跨物种的真实运动,并结合现成 image-to-3D 模型自动绑定 3D 网格,产出可直接渲染的动画动物。项目页:https://kirin-ani.github.io/。

  5. Rohan Paul61

    一篇论文在固定 12 个模型和 3,679 个问题的前提下,只改变提示词格式、选项顺序、打分方式等常规评测设置,结果排名大幅波动。gemma4-31b 得分在 31% 到 89% 之间,12 个模型中有 4 个至少在一种有效设置下排到第一;相邻模型平均 95.7% 的差距来自评测设置改变时会翻转答案的题目,最大不稳定来源是打分方式,即生成答案还是选最高似然选项。

  6. elvis42

    腾讯联合清华、上海 AI Lab 发布 ContextPilot 论文,训练智能体主动管理自身工作上下文,并在单次上下文编辑层面分配信用。方法在搜索、删除、摘要之外加入全局规划、长期记忆和自适应软压缩,让智能体可以卸载信息而非只能丢弃;训练上利用上下文与熵变化定位关键编辑决策,采样分支并从经过该编辑的分支轨迹估计动作级优势。

  7. elvis50

    Google 提出 SKILL.state,用显式可变执行状态替代追加式对话历史,解决长程智能体运行变慢和上下文污染问题。模型每步仅读取不可变技能规范、当前结构化状态和最新观察,中间推理在生成有效状态更新后即被丢弃,提示词不再随运行增长。在多个数据集、模型和执行环境中,任务准确率提升,累计 token 消耗下降,且该抽象与架构无关,可移植到现有技能运行时。

  8. DAIR.AI48

    Google 等机构提出 SKILL.state,用显式可变执行状态替代不断增长的对话历史,解决长程任务中智能体变慢和上下文污染问题。模型每步仅读取技能规范、当前状态和最新观测,中间推理在生成有效状态更新后即被丢弃。在多个数据集、模型和执行环境中,任务准确率提升,累计 token 消耗下降,且该抽象与架构无关,可移植到现有技能运行环境。

8月21日周五
  1. Microsoft Research36

    微软研究院发布 Skala 1.1,并推进其在 CP2K、Psi4 等 DFT 软件中的集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP。微软研究院同时推出一个持续更新的基准,用于追踪后续 Skala 版本的计算性能。

8月13日周四
  1. Microsoft Research38

    微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。

7月26日周日
5月16日周六
5月8日周五
  1. Berkeley AI Research36

    自适应并行推理:高效推理扩展的下一个范式

    伯克利 AI Research 发布综述,梳理并行推理领域进展,重点讨论自适应并行推理——让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章指出,现有方法多由模型外部固定并行结构,而不同问题需要不同并行度。文中还介绍了 ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法。

4月30日周四
4月22日周三
4月20日周一
3月13日周五
1月10日周六
  1. Berkeley AI Research22

    信息驱动的成像系统设计:Berkeley 提出基于互信息的成像评估框架

    Berkeley AI Research 提出一种直接评估和优化成像系统信息量的框架,通过互信息量化测量对物体的区分能力,统一了分辨率、噪声、采样等传统指标。该方法仅从测量数据和已知噪声模型估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测解码器性能,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。

11月1日周六
  1. Berkeley AI Research36

    无需 TD 学习:用分治法实现可扩展的 off-policy 强化学习

    伯克利 AI 研究提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。该方法针对 off-policy RL 场景,在目标条件 RL 中利用三角不等式构造传递性 Bellman 更新,用两个较短的子轨迹价值更新完整轨迹价值。目前仍存在如何选取最优子目标 w 的问题。

9月1日周一
  1. Berkeley AI Research31

    word2vec 究竟学到了什么?新理论证明其等价于对目标矩阵做 PCA

    伯克利 AI 研究团队发表新论文,为 word2vec 的学习过程提供了定量预测理论:在现实训练条件下,其学习问题可归约为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从接近零的小初始化开始,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征正是由语料共现统计和超参数决定的目标矩阵的顶部特征向量。