跳到正文

#推理

今日 2 条
9月1日周二
  1. 上海人工智能实验室 InternLM:原创项目63

    上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型

    上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。

    推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。

  2. HuggingFace Daily Papers(社区热门论文)49

    研究分析 On-Policy Distillation 机制并提出无监督方法 OPSA

    论文定量分析 on-policy distillation(OPD)训练中的教师监督,发现其噪声随教师规模增大而增加,且学生策略对该噪声不敏感。学习集中在低 log-probability token 上,用单一固定负优势即可匹配教师提供的信号,表明 OPD 主要通过抑制低概率 token 起作用而无需教师。

  3. 公众号:千问APP(阿里)46

    千问APP升级学习功能,新增作文辅导与教材精讲

    千问APP在开学季升级学习功能,新增与教材同步的单元作文辅导、初中语文数学教材精讲,并将高中、大学数理化拍题讲解能力扩展至千问小讲堂,相关功能均免费开放。作文辅导通过逐步提问引导孩子梳理素材和结构;教材精讲可从章节或知识点切入,讲解中可随时打断追问,千问会根据具体问题调整讲解内容和节奏。

  4. HuggingFace Daily Papers(社区热门论文)40

    SimLoss:单次解码的细粒度图像描述方法

    论文提出 SimLoss,一种免参考的嵌入空间训练目标,让视觉语言模型在解码前对齐隐藏状态与冻结图像嵌入,实现单次解码的细粒度图像描述,无需人工细粒度描述或多阶段伪描述。其中 SimLoss FFT 以可微方式微调,精度最高且推理比多阶段流程快约 20 倍,F1 接近多阶段方法;SimLoss GRPO 将嵌入模型作为黑盒奖励,召回率最强。

  5. Rohan Paul61

    一篇论文在固定 12 个模型和 3,679 个问题的前提下,只改变提示词格式、选项顺序、打分方式等常规评测设置,结果排名大幅波动。gemma4-31b 得分在 31% 到 89% 之间,12 个模型中有 4 个至少在一种有效设置下排到第一;相邻模型平均 95.7% 的差距来自评测设置改变时会翻转答案的题目,最大不稳定来源是打分方式,即生成答案还是选最高似然选项。

  6. elvis42

    腾讯联合清华、上海 AI Lab 发布 ContextPilot 论文,训练智能体主动管理自身工作上下文,并在单次上下文编辑层面分配信用。方法在搜索、删除、摘要之外加入全局规划、长期记忆和自适应软压缩,让智能体可以卸载信息而非只能丢弃;训练上利用上下文与熵变化定位关键编辑决策,采样分支并从经过该编辑的分支轨迹估计动作级优势。

  7. elvis50

    Google 提出 SKILL.state,用显式可变执行状态替代追加式对话历史,解决长程智能体运行变慢和上下文污染问题。模型每步仅读取不可变技能规范、当前结构化状态和最新观察,中间推理在生成有效状态更新后即被丢弃,提示词不再随运行增长。在多个数据集、模型和执行环境中,任务准确率提升,累计 token 消耗下降,且该抽象与架构无关,可移植到现有技能运行时。

  8. DAIR.AI48

    Google 等机构提出 SKILL.state,用显式可变执行状态替代不断增长的对话历史,解决长程任务中智能体变慢和上下文污染问题。模型每步仅读取技能规范、当前状态和最新观测,中间推理在生成有效状态更新后即被丢弃。在多个数据集、模型和执行环境中,任务准确率提升,累计 token 消耗下降,且该抽象与架构无关,可移植到现有技能运行环境。

  9. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 实测 Claude Fable 5.1 登顶智能指数但每任务成本高 20%

    Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。

    推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。

8月13日周四
  1. Microsoft Research38

    微软发布 MindTopo 基准,揭示多模态模型拓扑推理短板

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型的拓扑推理能力,覆盖连通性、分离、顺序、包围与打结五类任务,并区分静态识别与交互规划两个认知层级。测试显示,当前专有与开源模型在静态推理上明显强于交互规划,且两者均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。

8月12日周三
7月26日周日
6月11日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。