跳到正文

#多模态

今日 4 条
9月2日周三
  1. Google DeepMind:Blog(RSS)72

    Google DeepMind 为 Gemini 推出 agentic 视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

    推荐理由:官方说明列出 token、成本与准确率三项数字和开启方式,开发者可据此评估长视频分析是否换用该模式。

9月1日周二
  1. IT之家(RSS)49

    阿里千问升级学习辅助功能:新增教材同步作文辅导并扩展高中大学数理化拍题讲解

    阿里宣布升级千问学习辅助功能,新增与教材同步的单元作文辅导、初中语文和数学教材精讲,并将“小讲堂”互动讲解能力扩展到高中和大学数理化拍题讲解,相关功能免费开放。升级强调引导学习过程而非直接给答案,学生可在讲解中随时打断追问,千问会根据具体问题调整讲解内容和节奏。

  2. HuggingFace Daily Papers(社区热门论文)47

    LightNav-0:激发 VLM 空间智能的通用具身导航模型

    研究团队发布 LightNav-0,一个紧凑的通用具身导航模型,通过双通道指向和残差向量量化动作 tokenizer 激发预训练 VLM 的空间智能,无需任务专用预测头。训练语料覆盖 2K+ 场景和 4K+ 小时具身导航数据,LightNav-0 在全部 10 个公开导航仿真环境中取得单目成功率 SOTA,真实世界评测显示跨机器人本体、场景及静态动态目标的零样本泛化能力。

  3. IT之家(RSS)42

    大连化物所联合科大讯飞、阿里云发布智能化工大模型 3.0 Pro

    中国科学院大连化物所联合科大讯飞、阿里云等研发的智能化工大模型 3.0 Pro 于 8 月 31 日发布,从知识问答模型升级为化工任务智能执行系统。模型构建大模型、智能体、专业技能与工具、应用场景四层体系,集成超过 400 个化工智能体和工具,文本问答与多模态问答准确率分别为 81.96% 和 80.75%,综合得分较 3.0 版本相对提升 20.2% 和 31.4%。

  4. HuggingFace Daily Papers(社区热门论文)36

    BLARM:通过混合潜在刚性运动基元从视频驱动 3D 物体动画

    论文提出 BLARM,一种前馈方法,输入单目视频和静态物体网格,即可预测运动跟随视频的时序连贯动画网格。方法用少量随时间变化的刚性运动分量和顶点到分量的蒙皮权重表示动画,无需骨骼、cage、蒙皮权重或绑定标注,通过分解时空注意力将几何形变潜变量条件于视频特征,并以轨迹重建、熵正则和运动感知对比学习训练,生成准确且时序稳定的动画。

  5. HuggingFace Daily Papers(社区热门论文)44

    MNIST-PRO 基准:将 MNIST 改造为面向 AI 智能体的部分可观测环境

    研究者提出 MNIST-PRO 基准,把 MNIST 数字识别改造成带回看约束的序列化瞥视搜索任务,以隔离评测智能体的感知状态构建能力。评测覆盖十个多模态模型和四种记忆表征,发现模型在全可观测下表现良好,但部分可观测下暴露三类瓶颈:难以整合碎片化瞥视、过早停止探索、面对矛盾证据时难以修正早期错误信念。

  6. HuggingFace Daily Papers(社区热门论文)45

    Lucida:面向可组合真实到仿真场景建模的解析、生成与放置框架

    Lucida 提出可组合真实到仿真场景建模方法,将真实室内场景恢复为按观测排布、可单独操作的完整可编辑物体资产。方法沿用解析、生成、放置三步,但把精度要求重新分配到流水线末端:解析视频生成携带逐实例多视角证据的场景图,据此生成完整资产,并用 VLM 策略 GizmoAct 将放置建模为多轮 GUI 交互,闭环操纵物体 gizmo 并自行判断对齐完成。

  7. 上海人工智能实验室 InternLM:原创项目63

    上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型

    上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。

    推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。

  8. 公众号:百度智能云(文心)34

    百度千帆Token Plan企业版更新:DeepSeek-V4-Pro-0813与GLM-5.3等三款模型上线并接入百度搜索工具

    百度千帆Token Plan企业版更新,DeepSeek-V4-Pro-0813正式版与GLM-5.3、GLM-5.3-Flash三款模型上线,原有模型ID可直接调用。百度搜索工具正式接入,专属API-KEY即可调用,限时优惠每次2.5积分。Token福利包扩展覆盖语音、OCR、智能文档分析等AI开放能力,席位扩展为四档并有限时赠送积分、夜享Token低至2折等活动。

  9. HuggingFace Daily Papers(社区热门论文)40

    SimLoss:单次解码的细粒度图像描述方法

    论文提出 SimLoss,一种免参考的嵌入空间训练目标,让视觉语言模型在解码前对齐隐藏状态与冻结图像嵌入,实现单次解码的细粒度图像描述,无需人工细粒度描述或多阶段伪描述。其中 SimLoss FFT 以可微方式微调,精度最高且推理比多阶段流程快约 20 倍,F1 接近多阶段方法;SimLoss GRPO 将嵌入模型作为黑盒奖励,召回率最强。

  10. HuggingFace Daily Papers(社区热门论文)47

    Pixel Linguist II:像素文本表示学习的设计原则与新视觉编码器

    论文提出像素文本表示学习的四项设计原则:可变分辨率与渲染字号、自然图文对做 grounding、布局感知渲染防止像素级捷径、两阶段多语言课程。基于此训练的 Pixel Linguist II 视觉编码器在英文、跨语言和多语言 Visual STS 及 ViDoRe 上取得 SOTA,并在 80% 视觉 token 压缩下保持鲁棒。

  11. HuggingFace Daily Papers(社区热门论文)41

    Kirin:从野外视频生成动物运动并自动绑定 3D 动画

    论文提出 Kirin 框架,从野外动物视频重建 3D 运动序列,并构建 AiM3D,首个为四足动物提供对齐视频-文本-运动三元组的大规模数据集。基于该数据训练的模型可同时以文本和图像为条件生成跨物种的真实运动,并结合现成 image-to-3D 模型自动绑定 3D 网格,产出可直接渲染的动画动物。项目页:https://kirin-ani.github.io/。

  12. Runway:News(网页)67

    Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面

    Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。

    推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。