跳到正文

#多模态

今日 0 条
10月3日周六
9月30日周三
  1. HuggingFace Daily Papers(社区热门论文)30

    SentZero:面向多任务零样本胸部 X 光分析的句子级视觉语言预训练框架

    SentZero 是一个句子级视觉语言预训练框架,用于零样本、多任务的胸部 X 光(CXR)分析。它通过基于 LLM 的摘要级句子结构化与映射扩大正样本对多样性,并新增损失项缓解临床等价句子造成的假阴性,同时对视觉嵌入做句子条件残差调制。在多个下游任务和数据集上,SentZero 提升了零样本泛化能力,优于此前的多任务零样本方法。

9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)38

    SCOPD:面向高效视觉语言模型的稀疏上下文同策略自蒸馏

    针对推理型视觉语言模型(VLM)视觉 token 序列过长导致推理昂贵的问题,研究者提出稀疏上下文同策略自蒸馏框架 SCOPD:学生模型基于剪枝后的视觉 token 生成推理轨迹,由拥有完整上下文的教师模型对同一同策略前缀进行监督,无需真实答案、架构改动或额外推理开销。

  2. HuggingFace Daily Papers(社区热门论文)53

    GPT-6 Astra 跨计算机视觉评测揭示通用模型的能力边界

    该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。

  3. HuggingFace Daily Papers(社区热门论文)40

    RenderRank:用压缩视觉 token 学习文本重排序

    RenderRank 是一种从压缩视觉文档表示中学习查询相关性打分的重排序器,不再依赖传统文本 token 序列。在 BEIR 的 11 个数据集上,它减少 16.5-35.5% 输入 token,平均 NDCG@10 达 55.96,超过所有参数量低于 4B 的文本基线及部分更大模型。

  4. HuggingFace Daily Papers(社区热门论文)33

    GeoVerse:在几何隐空间中实现世界一致的新视角合成

    GeoVerse 通过在预训练 3D 基础模型的几何隐空间中生成、并注入视频生成模型的外观先验,实现世界一致的新视角合成。它从 Wan2.2 VACE 提取多层级特征,经 ControlNet 式适配器注入几何隐扩散模型,并用全局空间记忆聚合已观测与合成内容以保持跨视角连贯。

  5. HuggingFace Daily Papers(社区热门论文)49

    距离去掉视觉编码器还有多远?无编码器多模态预训练的缩放定律

    研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。

  6. HuggingFace Daily Papers(社区热门论文)42

    Just MLPs:为多模态语言模型高效重建视觉状态

    研究提出 δ-Vision,用轻量低秩适配器构建逐层视觉记忆,替代视觉 token 在 Transformer 中的重复演化,同时保留全部视觉 token 供文本检索。该方法发现视觉到文本的信息流集中在低维子空间,且轻量 MLP 能以高余弦相似度和低重建误差逼近各层视觉状态。在图像和视频基准上,δ-Vision 在相当或更低计算量下准确率超过视觉 token 剪枝基线,且不丢弃视觉 token。

9月28日周一
9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)34

    SciGen-Verifier:面向科学图像生成可解释验证的多模态推理器

    SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。

  2. HuggingFace Daily Papers(社区热门论文)38

    VGGT-Diff:融合视觉几何与扩散模型的稀疏视角新视角合成

    VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。

  3. HuggingFace Daily Papers(社区热门论文)41

    VisionHOPE:将视觉骨干网络构建为自修改学习系统

    VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。

9月26日周六
9月25日周五
  1. HuggingFace Daily Papers(社区热门论文)45

    利用预训练扩散模型和多模态条件增强摄影测量数字表面模型

    该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。

  2. HuggingFace Daily Papers(社区热门论文)55

    TRACE:流式视频理解的时序审计与条件感知评估框架

    论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。

9月24日周四
  1. HuggingFace Daily Papers(社区热门论文)55

    TrackEverything:突破长视频稠密3D点追踪的显存瓶颈

    TrackEverything提出一种新的3D点追踪模型,通过去重3D场景表示解决稀疏长时与稠密短时追踪的权衡问题。该模型利用体素化去重、端点细化器及3D WAFT技术,将模型复杂度与视频时长解耦。它是首个能在40GB显存内对超过1000帧视频进行全可见点追踪的3D追踪器,在TAPVid-3D基准上表现优于现有开源稠密追踪器。

9月23日周三
9月20日周日
  1. HuggingFace Daily Papers(社区热门论文)33

    BoundInk:边界感知的在线手写生成框架

    针对现有方法难以捕捉字符间连接、间距和对齐等微观行为的问题,研究者提出 BoundInk。这是一个以写作者为条件的框架,将字符间边界视为显式生成单元,联合建模局部转换与上下文,从而在保持字形外观的同时改善连笔和间距。实验显示,该方法在三项基准测试中显著提升了边界质量指标,并将归一化动态时间规整距离降低了 17.6%--47.8%,在盲测人类评估中的偏好率为 78.0%--82.6%。

9月18日周五
9月15日周二
  1. AK52

    Vidu S2 论文发布,提出实时交互、可编辑和空间视频生成,包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing。Vidu S2-Avatar 相比 Vidu S1 支持实时 720p 生成、可随时更新的动态参考和更强的指令遵循;Vidu S2-Editing 支持对视频流实时编辑,包括风格渲染、服装、角色和背景替换。论文链接 https://huggingface.co/papers/2609.11638,在线演示 https://vidu.com/vidu-stream。

  2. IT之家(RSS)60

    新型脑机接口首次同步解码语言与肢体动作

    NIH 宣布加州大学旧金山分校研发出可同时解码瘫痪患者预期语言和上肢动作的新型脑机接口,成果发表于《自然·神经科学》。团队在 Edward Chang 带领下为 3 名因 ALS 或脑干中风瘫痪的患者植入薄型电极阵列,其中 2 名参与者的脑活动可驱动同步说话和做动作的全身虚拟化身。

9月12日周六
9月9日周三
  1. HuggingFace Daily Papers(社区热门论文)57

    Gander 全双工全模态交互智能体技术报告发布并开源

    作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。

9月7日周一
  1. HuggingFace Daily Papers(社区热门论文)54

    DF26 基准:现有检测手段已难以分辨 AI 生成视频与真实视频

    DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。

9月5日周六
9月4日周五
  1. HuggingFace Daily Papers(社区热门论文)40

    Last Translation Benchmark 发布,用人工评审的多模态样本测试机器翻译模型极限

    研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。