跳到正文

#多模态

今日 4 条
9月29日周二
  1. LlamaIndex:产品、工程与评测49

    LlamaParse 为什么表单解析比 VLM 更可靠?

    LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。

9月28日周一
  1. IT之家(RSS)49

    酷派推出699元AI智能眼镜,支持第一人称拍摄与实时翻译

    酷派发布AI智能眼镜,售价699元起(国补后594.15元)。该产品集成眼镜、耳机与AI相机功能,配备800万像素摄像头,支持1080P第一人称拍摄及抖音直播。内置AI大模型助手,提供语音唤醒、智能问答、会议记录及音视频通话实时翻译功能。采用开放式音频设计,续航约9小时,支持触控与物理按键操作,并提供一元配镜服务。

  2. MeshyAI24

    2026 年 10 月 10 日,Meshy 与 Chrona 联合在旧金山举办 Tech Week 活动,主题为“用 AI 构建多人 3D 世界”。活动包含实时 3D 世界演示、创作者现场展示(6 位创作者参与并由观众投票)、多场圆桌对话,嘉宾包括 Meta 的 Yiqi Zhao、Roblox 的 Jinnan Chen 等。现场提供 3D 模型代金券、周边等福利,已有超 200 人报名,来自 Google、Meta、Roblox、Epic Games 等公司。

  3. Dongxi 东锡 NLP45

    作者分享了一首完全由 Claude Opus 5.5 生成的歌曲。歌词和乐谱均由 Opus 5.5 通过 Python 代码生成,未使用 Suno 等专用 AI 音乐模型。人声部分利用 macOS 自带的 Siri 语音合成(Aaron 和 Nicky 音色),通过 Swift 程序逐音节朗读,再经信号处理转化为旋律。作者称此过程主要依靠频谱图分析而非人工听测,且大部分技术细节未显式提示给模型。

  4. IT之家(RSS)78

    Meta 推出 Hologram 拟真虚拟形象,秋季上线雷朋眼镜与 Quest 头显

    Meta 宣布将于今年秋季在雷朋 Display 智能眼镜、Quest 头显及新轻薄头显上推出“Hologram”功能。该功能利用生成式 AI(实时扩散模型)创建高度拟真的用户虚拟形象,替代传统摄像头画面用于 WhatsApp 视频通话。用户需通过手机 Meta AI 应用采集面部表情和语音数据完成建模。雷朋版基于音频驱动生成 2D 视频流,Quest 版支持 3D 等身立体呈现。目前存在细节粗糙、侧倾变形等技术局限。

    推荐理由:Meta 将生成式 AI 深度整合进主流 XR 硬件的通信场景,标志着虚拟形象从卡通向高保真实时生成的跨越,对 AR/VR 社交体验有重要影响。

  5. H Company 官方74

    H Company 发布 Holo4 开放权重模型,统一操作界面与工具

    H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。

    推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)34

    SciGen-Verifier:面向科学图像生成可解释验证的多模态推理器

    SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。

  2. HuggingFace Daily Papers(社区热门论文)38

    VGGT-Diff:融合视觉几何与扩散模型的稀疏视角新视角合成

    VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。

  3. HuggingFace Daily Papers(社区热门论文)41

    VisionHOPE:将视觉骨干网络构建为自修改学习系统

    VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。

9月26日周六
9月25日周五
  1. 公众号:千问APP(阿里)35

    千问App上线盒马菜谱与淘宝闪购异地美食Skill

    阿里千问App联合盒马和淘宝闪购,推出“盒马菜谱”和“淘宝闪购异地美食”两大智能体技能。用户可通过文字指令、拍摄冰箱食材或宴席照片获取家宴方案及做法,并一键下单购买食材;旅游时也可查询当地特色美食推荐并直接配送。该功能旨在通过AI辅助解决假期饮食规划与采购问题。

  2. HuggingFace Daily Papers(社区热门论文)45

    利用预训练扩散模型和多模态条件增强摄影测量数字表面模型

    该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。

  3. HuggingFace Daily Papers(社区热门论文)55

    TRACE:流式视频理解的时序审计与条件感知评估框架

    论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。

  4. The Verge:AI(RSS)52

    The Verge 评测人谈 Meta Muse 智能体吉祥物 Jolly 的可爱设计为何令人警惕

    The Verge 评测人 Victoria Song 亲测 Meta 的 Muse AI 智能体后认为,其吉祥物 Jolly 的可爱设计会降低用户分享个人信息的警惕。她测试发现 Muse 演示存在识别食物出错、无法加购商品等常见 AI 缺陷,并担忧眼镜采集的饮食上下文可能被 Meta 用于广告定向,提醒读者不要被可爱外表迷惑。