跳到正文

#多模态

今日 4 条
9月2日周三
  1. IT之家(RSS)46

    新加坡科技设计大学研究发现老年群体更看重 AI 陪伴聊天机器人的真实感而非拟人化

    新加坡科技设计大学研究人员让 140 名 60 至 89 岁老年人与其社交聊天机器人 Ami Chat 互动,研究发表于《老龄化创新》期刊。结果显示,社会关系相关三个指标(拟人化、真实性、AI 社交互动强度)在使用意愿差异中额外解释了 27%;感觉更真实、互动更具回应性时使用意愿更高,但认为机器人更像真人的参与者意愿反而更低;自评健康状况较差者使用意愿更强。

  2. 凡人小北62

    World Labs 团队宣布达成重要里程碑,发布从头训练的多模态世界模型 Atlas,称其为首个此类模型。Atlas 支持像素级精确的相机控制生成帧、从单张输入图像重建大场景、通过重构视频模拟时空、从一张或多张图像原生输出 3D 空间,以及将多张带位姿图像合成为一致的 3D 世界,并称其为目前最好的相机条件世界模型,可用于 VFX 到机器人等场景。

  3. IT之家(RSS)61

    Meta 通过软件更新永久禁用数千副被破坏指示灯的智能眼镜摄像头

    据《商业内幕》报道,Meta 通过软件更新关闭了数千副录像指示灯被人为破坏的 Meta AI 智能眼镜的摄像头,受影响设备不到累计销量的 0.1%。最新更新修补了此前先启动录像再遮挡指示灯的漏洞:钻掉 LED 的设备摄像头永久禁用,撕掉遮挡贴纸后摄像功能可恢复。Meta 智能眼镜 2025 年单年销量达 700 万副。

  4. IT之家(RSS)59

    豆包工作上新:支持多 Agents 并行与 Mac 操作电脑

    豆包工作新增多 Agents 并行和 Mac 操作电脑两项功能。多 Agents 并行可召唤不同子 Agent 在同一任务下分别执行不同模块,成倍节省时间;Mac 操作电脑功能可实现本地 GUI 操作,无需 MCP、API、插件和 CLI 即可看懂界面并完成操作。豆包工作是字节跳动于 2026 年 8 月 25 日推出的 Agent 产品,定位为字节跳动在 AI 办公场景的统一产品入口。

  5. 公众号:昆仑万维(天工)54

    昆仑万维 SkyProduction 天工工作台新版本上线,打通剧本到成片流程

    昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。

  6. IT之家(RSS)62

    李飞飞 World Labs 发布多模态世界模型 Atlas,支持像素级相机控制生成 1440p 视频

    李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。

  7. HuggingFace Daily Papers(社区热门论文)34

    ReFlowSET:面向 SAR 到 EO 图像翻译的表征对齐潜空间流匹配框架

    KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。

  8. HuggingFace Daily Papers(社区热门论文)44

    研究揭示原生统一多模态模型中理解与生成的协同机制

    该论文在无预训练视觉先验的受控原生设置下,从表征、任务和系统三层研究统一多模态模型中视觉理解与生成的关系。研究发现两个目标可互相提供有用信号但共享计算路径时一方会主导,任务解耦架构可避免这种不对称退化;共享知识任务间存在正向双向迁移,端到端 UMM 在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。

  9. HuggingFace Daily Papers(社区热门论文)45

    DroneCATS:评测多模态大模型作为无人机通用视觉-语言-动作智能体

    论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。

  10. HuggingFace Daily Papers(社区热门论文)43

    VeriPhy 提出面向世界模型评估与改进的智能体物理推理系统

    论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。

  11. Hacker News 热门(buzzing.cc 中文翻译)70

    World Labs 发布世界模型 Atlas:面向空间智能的多模态自回归扩散 Transformer

    World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。

  12. Fei-Fei Li57

    World Labs 发布从零训练的多模态世界模型 Atlas。模型可生成具有像素级相机控制能力的图像和视频帧,从单张输入图像重建大型场景,通过重帧视频模拟时空,并从一张或多张输入图像原生输出 3D 空间,还能将多张带位姿的图像合成一致的三维世界。作者称其为迄今最好的相机条件世界模型,可能应用于 VFX 到机器人等多个方向。