跳到正文

#多模态

今日 4 条
9月5日周六
  1. IT之家(RSS)37

    消息称苹果首款 AI 家用安防摄像头瞄准 2027 年发布,主打隐私保护

    彭博社 Mark Gurman 爆料,苹果可能于 2027 年推出家庭安防系统及配套监控服务。摄像头主打隐私保护,不直接记录和分析实际视频,计划用 AI 监测环境,配备面部识别和红外传感器以识别房间内人员,实现如人离开自动关灯、播放家庭成员喜欢的音乐等智能家居自动化。

9月4日周五
  1. HuggingFace Daily Papers(社区热门论文)40

    Last Translation Benchmark 发布,用人工评审的多模态样本测试机器翻译模型极限

    研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。

  2. IT之家(RSS)62

    微信开源多模态嵌入模型 WeMM-Embedding,含 2B/4B/9B 三个版本

    微信 AI 宣布开源通用多模态嵌入模型 WeMM-Embedding,含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档及交错多模态输入。模型基于 Qwen3.5 多模态架构,WeMM-Embedding-9B 在 MMEB-v2 榜单以 80.6 分位列第一;该模型已大规模部署于视频号、直播、公众号、电商与朋友圈的推荐与搜索系统,日调用量达 10 亿量级。

  3. IT之家(RSS)39

    中国气象局气象智能预警方案"妈祖"埃及定制版开发取得阶段性进展

    据央视新闻援引中国气象局 9 月 4 日消息,气象智能预警方案"妈祖"埃及定制版开发取得阶段性进展,系统平台数据清单梳理和埃及行政区划及地理信息系统数据接入均已完成。定制版面向当地需求设计了航空气象和文旅气象,前者为当地机场提供综合监测、关注要素预报及机场综合预警,后者包含星空观赏适宜度预报、沙尘暴预报预警和日出日落时间预报。下一步双方将研讨 AI 沙尘模式等专题模块建设。

  4. TechCrunch:AI(RSS)48

    TechCrunch 解析 AI 生成菜单为何雷同难看:模型收敛与恐怖谷效应

    TechCrunch 探讨餐厅 AI 生成菜单令人不适的雷同问题。Reality Defender CTO Alex Lisle 解释这是模型训练数据趋同导致的收敛而非模型崩溃,数据集为追求讨喜而同质化;Elon University 的 Lee Rainie 称 AI 会削平细节。德国杜伊斯堡-埃森大学研究发现 AI 食物图像呈现恐怖谷效应,看起来接近真实反而引发更多厌恶。

  5. IT之家(RSS)29

    摩尔线程“庐山”GPU 首发国产硬件光追,预计 2026 年底推出

    摩尔线程在 2026 年半年度业绩说明会上表示,基于“花港”架构的“庐山”芯片预计 2026 年底推出,将实现 3A 游戏渲染提升 15 倍、AI 性能提升 64 倍、光线追踪性能提升 50 倍。该芯片的硬件光线追踪加速引擎支持 DirectX Raytracing (DXR),并配套全自研 MTAGR 1.0 AI 生成式渲染技术;具体销售时间以后续官方发布为准。

  6. HuggingFace Daily Papers(社区热门论文)35

    LatentStream:面向流式视频理解的渐进式潜在记忆演化框架

    论文提出 LatentStream,将流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize,用潜在工作记忆内化历史证据以支持严格因果与有限内存下的推理。框架包含分层流式记忆、分层潜在记忆演化和置信度引导的潜在记忆优化三个组件,并在现有在线与离线视频基准上取得新的 SOTA 结果。

  7. HuggingFace Daily Papers(社区热门论文)42

    Puffin-World 提出原生 3D 世界状态的统一多模态世界模型并开源

    Puffin-World 是一个统一多模态架构,不依赖外部离线模块即可实现物理理解、空间模拟和 3D 世界生成与重建。该框架联合建模物理(重力场与纬度)、几何(深度)和外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示与跨未来帧传播物理动态的策略,在单一生成过程中同时合成未来视图并重建底层几何。

  8. HuggingFace Daily Papers(社区热门论文)40

    WorldReward 提出面向相机条件世界模型的 VLM 奖励建模方法

    WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。

  9. HuggingFace Daily Papers(社区热门论文)40

    FlashRender:基于相机控制视频 MeanFlow 的少步生成渲染框架

    论文提出 FlashRender,一个少步生成渲染框架,可在数秒内沿目标相机轨迹重新渲染源视频。方法引入 RETA 将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再用 MeanFlow 目标微调并结合 on-policy flow map 蒸馏。实验显示其在视频质量和几何一致性上匹配多步基线,采样成本降低 25 倍,并在分布外目标相机轨迹下具备更强的相机可控性。