跳到正文

#图像生成

今日 1 条
9月4日周五
  1. IT之家(RSS)29

    摩尔线程“庐山”GPU 首发国产硬件光追,预计 2026 年底推出

    摩尔线程在 2026 年半年度业绩说明会上表示,基于“花港”架构的“庐山”芯片预计 2026 年底推出,将实现 3A 游戏渲染提升 15 倍、AI 性能提升 64 倍、光线追踪性能提升 50 倍。该芯片的硬件光线追踪加速引擎支持 DirectX Raytracing (DXR),并配套全自研 MTAGR 1.0 AI 生成式渲染技术;具体销售时间以后续官方发布为准。

  2. Midjourney:Updates(RSS)51

    Midjourney alpha 站发布大型更新,v8.2 编辑模型上线 lightbox 编辑器

    Midjourney 向 alpha.midjourney.com 推送大型更新,新的 v8.2 编辑模型上线,lightbox 内置编辑器支持自然语言指令编辑、最多附 4 张参考图并集中查看会话编辑记录。同时测试 Change Style 风格探索功能,修复大量 bug,Niji 7 加 inpainting 已正常工作;下一步将设置默认参数和用提示词预览 sref。

9月3日周四
  1. IT之家(RSS)62

    小红书治理 AI 虚假探店和民宿内容,今年 6-8 月清理相关笔记近 12 万条

    小红书发布《关于 AI 制作医美、民宿等虚假内容治理公告》,将 AI 制作发布虚假内容纳入常态化治理。平台从细化管控重点、清理存量、严控新增三方面加大力度,今年 6-8 月清理 AI 虚假笔记近 12 万条,对发布 AI 虚假医美、民宿、教育内容的账号予以封禁或禁言处置,并要求创作者用 AI 内容声明功能标注 AI 生成内容。

9月2日周三
  1. IT之家(RSS)62

    李飞飞 World Labs 发布多模态世界模型 Atlas,支持像素级相机控制生成 1440p 视频

    李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。

  2. HuggingFace Daily Papers(社区热门论文)34

    ReFlowSET:面向 SAR 到 EO 图像翻译的表征对齐潜空间流匹配框架

    KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。

  3. Hacker News 热门(buzzing.cc 中文翻译)70

    World Labs 发布世界模型 Atlas:面向空间智能的多模态自回归扩散 Transformer

    World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。

  4. Fei-Fei Li57

    World Labs 发布从零训练的多模态世界模型 Atlas。模型可生成具有像素级相机控制能力的图像和视频帧,从单张输入图像重建大型场景,通过重帧视频模拟时空,并从一张或多张输入图像原生输出 3D 空间,还能将多张带位姿的图像合成一致的三维世界。作者称其为迄今最好的相机条件世界模型,可能应用于 VFX 到机器人等多个方向。