跳到正文

#图像生成

今日 1 条
今天10月8日周四
10月7日周三
  1. TechCrunch · AI22

    前 Ramp 工程师创办的 Melius 融资 2500 万美元,转型 AI 广告创意生成

    前 Ramp 工程师创立的 Melius 完成 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司最初做 AI 效果营销工具,六個月后放弃原产品并重写全部代码,转向生成广告创意素材与营销活动的「创意工作智能体实验室」平台。Melius 称 7 月结束隐身状态后两个月内年化收入已超 100 万美元。

10月6日周二
10月2日周五
  1. The Decoder62

    Ideogram 发布 Ideogram 4.5,称局部编辑不破坏画面其余部分

    Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,换装等编辑不会改变人物身形和背景,早期测试者确认多次编辑后一致性较强。该模型提供四档质量档位,每张图 0.8 至 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI。

9月30日周三
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)38

    MT-OPSD:面向多轮图像编辑的在线策略自蒸馏框架

    针对现有图像编辑模型在递归编辑中快速退化的问题,研究者提出 MT-OPSD 在线策略自蒸馏框架,让模型在自生成的条件下状态上训练,并由干净条件教师模型提供编辑监督,无需多轮标注。该工作同时发布 LME-Bench,包含 100 组十轮编辑会话,用于评估长程鲁棒性。在三个编辑骨干上的实验显示,MT-OPSD 显著提升长程编辑成功率、减少多轮崩溃,并基本保持单轮编辑质量。

9月28日周一
  1. 公众号:数字生命卡兹克45

    GPT-Image 2.5 的12种照片编辑与创意玩法教程

    文章介绍了利用 GPT-Image 2.5 模型进行照片精准编辑和创意生成的12种具体玩法,包括消除背景游客、自动调光、专业美颜、制作3D公仔拍立得、景点明信片、主体贴纸化、旅游碎片行李箱、人物海报、演唱会氛围感照片、美食飞溅效果、物体转文字涂鸦及Ins风注释等。每种玩法均提供了详细的提示词示例和操作步骤,旨在帮助用户在假期通过AI优化朋友圈照片。

9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)41

    结构化残差连接对 Diffusion Transformer 为何重要

    研究提出将 Diffusion Transformer 的残差连接从被动求和改为主动检索机制,通过结构化连接设计让每个 Transformer block 选择性关注早期层表示。该方法训练迭代次数最多减少 1.73 倍,额外参数不到 0.1%,将 REPA-XL/2 的无引导 FID 从 5.9 降至 4.34,使用 classifier-free guidance 时达到 1.39 FID。

9月26日周六
  1. HuggingFace Daily Papers(社区热门论文)38

    神经图像水印中的残差可迁移性研究:CoverLock 防御策略

    研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。

9月25日周五
9月24日周四
  1. 公众号:卡尔的AI沃茨62

    五大场景实测商汤SenseNova U1 Pro:从审美到多图融合的生图能力评测

    商汤上线SenseNova U1 Pro,在8月SuperCLUE-Image中文文生图榜单以总分93.81排名第一,作者实测其与gpt image 2.5对比。作者分审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合五类任务测试,附全部提示词,认为其文字稳定、局部编辑精准、可支持8K输出,整体完成度达到可交付水平,考虑替换进自己的图片工作流。

  2. 公众号:火山引擎67

    Seedance 2.5 API 上线 Draft 模式,480P 试错后 1080P 一次成片

    火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。

    推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。

  3. 公众号:蚂蚁百灵(Ling)67

    蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。

    推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。

9月23日周三
9月22日周二
  1. IT之家(RSS)65

    火山引擎 Seedance 2.5 API 上线 Draft 模式:480P 验证创意后生成 1080P 终版

    火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,用户先用 480P 低成本生成样片验证创意,再通过样片 ID 复用提示词、seed、ratio、duration 等参数生成 1080P 成片。以 5 秒镜头抽卡 4 次为例可节约 57% 成本、速度提升近一倍,抽卡 20 抽 1 时可节约 77%;C 端可在即梦中选择“Seedance 2.5(样片模式)”体验。

  2. 腾讯混元:Research(API)60

    腾讯混元发布 Hy Image3.5 preview 图像生成模型

    腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。

    推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。

  3. HuggingFace Daily Papers(社区热门论文)45

    FoMo:利用扩散模型轨迹分叉时刻自动生成感知距离标签

    该论文提出 FoMo(Forking Moment),一种全自动数据生成管线,用于在无需人工标注的情况下生成图像对之间的点式感知距离标签。方法利用扩散模型的生成动态,认为早期时间步决定粗结构,晚期决定细节;图像在生成轨迹中“分叉”越早,感知距离越远。实验表明该方法能对齐人类视觉系统,并用于训练参考型图像质量评估指标,在多个基准上超越依赖人工标注的数据集。