Artcraft 用 Claude Opus 5.5 生成七款 Adobe 软件开源替代品
Artcraft 从可控 AI 图像视频编辑工具转向开源应用套件,用 Claude Opus 5.5 以 Rust 复刻 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro 的界面与工具,并提供可在浏览器运行的 WebAssembly 版本。
Artcraft 从可控 AI 图像视频编辑工具转向开源应用套件,用 Claude Opus 5.5 以 Rust 复刻 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro 的界面与工具,并提供可在浏览器运行的 WebAssembly 版本。
前 Ramp 工程师创立的 Melius 完成 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司最初做 AI 效果营销工具,六個月后放弃原产品并重写全部代码,转向生成广告创意素材与营销活动的「创意工作智能体实验室」平台。Melius 称 7 月结束隐身状态后两个月内年化收入已超 100 万美元。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,1K 图像价格从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Pinterest 周二展示了新功能 Beauty Guides,由 Pinterest Intelligence 的视觉智能与生成式 AI 技术驱动,可把发型、美甲等美妆类 Pin 转成可带去沙龙的行动方案。
Black Forest Labs 发布 Flux 3 模型家族中的图像模型 Flux 3 Image,官方称其支持多步编辑且不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,换装等编辑不会改变人物身形和背景,早期测试者确认多次编辑后一致性较强。该模型提供四档质量档位,每张图 0.8 至 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI。
OpenAI 宣布在全球范围上线两项 ChatGPT 购物功能,包括虚拟试穿服饰与配饰,以及把商品保存到应用内 Library 的 Favorites 收藏功能。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别人脸并模糊处理。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全程在本地运行。
FlowTool 将基于工具的图像修饰建模为流匹配问题,用条件整流流直接生成工具参数,由视觉语言模型骨干加 Diffusion Transformer 参数生成器组成,把高斯噪声转成编辑方案。
针对现有图像编辑模型在递归编辑中快速退化的问题,研究者提出 MT-OPSD 在线策略自蒸馏框架,让模型在自生成的条件下状态上训练,并由干净条件教师模型提供编辑监督,无需多轮标注。该工作同时发布 LME-Bench,包含 100 组十轮编辑会话,用于评估长程鲁棒性。在三个编辑骨干上的实验显示,MT-OPSD 显著提升长程编辑成功率、减少多轮崩溃,并基本保持单轮编辑质量。
UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。
研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。
Google 与 XPRIZE、Range Media Partners 合办的 Future Vision XPRIZE 在洛杉矶揭晓,独立电影人 Jeff Synthesized 凭《The Gifted》从全球 2500 多件参赛作品中获得大奖。
文章介绍了利用 GPT-Image 2.5 模型进行照片精准编辑和创意生成的12种具体玩法,包括消除背景游客、自动调光、专业美颜、制作3D公仔拍立得、景点明信片、主体贴纸化、旅游碎片行李箱、人物海报、演唱会氛围感照片、美食飞溅效果、物体转文字涂鸦及Ins风注释等。每种玩法均提供了详细的提示词示例和操作步骤,旨在帮助用户在假期通过AI优化朋友圈照片。
研究提出将 Diffusion Transformer 的残差连接从被动求和改为主动检索机制,通过结构化连接设计让每个 Transformer block 选择性关注早期层表示。该方法训练迭代次数最多减少 1.73 倍,额外参数不到 0.1%,将 REPA-XL/2 的无引导 FID 从 5.9 降至 4.34,使用 classifier-free guidance 时达到 1.39 FID。
研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。
商汤上线SenseNova U1 Pro,在8月SuperCLUE-Image中文文生图榜单以总分93.81排名第一,作者实测其与gpt image 2.5对比。作者分审美与中文版式、多文字运营物料、资料检索与高密度信息、局部修图、多图融合五类任务测试,附全部提示词,认为其文字稳定、局部编辑精准、可支持8K输出,整体完成度达到可交付水平,考虑替换进自己的图片工作流。
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。
推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
开源项目 virtio-nvgpu 在驱动 ABI 层转发 NVIDIA 内核驱动 ioctl,使 Linux guest 运行未修改的 NVIDIA 用户态驱动,在 RTX 3060(驱动 595.99.02)上帧时间 2ms 以上的负载达到裸机 98–100% 的性能,CPU 开销与裸机相同。
Viggle 发布面向开源社区的首个 Qwen-Image-2.1 turbo 模型 Viggle-Turbo,采用 DMD 蒸馏,可生成和编辑图像。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型,分别用于从文字生成 UI、信息图、海报等设计和将设计图拆为可编辑透明图层,同时开源 Design Skill 和 PPT Skill。
推荐理由:原文给出 Arena 两个榜单的开源第一排名和具体分数,读者可以据此比较开源图像模型的当前水平。
斯坦福 Residential & Dining Enterprises 被指在广告中使用 AI 修改学生形象,学生 Billy Ramirez '27 发现自己在横幅照片中被替换为 AI 生成的黑人女性,他右侧两名学生也被修改得明显更瘦。当事学生表示对身份被更改感到被抹除,Stanford Review 表示将持续关注 R&DE 后续的广告行为。
火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,用户先用 480P 低成本生成样片验证创意,再通过样片 ID 复用提示词、seed、ratio、duration 等参数生成 1080P 成片。以 5 秒镜头抽卡 4 次为例可节约 57% 成本、速度提升近一倍,抽卡 20 抽 1 时可节约 77%;C 端可在即梦中选择“Seedance 2.5(样片模式)”体验。
腾讯混元团队 9 月 22 日发布 Hy Image3.5 preview 模型,面向专业级生图,支持文生图、图生图和多轮对话创作,单次最多上传 5 张参考图,最高 2K 分辨率。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),官方称综合能力较 Hy Image3.0 提升约 30%,内部数百名设计师 GSB 盲测中与 Seedream 5.0 pro 持平,略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。
腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。
推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。
该论文提出 FoMo(Forking Moment),一种全自动数据生成管线,用于在无需人工标注的情况下生成图像对之间的点式感知距离标签。方法利用扩散模型的生成动态,认为早期时间步决定粗结构,晚期决定细节;图像在生成轨迹中“分叉”越早,感知距离越远。实验表明该方法能对齐人类视觉系统,并用于训练参考型图像质量评估指标,在多个基准上超越依赖人工标注的数据集。
阿里 Qwen 团队发布 Qwen-Image-2.1,将文生图与图像编辑统一到一个 7B 单流 DiT 模型中,搭配 8B Qwen3-VL 编码器,支持原生 RGBA 透明输出和最多 10 张参考图编辑。