跳到正文

#多模态

今日 4 条
9月15日周二
  1. Apple:Newsroom(RSS)77

    Apple 发布新一代 Apple Intelligence,Siri AI 正式以测试版上线

    Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI,支持个人语境理解、屏幕感知、系统级应用操作和跨设备对话,今日起以英文测试版随 2027 系统更新推出,下月扩展至法语、日语、韩语、葡萄牙语和西班牙语。

    推荐理由:官方公告完整列出 Siri AI 的能力清单、设备与语言范围,以及欧盟和中国市场暂不可用等限制,读者可据此评估适用性。

9月14日周一
  1. 公众号:火山引擎57

    AI导演DiDi_OK解密用Seedance 2.5制作科幻短片《Candy》的工作流

    火山引擎采访AI导演DiDi_OK,介绍其完全用Seedance 2.5 720P制作的9分钟科幻短片《Candy》背后的制作过程。他称模型在精细定制化、运动规律理解和超长镜头一次生成上有突破,部分效果连续性超过传统CG;其工作流随之改变,提示词取代关键帧成为决定视觉上限的首要条件,世界观类叙事中分镜不再是必需。

  2. MarkTechPost(RSS)52

    基于 JAX3D 构建分层 NeRF 教程:体渲染、新视角合成与 3D 重建

    该教程用 JAX、Flax、Optax 和 jax3d 的体渲染原语构建端到端分层 NeRF,包含位置编码、粗细双网络与 sample_piecewise_constant_pdf 重要性采样,并用 Adam、指数学习率衰减和梯度裁剪训练。评估涵盖 held-out PSNR、深度与透明度可视化、360 度渲染 GIF 以及 marching cubes 提取密度场等值面。

9月13日周日
  1. Suno:Blog(网页)68

    Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本

    Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。

    推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。

9月12日周六
  1. IT之家(RSS)63

    微信测试图片 AI 处理功能,支持美化、修改与信息提取

    微信在发送图片界面新增 AI 处理功能,点击后提供美化图片、修改图片、提取信息三类菜单,涵盖生成写真、消除杂物、扩图、变高清、提取文字、翻译图片等选项。此前微信已基于小微灰度上线至少 16 个 AI 功能,覆盖公众号 AI 总结、朋友圈 AI 点评与 AI 帮写、扫一扫视觉识别及聊天语音指令等场景,目前均处灰度测试阶段,仅部分用户可体验。

9月11日周五
  1. 公众号:卡尔的AI沃茨76

    实测 DeepSeek V4.1 Flash:价格大降、原生带视觉,作者用游戏与城市生成任务验证表现

    作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。

    推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。

9月10日周四
  1. Hugging Face:Blog(RSS)65

    Hugging Face 用 Gradio Workflow 重建 Workflow1111,复刻 AUTOMATIC1111 主要功能

    Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。

    推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。

  2. IT之家(RSS)56

    高德发布 3D 原生城市世界模型 ABot-Earth 0.7,支持从星球到街景全尺寸生成

    高德发布 3D 原生城市世界模型 ABot-Earth 0.7,称其为全球首个全模态、可预测的 3D 原生城市世界模型,覆盖超过 196 个国家和地区。模型可从卫星图像或文字描述出发,10 分钟内在一块消费级 GPU 上生成公里级 3DGS 格式城市场景,效率较传统模式提升 1000 倍,已应用于飞行街景 2.0,体验官网同步上线。