Ben Affleck:从卷积神经网络到 Transformer 的电影特效工作流
Ben Affleck 在 2026 年 10 月 7 日的一次发言中表示,自己从胶片转向数字时代起就对视觉特效产生兴趣,并因此会写一些 Python 脚本。他提到视觉特效工作流多年来已包含机器学习,早期用卷积神经网络对 tensor 做边缘检测和特征提取,从而更方便地抠出绿幕画面并替换背景。他把卷积神经网络称为 Transformer 的前身,后者能同时进行更多计算。
Ben Affleck 在 2026 年 10 月 7 日的一次发言中表示,自己从胶片转向数字时代起就对视觉特效产生兴趣,并因此会写一些 Python 脚本。他提到视觉特效工作流多年来已包含机器学习,早期用卷积神经网络对 tensor 做边缘检测和特征提取,从而更方便地抠出绿幕画面并替换背景。他把卷积神经网络称为 Transformer 的前身,后者能同时进行更多计算。
OpenAI 在 ChatGPT 中推出 Intelligent UI 功能,让回答可以结合图表、表单、可点按钮等交互式视觉内容,该更新与 GPT-6 一同面向所有用户推送。
推荐理由:ChatGPT 把回答从纯文本扩展为图表、表单和可点按钮,读者可据此判断交互形态的变化。
Google 将 SynthID Detector 开放给公众,任何人都可以检测图片、视频或音频是否由 Google 及其合作伙伴的 AI 生成。该工具可识别 Gemini、Veo、Lyria 等模型嵌入的隐形水印,支持 JPG、PNG、MP4 和 MP3 格式,但它并非通用 AI 检测器,只能标记带有 SynthID 水印的内容。
OpenAI 推出名为 Intelligent UI 的新界面,随新 GPT-6 模型于周三开始推送,把可点击按钮、定制计算器、交互式图表和可编辑图形等可视化元素直接嵌入对话,官方称目标是让学习复杂主题更容易。该功能支持自定义,用户可调低可视化程度;面向 Pro、Plus、Business 和 Enterprise 用户全球上线,免费和低价 Go 档用户周四可用。
推荐理由:OpenAI 把交互式图表、按钮和计算器直接嵌入对话,读者可据此判断 ChatGPT 的界面形态变化。
Google 上线新网站,任何人都可以验证图像、视频或音频是否由 AI 生成。该工具此前在 Google I/O 上仅向部分记者、媒体从业者和研究人员开放测试,现已向所有人开放,支持 JPG、PNG、GIF 等图像格式,MP4、MOV、WEBM 视频格式以及 WAV、MP3、FLAC 等音频格式。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量。该模型 7.4 亿参数,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分,Google 称其表现超过规模两倍的竞品。
苹果被曝正在研发一款不保存视频录像的智能家居摄像头,改用 AI 将视觉数据转成描述家中情况的文字片段,并支持人脸识别;古尔曼称未来 AirPods 的摄像头也可能采用类似方案。
Pinterest 周二展示了新功能 Beauty Guides,由 Pinterest Intelligence 的视觉智能与生成式 AI 技术驱动,可把发型、美甲等美妆类 Pin 转成可带去沙龙的行动方案。
法国 AI 实验室 Mistral 于周二发布 Mistral Large 4(ML4),这是一个 1 万亿参数的大规模多模态模型,绰号 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在三周内完成安全测试后开放权重。
Mistral 发布迄今最大模型 Mistral Large 4,拥有 1 万亿参数、490 亿激活参数,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Reka AI 发布全模态模型 Rho-1 的研究预览版,这是一个 190 亿参数的模型,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型,可实时生成连续视频并即时响应新指令而无需重启。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房标准化扫描,公司称其灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者,并研发新一代乳腺 X 光 AI。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
Black Forest Labs 发布 Flux 3 模型家族中的图像模型 Flux 3 Image,官方称其支持多步编辑且不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在实时视频通话中同时接收和生成语音、面部表情、语气、手势与停顿。
OpenAI 在年度 DevDay 大会上发布由 GPT-6 Astra 驱动的智能体 Dots,定位为可委派复杂工作的“幕僚长”或资深工程师,目前仅面向每月 100 美元的 Pro 套餐用户开放。
Google 在 Gemini Live 中上线 Guided Vision,可在兼容的 Android 设备上通过共享摄像头,对镜头所指向的内容进行实时语音描述,用于读小字、描述周围环境、寻找或识别物体等。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
OpenAI 宣布在全球范围上线两项 ChatGPT 购物功能,包括虚拟试穿服饰与配饰,以及把商品保存到应用内 Library 的 Favorites 收藏功能。
SentZero 是一个句子级视觉语言预训练框架,用于零样本、多任务的胸部 X 光(CXR)分析。它通过基于 LLM 的摘要级句子结构化与映射扩大正样本对多样性,并新增损失项缓解临床等价句子造成的假阴性,同时对视觉嵌入做句子条件残差调制。在多个下游任务和数据集上,SentZero 提升了零样本泛化能力,优于此前的多任务零样本方法。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容发现任务耗时从平均 250 分钟降至 2 分钟以内。
针对推理型视觉语言模型(VLM)视觉 token 序列过长导致推理昂贵的问题,研究者提出稀疏上下文同策略自蒸馏框架 SCOPD:学生模型基于剪枝后的视觉 token 生成推理轨迹,由拥有完整上下文的教师模型对同一同策略前缀进行监督,无需真实答案、架构改动或额外推理开销。
Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可跨基因组、蛋白质、化学、细胞状态和生物成像等模态联合学习并推理干预后果。
推荐理由:原文给出 PDAC 化合物筛选一个周末完成并经湿实验验证的结果,读者可据此评估 AI 驱动生物发现的实际路径。
论文提出 AnswerMap,一种免训练、任务无关的黑盒方法,通过行列条带的是/否后验外积生成查询条件下的空间图,并可定义读取方式导出定位等连续输出。
该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。
FlowTool 将基于工具的图像修饰建模为流匹配问题,用条件整流流直接生成工具参数,由视觉语言模型骨干加 Diffusion Transformer 参数生成器组成,把高斯噪声转成编辑方案。
RenderRank 是一种从压缩视觉文档表示中学习查询相关性打分的重排序器,不再依赖传统文本 token 序列。在 BEIR 的 11 个数据集上,它减少 16.5-35.5% 输入 token,平均 NDCG@10 达 55.96,超过所有参数量低于 4B 的文本基线及部分更大模型。
UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。
GeoVerse 通过在预训练 3D 基础模型的几何隐空间中生成、并注入视频生成模型的外观先验,实现世界一致的新视角合成。它从 Wan2.2 VACE 提取多层级特征,经 ControlNet 式适配器注入几何隐扩散模型,并用全局空间记忆聚合已观测与合成内容以保持跨视角连贯。
研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。
ColNanoVDR 是首个将无文档查询蒸馏用于多向量视觉文档检索(VDR)的框架,通过基于熵最优传输的 OTW 目标对齐学生与教师的查询 token,无需页面数据。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活运行和构建该模型的方式。
EvolvingAvatar 是一种因果生成器,通过测试时训练在交互过程中适配用户面部视频与双人音频,其双人上下文预测目标无需测试时目标动作标注即可提供自监督信号。
研究提出 δ-Vision,用轻量低秩适配器构建逐层视觉记忆,替代视觉 token 在 Transformer 中的重复演化,同时保留全部视觉 token 供文本检索。该方法发现视觉到文本的信息流集中在低维子空间,且轻量 MLP 能以高余弦相似度和低重建误差逼近各层视觉状态。在图像和视频基准上,δ-Vision 在相当或更低计算量下准确率超过视觉 token 剪枝基线,且不丢弃视觉 token。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并在收购 SceniX 后推进机器人仿真能力。
推荐理由:AMD 以 82 亿美元收购 World Labs,读者可借此了解空间智能与机器人仿真方向的整合动向。
9 月 28 日 Manus 面向海外用户发布 2.0 版本,并推出面向个人生活场景的智能助理应用 Cue。Cue 中每个 Agent 可拥有自己的邮箱、电话号码、钱包和电脑,代表用户与现实服务交互,多 Agent 可进入同一群聊处理扫码点餐、排队取号等事宜。Manus 同时在开发面向国内市场的产品,与国产模型厂商及生态伙伴的合作稳步进行。
快手可灵 AI 宣布 Kling 4.0 将于 10 月正式上线,Kling 4.0 Flash 已于 9 月 28 日向黑金年卡会员开放抢先体验。