Adobe 将 Photoshop、Illustrator 等创意工具接入 Slack
Adobe 宣布将 Photoshop、Premiere 和 Illustrator 等创意工具接入 Slack 协作平台,Adobe for Slack 已集成在 Slack 中。用户通过 Slackbot 选择 Manage Apps 添加 Adobe 后,可在聊天框输入 @Adobe 加提示词生成内容,还可引用聊天内容和共享文件辅助生成。
Adobe 宣布将 Photoshop、Premiere 和 Illustrator 等创意工具接入 Slack 协作平台,Adobe for Slack 已集成在 Slack 中。用户通过 Slackbot 选择 Manage Apps 添加 Adobe 后,可在聊天框输入 @Adobe 加提示词生成内容,还可引用聊天内容和共享文件辅助生成。
新加坡科技设计大学研究人员让 140 名 60 至 89 岁老年人与其社交聊天机器人 Ami Chat 互动,研究发表于《老龄化创新》期刊。结果显示,社会关系相关三个指标(拟人化、真实性、AI 社交互动强度)在使用意愿差异中额外解释了 27%;感觉更真实、互动更具回应性时使用意愿更高,但认为机器人更像真人的参与者意愿反而更低;自评健康状况较差者使用意愿更强。
据 Android Authority 报道,高通披露新一代 Adreno GPU 细节,核心新设计是加入 Adreno 矩阵核心,预计配备 3 个,以更低延迟和功耗处理本地 AI 任务。
World Labs(李飞飞联合创立)发布世界模型 Atlas,可从几张照片完成 3D 场景生成、重建与仿真,输出最高 1440p、1 分钟的可控镜头视频,并支持点云与 3D Gaussian splats 等 3D 数据输出。
谷歌在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解(agentic video understanding)功能,替代按固定帧率读取视频的静态处理方式,让模型在视觉帧、音频和转录文本中动态搜索和检查目标片段。
Google 为 Gemini Flash 系列模型(Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite)推出智能体式视频分析,模型自主决定查看哪些片段、以何种帧率和模态获取信息,取代原来每秒固定采样一帧的静态处理。
据《商业内幕》报道,Meta 通过软件更新关闭了数千副录像指示灯被人为破坏的 Meta AI 智能眼镜的摄像头,受影响设备不到累计销量的 0.1%。最新更新修补了此前先启动录像再遮挡指示灯的漏洞:钻掉 LED 的设备摄像头永久禁用,撕掉遮挡贴纸后摄像功能可恢复。Meta 智能眼镜 2025 年单年销量达 700 万副。
豆包工作新增多 Agents 并行和 Mac 操作电脑两项功能。多 Agents 并行可召唤不同子 Agent 在同一任务下分别执行不同模块,成倍节省时间;Mac 操作电脑功能可实现本地 GUI 操作,无需 MCP、API、插件和 CLI 即可看懂界面并完成操作。豆包工作是字节跳动于 2026 年 8 月 25 日推出的 Agent 产品,定位为字节跳动在 AI 办公场景的统一产品入口。
昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。
Arena 平台发布 2026 年第 35 周(8 月 24 日至 8 月 30 日)AI 大模型盲测排行榜。智谱 GLM-5.3-Flash 首次入榜即列代码榜第 7 名(ELO 1535),阿里 Qwen3.8-max-0902 首次入榜以 1691 分登顶前端开发榜,将 Claude-Opus-5-Max 挤到第二。
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将流式 ASR、20+ 说话人的说话人分离和端点检测合并为一个自回归模型,无需后处理。
Grok 在语音对话模式中上线屏幕共享功能,用户可将浏览器中的画面共享给语音模型,由其实时看到屏幕内容并逐步讲解指引。引用用户反馈称该功能运行效果很好。
中央网信办公布“清朗 · 整治 AI 应用乱象”专项行动第二阶段成果,累计清理违法违规信息 561 万余条、查处账号 4.9 万余个、处置违规网站和应用 2400 余个。
李飞飞创办的 World Labs 发布多模态世界模型 Atlas,称其能以像素级精确相机控制生成图像和视频帧,并在 3D 中重建。Atlas 可输出最长 1 分钟的 1440p 视频,从一至数十张图像进行空间重建,支持时空模拟和文本生成图像与 360 度全景,部分合作伙伴已获抢先体验,未来几周内开放早期访问。
三星 9 月 1 日发布博文,宣布面向 Galaxy Z Fold8、Galaxy Z Flip8、Galaxy S26 FE 等机型推出 My FanCam 功能,可一键识别并追踪视频中指定人物,自动重新裁切画面使其保持在中心。
KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。
论文提出 EM^2Mem,一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,每个事件索引的记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实和来源信息。
该论文在无预训练视觉先验的受控原生设置下,从表征、任务和系统三层研究统一多模态模型中视觉理解与生成的关系。研究发现两个目标可互相提供有用信号但共享计算路径时一方会主导,任务解耦架构可避免这种不对称退化;共享知识任务间存在正向双向迁移,端到端 UMM 在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。
论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。
H3-World 提出一个把 33B MiniMax-H3 视频生成器转化为交互式世界模型的框架,通过自然语言指令实现精确的时间对齐世界控制。
论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。
论文提出 Temporal Context Routing(TCR),将结构化剧本中的镜头切换和对白时间映射到音视频生成的共享时间轴,并把各提示词引导路由到两种模态的对应位置。
据 The Los Angeles Times 报道,Google 正接触多家好莱坞大型片厂,希望以巨额费用换取用版权内容训练 AI 模型,单个版权角色的生成权报价可达约 $40 million,总额可能达数十亿美元,还可能附广告收入分成。
Stryker 宣布杜克大学医疗中心完成首例通过 Apple Vision Pro 搭配 SportSuite Vision 应用的髋关节镜手术。该应用将关节镜画面和 CT 影像显示在头显中,减少医生反复转动颈部查看屏幕的需求,主刀医生 Chad Mather III 表示可按个人工作流程在无菌区内安排关键信息位置。
World Labs 发布新一代世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,输入以 3D 姿态形成空间上下文。模型支持相机控制生成(最长 1 分钟 1440p 视频)、稀疏视图 3D 重建、时空仿真和图像生成,在相机控制生成与 3D 重建任务上优于更专用的模型;现已开放早期访问申请,未来将驱动 Marble 等产品。
Google 发布八月 AI 更新汇总:推出面向编码和 Agent 的工作模型 Gemini 3.7 Flash,价格为 Gemini 3.6 Flash 推出价的一半每百万 token。
Google 于周二宣布面向 Android 推出五项新功能,涵盖减少晕动症、帮助盲人和低视力用户、记录物品存放位置,以及 Google Messages 的个性化改进。
Claude 官方频道发布视频,标题为 Claude turns flight data into "look behind you",展示将飞行数据转化为对应内容的过程,正文无更多细节。
Miro 品牌团队分享如何完全用 Runway 制作 Canvas26 年度活动的开场视频,并本地化为四个城市的版本。此前年份依赖素材库加 3D 动效,今年每个镜头包括城市景观、人群和入场镜头都以 Runway 生成,再叠加基于 Miro Flows 节点连线设计的 3D 动效。
Google DeepMind 宣布为最新 Gemini 模型引入智能体视频理解能力。模型现在能以更高准确率分析视频,同时最多减少 88% 的 token 消耗。