World Labs 宣布加入 AMD,李飞飞将出任 AMD 执行副总裁兼首席科学家
World Labs 宣布与 AMD 签署最终协议加入 AMD,交易预计于 2026 年底前完成,需监管审批。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队组建前沿研究组织。
World Labs 宣布与 AMD 签署最终协议加入 AMD,交易预计于 2026 年底前完成,需监管审批。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队组建前沿研究组织。
AMD 宣布以约 82 亿美元的全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,2025 年推出从提示词生成可交互 3D 世界的商业产品 Marble;李飞飞将出任 AMD EVP 兼首席科学家,向 CEO Lisa Su 汇报,团队继续推进 AI 模型研究。
LlamaIndex 发文解释表单为何需要专用解析器:VLM 擅长通用推理,但表单解析结果并不会随推理增强而变好,且成本更高。LlamaParse 将表单表示为带 id、label、value 的字段与 section 嵌套 JSON 树,能保留复选框、签名及字段归属关系,避免扁平化后两个 "Date" 字段无法区分。
Meta 宣布推出面向企业客户的 Meta Enterprise Platform,并聘请 MongoDB CEO Chirantan "CJ" Desai 领导该新业务。
可灵AI宣布全新升级的 Kling 4.0 将于 10 月正式上线,Kling 4.0 Flash 已于 9 月 28 日向黑金年卡会员开放小范围抢先体验。
酷派发布AI智能眼镜,售价699元起(国补后594.15元)。该产品集成眼镜、耳机与AI相机功能,配备800万像素摄像头,支持1080P第一人称拍摄及抖音直播。内置AI大模型助手,提供语音唤醒、智能问答、会议记录及音视频通话实时翻译功能。采用开放式音频设计,续航约9小时,支持触控与物理按键操作,并提供一元配镜服务。
9月27日,昆仑万维旗下SkyProduction(天工工作台)上线三项新能力:开放AI MV创作功能;无限画布接入Mureka V8/V9/V9.5音乐生成模型;视频和图片支持智能配乐。用户可在同一画布完成从音乐分析、分镜规划到视频生成的全流程,并调用Seedance 2.5模型生成视频片段。
Meta 宣布将于今年秋季在雷朋 Display 智能眼镜、Quest 头显及新轻薄头显上推出“Hologram”功能。该功能利用生成式 AI(实时扩散模型)创建高度拟真的用户虚拟形象,替代传统摄像头画面用于 WhatsApp 视频通话。用户需通过手机 Meta AI 应用采集面部表情和语音数据完成建模。雷朋版基于音频驱动生成 2D 视频流,Quest 版支持 3D 等身立体呈现。目前存在细节粗糙、侧倾变形等技术局限。
推荐理由:Meta 将生成式 AI 深度整合进主流 XR 硬件的通信场景,标志着虚拟形象从卡通向高保真实时生成的跨越,对 AR/VR 社交体验有重要影响。
Google Research 推出 AI 视频联合导演,由 4 个智能体框架组成,运行在 Gemini 和 Veo 之上,用于解决多镜头 AI 视频中的身份漂移和级联错误问题。
H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。
推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕主题演讲前,用 Claude Opus 5.5 根据三张鸮鹦鹉照片生成至少 20 只鸮鹦鹉开派对的 HTML 5 canvas 像素动画页面。
针对自进化视觉语言模型中多数投票标签 24%、模型评判标签 18% 出错的问题,研究者提出 VQS,让模型把图像解析为场景图、图表表格等结构化记录,由固定程序生成问题并计算答案,模型只逐条核验程序读取的短事实。
arXiv 论文介绍 YuE2,通过符号规划统一符号与音频音乐生成,单一 AR-NAR Mixture-of-Transformers 先生成可读乐谱,再扩展为语义音乐 token 并实现全曲音频。
SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。
VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。
REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。
VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。
SpatialSpeak 是一个两阶段框架,将 QA 原生重建预训练与空间 CoT 学习结合,在 ReVSI 上把 CoT-VC 带来的增益从 2.6 分提升到 6.9 分。该框架在 ReVSI、VSI-Bench 和 SPAR-Bench 上取得 SOTA,ReVSI 得分 62.8,超过最强对比基线 8.7 分。
作者受 Jev 及 OpenJev、SemIf 启发,实现了一个单函数封装:让 LLM 只生成一个选项字母,再读取 top_logprobs 得到各选项概率。
本教程基于 AugLy 构建覆盖图像、文本、音频的端到端多模态数据增强与鲁棒性工作流。教程解决依赖兼容问题,生成确定性合成数据集,演示 AugLy 的函数式与类式 API。
美团 LongCat API 开放平台于 9 月 25 日上线 LongCat-2.5-Preview 模型,同步开放 API 与网页端体验入口。
针对多模态大模型在极低视觉 token 预算下性能骤降的问题,研究者提出训练框架 LT-OPD,让仅保留少量视觉 token 的学生模型在自己生成的轨迹上接受冻结全 token 教师模型的分布监督,并引入逐步降低 token 预算的课程。
Liquid AI 发布 LFM2.5-VL-3B-DSpark,一个为其视觉语言模型 LFM2.5-VL-3B 设计的实验性投机解码草稿模型,新增约 279.5M 参数(+8.9%),在 Apple silicon 上解码最高提速 3.13 倍,NVIDIA H100 上最高 2.66 倍。
The Verge 记者用 Google Nest Doorbell、Aqara G400 和 Ring Pro 4K 三款门铃,实测了 Gemini for Home、Apple Intelligence for Home 与 Amazon Ring 的 AI 摄像头功能。测试源于其宠物鸡被咬死却只收到一连串"motion detected"通知、视频片段还一直缓冲的经历。
阿里千问App联合盒马和淘宝闪购,推出“盒马菜谱”和“淘宝闪购异地美食”两大智能体技能。用户可通过文字指令、拍摄冰箱食材或宴席照片获取家宴方案及做法,并一键下单购买食材;旅游时也可查询当地特色美食推荐并直接配送。该功能旨在通过AI辅助解决假期饮食规划与采购问题。
Runway 本月推出研究预览版 GWM Worlds 2,将高保真视频和音频生成变为实时交互模拟,以 720p、24 fps 连续视频和 48,000 Hz 音频流式输出,并新增 WorldPrompt 输入格式,可固定环境部分方面并通过带时间戳的事件控制角色、相机和场景。
谷歌宣布在上周推出的 Gemini 3.8 Live 基础上,正式推出带 Live Avatar 功能的 Gemini 3.8 Live,为实时对话模型带来接近实时的视觉形象。
该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
Google Research 提出基于 Gemini 和 Veo 的多智能体编排框架,将长视频生成建模为全局优化与世界状态跟踪问题,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,支持 SynthID 水印。
Meta 宣布两款 AI 游戏开发工具:移动端应用 Horizon Create 和浏览器端应用 Horizon Studio,均支持用 AI 提示词生成 2D 或 3D 移动游戏,包含进度系统、难度平衡、美术方向和多人玩法,目前以早期访问形式开放候补名单。
Google Photos 的 AI 虚拟衣橱功能现已向美国、巴西和印度所有 Android 和 iOS 用户开放,可根据照片中的穿着生成衣橱副本,按上衣、下装、首饰等类别筛选并混搭造型。
The Verge 评测人 Victoria Song 亲测 Meta 的 Muse AI 智能体后认为,其吉祥物 Jolly 的可爱设计会降低用户分享个人信息的警惕。她测试发现 Muse 演示存在识别食物出错、无法加购商品等常见 AI 缺陷,并担忧眼镜采集的饮食上下文可能被 Meta 用于广告定向,提醒读者不要被可爱外表迷惑。