AI 智能体用照片生成 3D 场景,却无法判断自己做得对不对
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片写出可执行的 Blender 程序,并迭代修改直到场景匹配原图。配套基准 LEGO-Bench 包含 104 个场景的 208 张图像,最佳模型 GPT-6 Astra 在室内场景准确率 53.4%、室外仅 39.6%,弱配置约 15%。
SentZero 是一个句子级视觉语言预训练框架,用于零样本、多任务的胸部 X 光(CXR)分析。它通过基于 LLM 的摘要级句子结构化与映射扩大正样本对多样性,并新增损失项缓解临床等价句子造成的假阴性,同时对视觉嵌入做句子条件残差调制。在多个下游任务和数据集上,SentZero 提升了零样本泛化能力,优于此前的多任务零样本方法。
针对推理型视觉语言模型(VLM)视觉 token 序列过长导致推理昂贵的问题,研究者提出稀疏上下文同策略自蒸馏框架 SCOPD:学生模型基于剪枝后的视觉 token 生成推理轨迹,由拥有完整上下文的教师模型对同一同策略前缀进行监督,无需真实答案、架构改动或额外推理开销。
论文提出 AnswerMap,一种免训练、任务无关的黑盒方法,通过行列条带的是/否后验外积生成查询条件下的空间图,并可定义读取方式导出定位等连续输出。
该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。
FlowTool 将基于工具的图像修饰建模为流匹配问题,用条件整流流直接生成工具参数,由视觉语言模型骨干加 Diffusion Transformer 参数生成器组成,把高斯噪声转成编辑方案。
RenderRank 是一种从压缩视觉文档表示中学习查询相关性打分的重排序器,不再依赖传统文本 token 序列。在 BEIR 的 11 个数据集上,它减少 16.5-35.5% 输入 token,平均 NDCG@10 达 55.96,超过所有参数量低于 4B 的文本基线及部分更大模型。
UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。
GeoVerse 通过在预训练 3D 基础模型的几何隐空间中生成、并注入视频生成模型的外观先验,实现世界一致的新视角合成。它从 Wan2.2 VACE 提取多层级特征,经 ControlNet 式适配器注入几何隐扩散模型,并用全局空间记忆聚合已观测与合成内容以保持跨视角连贯。
研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。
ColNanoVDR 是首个将无文档查询蒸馏用于多向量视觉文档检索(VDR)的框架,通过基于熵最优传输的 OTW 目标对齐学生与教师的查询 token,无需页面数据。
EvolvingAvatar 是一种因果生成器,通过测试时训练在交互过程中适配用户面部视频与双人音频,其双人上下文预测目标无需测试时目标动作标注即可提供自监督信号。
研究提出 δ-Vision,用轻量低秩适配器构建逐层视觉记忆,替代视觉 token 在 Transformer 中的重复演化,同时保留全部视觉 token 供文本检索。该方法发现视觉到文本的信息流集中在低维子空间,且轻量 MLP 能以高余弦相似度和低重建误差逼近各层视觉状态。在图像和视频基准上,δ-Vision 在相当或更低计算量下准确率超过视觉 token 剪枝基线,且不丢弃视觉 token。
Google Research 推出 AI 视频联合导演,由 4 个智能体框架组成,运行在 Gemini 和 Veo 之上,用于解决多镜头 AI 视频中的身份漂移和级联错误问题。
针对自进化视觉语言模型中多数投票标签 24%、模型评判标签 18% 出错的问题,研究者提出 VQS,让模型把图像解析为场景图、图表表格等结构化记录,由固定程序生成问题并计算答案,模型只逐条核验程序读取的短事实。
arXiv 论文介绍 YuE2,通过符号规划统一符号与音频音乐生成,单一 AR-NAR Mixture-of-Transformers 先生成可读乐谱,再扩展为语义音乐 token 并实现全曲音频。
SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。
VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。
REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。
VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。
SpatialSpeak 是一个两阶段框架,将 QA 原生重建预训练与空间 CoT 学习结合,在 ReVSI 上把 CoT-VC 带来的增益从 2.6 分提升到 6.9 分。该框架在 ReVSI、VSI-Bench 和 SPAR-Bench 上取得 SOTA,ReVSI 得分 62.8,超过最强对比基线 8.7 分。
针对多模态大模型在极低视觉 token 预算下性能骤降的问题,研究者提出训练框架 LT-OPD,让仅保留少量视觉 token 的学生模型在自己生成的轨迹上接受冻结全 token 教师模型的分布监督,并引入逐步降低 token 预算的课程。
该研究提出一种改进的 Stable Diffusion 3 架构,通过同时以摄影测量 DSM 和 Pléiades 卫星图像作为条件,对垂直配准的数字表面模型进行细化。实验表明,这种多模态条件方法能显著提升高程精度,在法国城市测试中,密集城区的 RMSE 从 6.00 米降至 3.45 米(上下文城市)及 2.76 米(留出城市)。
论文提出 TRACE 基准,旨在解决现有流式视频理解评估中忽略证据时效性、历史维护及响应触发机制的问题。该框架通过统一因果协议控制信息可用性,并多维报告答案质量、及时性、负载等指标。在 1240 条记录上的实验显示,相似的 QA 准确率可能掩盖系统在完成度、生成负载及主动响应行为(如误报、漏报)上的巨大差异,强调应将性能视为执行条件下的系统行为而非单一分数。
阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构发布食管癌筛查 AI 模型 DAMO EAGLE,无需插管和造影,从平扫 CT 识别包括早期和癌前病变在内的食管癌,论文 9 月 22 日发表于《自然·医学》。
TrackEverything提出一种新的3D点追踪模型,通过去重3D场景表示解决稀疏长时与稠密短时追踪的权衡问题。该模型利用体素化去重、端点细化器及3D WAFT技术,将模型复杂度与视频时长解耦。它是首个能在40GB显存内对超过1000帧视频进行全可见点追踪的3D追踪器,在TAPVid-3D基准上表现优于现有开源稠密追踪器。
研究者提出 EmbodiedMemory-Bench(EMem-Bench),包含 4 类任务家族共 2,554 个交互 episode,要求智能体从交互历史中构建并更新记忆,再据此在环境中完成后续任务。
针对现有方法难以捕捉字符间连接、间距和对齐等微观行为的问题,研究者提出 BoundInk。这是一个以写作者为条件的框架,将字符间边界视为显式生成单元,联合建模局部转换与上下文,从而在保持字形外观的同时改善连笔和间距。实验显示,该方法在三项基准测试中显著提升了边界质量指标,并将归一化动态时间规整距离降低了 17.6%--47.8%,在盲测人类评估中的偏好率为 78.0%--82.6%。
论文提出 JEPA-Anything,一个基于正交预测分解(OPF)的领域无关世界建模框架,覆盖视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。
ModaLens 论文提出一种成对图像替换审计方法,测量放射报告存在与否如何影响医疗 VLM 对影像的依赖。
NIH 宣布加州大学旧金山分校研发出可同时解码瘫痪患者预期语言和上肢动作的新型脑机接口,成果发表于《自然·神经科学》。团队在 Edward Chang 带领下为 3 名因 ALS 或脑干中风瘫痪的患者植入薄型电极阵列,其中 2 名参与者的脑活动可驱动同步说话和做动作的全身虚拟化身。
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。
DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。
Elvis Saravia 推荐 arXiv 论文 Codebook Agent(arXiv:2609.02264,UCLA),研究发现多智能体系统经奖励筛选后拓扑收敛到约六种。
研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。
arXiv 论文《Select, Compress, Reinvest》在固定评分器、分辨率策略与回答模型的前提下,逐一检验长视频 MLLM 的视觉token分配决策,覆盖六种免训练选择规则、三个长视频基准和两个回答模型。