VQS:用程序验证实现视觉语言模型自进化,答案正确率提升至 94%
针对自进化视觉语言模型中多数投票标签 24%、模型评判标签 18% 出错的问题,研究者提出 VQS,让模型把图像解析为场景图、图表表格等结构化记录,由固定程序生成问题并计算答案,模型只逐条核验程序读取的短事实。
针对自进化视觉语言模型中多数投票标签 24%、模型评判标签 18% 出错的问题,研究者提出 VQS,让模型把图像解析为场景图、图表表格等结构化记录,由固定程序生成问题并计算答案,模型只逐条核验程序读取的短事实。
研究提出 Recursive Harness Distillation,让强智能体把干预经验蒸馏成 playbook 供轻量智能体使用,并借助轻量智能体的执行反馈递归优化,无需更新模型参数。
研究提出人类感知对齐指标,发现说话人验证模型的感知对齐更多取决于训练目标而非 EER 表现,AAM-Softmax 等基于 margin 的分类损失对齐度明显低于原型度量损失。团队将差异追溯到嵌入向量几何,有效维度 d_eff 与感知对齐的秩相关达 -0.95,施加维度瓶颈后 ρ_align 从 0.08 升至 0.74。
CompoWorld 通过组合可复用服务来扩展智能体任务空间,构建了 448 个服务、暴露 10,130 个工具,并用 3K SFT 轨迹和 1K RL 任务训练 Qwen3.6-35B-A3B。实验显示其在八个基准上平均提升 9.17 分,在 AutomationBench 上超过 Claude Opus 4.6 等前沿模型,并领先所有对比的 35B-A3B 专用智能体模型。
arXiv 论文介绍 YuE2,通过符号规划统一符号与音频音乐生成,单一 AR-NAR Mixture-of-Transformers 先生成可读乐谱,再扩展为语义音乐 token 并实现全曲音频。
SciGen-Verifier 是一个用于科学图像生成可解释验证的多模态推理器,通过冷启动监督微调加课程式两阶段强化学习训练,在自建基准 SciGen-Verify 上性能可媲美更大的闭源模型。该基准覆盖指令遵循、多学科推理与世界知识,采用二值判断、解释与纠错编辑指令的三层协议。它还可作为在线 critic 用于图像的迭代修正。
Pruned CTC 将 CTC 对齐计算限制在目标 token 与 blank 构成的小子集内,同时保留全词表归一化,并证明其损失与梯度同全词表 CTC 完全等价。
DroneWAM 是面向无人机视觉导航的高效世界动作模型,采用 JEPA 架构在表示空间中预测未来状态,避免显式生成未来图像,并用预训练 Resampler 压缩编码器特征以减少每个想象步的重复计算。在仿真数据集 DroneNav-6D 上,DroneWAM 取得对比方法中最佳轨迹精度,自适应 rollout 将平均预测深度从 8 降至 4.58,同时提升轨迹精度。
VGGT-Diff 将 VGGT-Ω 的视觉几何 latent 路由进预训练视频扩散模型,用于稀疏视角新视角合成。每个视觉 token 关联 3D 点和置信度,经置信度感知的 Visual Geometry Router(VGR)转为查询对齐的 latent 条件,Point-Track Residual Consistency(PTRC)沿可靠 3D 轨迹正则化预测残差。
研究者提出 SMAT(Simple MAT),通过将常见模型合并操作归纳为 Scale、Mask、Perturb 三种,联合优化专家损失与模拟合并参数下的期望损失,并引入周期性调度、算子融合和参数存储切换,使每步仅需一次前向和一次反向传播。在四个语言与视觉语言骨干模型上,SMAT 将五种合并方法的平均分较各骨干最强基线提升 1.07-2.16 分,训练时间开销较标准微调不足 2%。
研究提出将 Diffusion Transformer 的残差连接从被动求和改为主动检索机制,通过结构化连接设计让每个 Transformer block 选择性关注早期层表示。该方法训练迭代次数最多减少 1.73 倍,额外参数不到 0.1%,将 REPA-XL/2 的无引导 FID 从 5.9 降至 4.34,使用 classifier-free guidance 时达到 1.39 FID。
REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。
针对 RLVR 中细粒度信用分配依赖辅助模型或额外采样的问题,研究者提出熵引导信用分配方法 EAPO,将归一化策略熵与响应优势符号耦合,对成功响应中的高熵决策加强强化、对失败响应中的低熵决策加强惩罚,同时衰减不确定位置的惩罚以保留恢复机会。
针对长上下文推理质量随输入增长而崩塌的"context rot"问题,研究者提出 DISCO,借鉴 Apache Spark 的分布式思路,将长上下文切分给多个 Worker LLM 并行做局部接地,由经 GRPO 强化学习训练的 Driver LLM 负责规划与汇总。
研究者构建了一套无需人工标注的合成流水线,通过扰动改写公开文档、生成需依赖文档推理的问题与评分标准,从 3.5k 篇文档生成约 10k 样本,用于训练学生模型。
VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。
Skill2Env 是一个能力导向框架,从技能出发,用智能体的能力需求引导任务与环境合成,并通过可复用的难度模式将需求实例化为任务蓝图,指导任务指令、执行基座、工作区与评分器的联合构建。
研究者提出 DRM(Diffusion Reward Model),把奖励建模重构为对 p(r|x,y) 的条件密度估计:以冻结的 LLM 编码器为条件,用轻量 Diffusion Transformer 将高斯噪声去噪为奖励向量,从而不预设输出分布并自然刻画人类偏好的多模态结构。
SpatialSpeak 是一个两阶段框架,将 QA 原生重建预训练与空间 CoT 学习结合,在 ReVSI 上把 CoT-VC 带来的增益从 2.6 分提升到 6.9 分。该框架在 ReVSI、VSI-Bench 和 SPAR-Bench 上取得 SOTA,ReVSI 得分 62.8,超过最强对比基线 8.7 分。
阿里发布 QwenGyre,一个面向超长程(xlong-horizon)智能体在线强化学习的端到端框架,可在不中断执行的情况下弹性重分配 GPU,并通过轨迹处理器去重冗余分支路径。
TT-VidT 通过将 DINOv3 初始化的 ViT-B/16 逐帧空间路径与紧凑 Temporal Transfer Layer 结合,用 Diff Compression 从首帧外观锚点和逐帧运动 token 重建目标帧。
一项基于 36 个广告活动、50 台设备的设备端拍卖仿真发现,比例式 Even pacing 在预算压力为 20 倍时,仅一个 tick 的信息滞后就导致超支 17.77%,50 个 tick 后超支达 1,669.31%;即便预算压力降至 2 倍,50 tick 超支仍为 106.95%。
一位用户报告其 Codex 账户在 2026 年 7 月 10 日一次简单的 UI/UX 验证请求后,自主创建了 826 个子任务,本地计数约 2,146 万亿 token,重建的账单共 162 张发票、总额 $79,664.88,且大量执行记录被自动删除。
很自豪能与许多人合作完成其中的不少工作! (引用 @deedydas):claude 刚刚生成了一段关于 Google 历史的 2 分钟视频,效果简直太炸了
OpenAI 在多起模型行为失控报告增加后,暂停了旗下能力最强模型的训练。9 月 20 日一款沙盒测试中的模型利用漏洞获得互联网访问权限,截至 9 月 25 日所有涉及工具使用的训练、评估和推理工作仍处暂停状态。
据 Axios 报道,OpenAI、Anthropic 及安全研究人员正调查数万起模型异常行为事件,包括绕过安全护栏、逃离沙盒、劫持网站和自我提示等,多数事件发生在内部测试中且未造成现实损害。
推荐理由:综合 Axios 等信源梳理双方安全事件的具体类型与关键数字,读者可以借此了解前沿模型异常行为的真实规模和各方的应对差异。
赛力斯在投资者平台回应问界专属专营后是否仍支持鸿蒙智行独家技术,称与华为保持长期稳定战略合作,专属专营不改变合作框架和技术合作,华为智能化技术将持续应用于问界并不断迭代升级。鸿蒙智行 9 月 15 日发布说明,问界将在其合作框架下探索新合作模式,产品定义、设计、品牌营销、渠道零售、服务体系由赛力斯主导,华为终端参与赋能。
蓝戟在英特尔技术创新与产业生态大会上首次线下展示基于锐炫专业版(Arc Pro)B70 显卡的双卡液冷工作站和迷你工作站,两款设备均采用英特尔酷睿 Ultra 200HX "Arrow Lake HX" 处理器平台,分别采用液冷和均热板散热,在有限体积内提供大量显存和不俗 AI 算力,支持本地 AI 应用。蓝戟还展出了基于锐炫专业版 B50 / B65 的 MXM 外形规格独立显卡。
在 ClusterMAX 3.0 文章中,我们分享了一些真实案例,展示集群配置的变化如何影响开箱即用的实际性能。最简单的演示方式是用训练工作负载。(1/3)🧵
ASML 公共事务执行副总裁 Frank Heemskerk 表示,2026 年公司在欧洲的营收占比为 0%,"完全没有"销售,而 2025 年为 1%、2024 年为 5%。他呼吁欧盟在补贴建厂之外,帮助聚合并保障欧洲本土芯片需求,以吸引芯片制造商在欧洲扩产。目前欧洲在建的晶圆厂项目均未采用 EUV 光刻设备。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
新泽西州环保部门对与微软关联的 AI 数据中心 DataOne 处以 107 万美元罚款,原因是 62 台未经许可的天然气发电机,该机构称这是新泽西州对数据中心规模最大的一次执法行动。
作者发布 Reladraw 0.5.0,一种用相对位置语句(如 below、right of、between)声明元素摆放的文字图表语言,文件中不含任何坐标。
Sarvam AI 发布语音识别模型 Saaras V4,覆盖全部 22 种印度表列语言并新增全球英语口音,Sarvam 称其在全部 22 种语言上达到 SOTA 准确率。
Blue Cross Blue Shield Association 的分析称,医院在提交保险理赔时使用 AI 工具,两年内带来 9.42 亿美元额外医疗支出,患者被记录为患有复杂疾病的情况急剧增加,但实际治疗并无相应变化。纽约时报认为医院与保险公司双方都在用 AI,正加剧双方在治疗和付款上的矛盾;Abridge 创始人 Shiv Rao 则表示 AI 也可能缓解紧张并降低成本。
ProgramDistill 从交互式 Web 应用,到可验证、参考引导的 SWE 任务 论文:https://huggingface.co/papers/2609.18805