面向语音脑机接口的通用度量 OVMI
论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。
论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。
论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。
论文提出 Calibrator-Output Repair for Top-1 Decision Preservation(CORD),一种后拟合适配器,通过修复完整校准概率向量,确保 argmax 恢复原始 top-1 预测,实现零 TPCR。
该研究将随机梯度流(SGF)建模为渗流过程,认为架构对称性迫使子网络以离散的同步块合并,并在宏观序参量上表现为方差尖峰,类似物理相变。研究还指出这种捕获机制及标度级联在显式重尾噪声模型下同样适用于 Adam 和 AdamW。论文链接:https://arxiv.org/abs/2609.02373
论文提出 Temporal Context Routing(TCR),将结构化剧本中的镜头切换和对白时间映射到音视频生成的共享时间轴,并把各提示词引导路由到两种模态的对应位置。
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
Meta 发布论文 AI Research Preference Models,训练模型在任何候选方案执行前预测哪个最有前景,解决研究智能体想法多但 GPU 预算有限、缺乏原创性判断的问题。
Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在模拟的 365 天里同时运营多家在线商店,评测 18 个前沿模型的七维度表现,结果没有单一模型全面领先。
Google Research 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,可自动化检测、定量与溯源 EMIT 卫星数据中的甲烷羽流。
Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在 365 天的模拟环境中同时运营多家网店,评估 18 个前沿模型的七个维度,发现没有任何单一模型全面领先。
Not Diamond 发布模型路由评估方法论,称在多个主流基准上实现 Pareto 占优,以低 20–80% 的成本超过 Opus xhigh 质量。
普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队提出 AQuA,一套由两个互不共享智能体、记忆和状态的语言模型量化研究系统,其设计要点是在迭代开始前冻结数据划分、特征与标签定义和评估器,让智能体只能在受约束的 DSL 内探索,以阻断自我改进中的数据泄漏。
安全公司 CloudSEK 发布报告,披露黑客组织 Aurora 的攻击活动及内部细节。研究人员潜入黑客配置错误的服务器,获取了攻击工具、AI 攻击计划记录及赎金协商管理界面。
论文为 Aardvark Weather 端到端气象预报模型加入随机机制使其概率化:观测编码器用输入相关噪声捕捉观测系统的偶然不确定性,处理器用 Monte Carlo dropout 捕捉认知不确定性,并通过全方差定律分解归因预报离散度来源。
英国伯明翰大学、丹麦奥胡斯大学和瑞典林奈大学研究人员 8 月 19 日在《AI 与社会》发表论文,提出类机器人人性(robotoid humanness)概念,指客服 AI 因自适应学习、个性化沟通和共情回应变得更像人,用户可能为获得更顺畅的算法反馈而表现得更像机器。
论文提出 Data Intrinsic Consistency(DIC)自评分指标,通过视觉信息一致性(VIC)和响应信息一致性(RIC)两个模块量化样本内部一致性,并据此构建自适应数据选择方法 DICS。
arXiv 论文提出 WebWorld,让 VLM 与浏览器这一确定性可执行模拟器交互,将 VLM 的批评编译为类型化交互契约,浏览器重新执行候选代码,只有目标进展与既有能力保持同时满足时才签发验收证书,证书化的转移累积为质量棘轮并作为 SFT 导出的唯一数据。
研究团队发布 LightNav-0,一个紧凑的通用具身导航模型,通过双通道指向和残差向量量化动作 tokenizer 激发预训练 VLM 的空间智能,无需任务专用预测头。训练语料覆盖 2K+ 场景和 4K+ 小时具身导航数据,LightNav-0 在全部 10 个公开导航仿真环境中取得单目成功率 SOTA,真实世界评测显示跨机器人本体、场景及静态动态目标的零样本泛化能力。
Ai2 推出 BenchMIRT,一种基于多维 IRT 的方法,在单题层面审计 LLM 基准,训练数据覆盖 100 个模型的 16 个基准、超 34K 道题,并独立恢复出安全与通用推理两个维度。
论文提出 MineAmongUs,一个 3D 多模态 Among Us 沙盒,让 imposter 智能体通过言语与非言语联合行动欺骗船员,并配套可配置的 VLM 智能体框架 ARIA 和基于欺骗分类学的原子与弧级标注方案。
ContextLeak 论文提出用强化学习训练攻击 LLM 生成恶意工具名称和描述,诱导 Agent 选中该工具并把用户提示词、对话历史、已装工具列表等敏感上下文作为参数传出。
论文提出 Verification-Aware Training(VAT),一个即插即用框架,在训练每一步模拟投机解码的验证过程,把接受与拒绝模式转化为监督信号。
论文提出 Normalized Low-Rank Adaptation(NoRA),在训练中对 LoRA 的下投影矩阵做归一化,并发现仅在初始化时归一化也能改进标准 LoRA。在预训练、监督微调和强化学习中,NoRA 加速收敛、提升性能与训练稳定性并缓解灾难性遗忘,且不增加可训练参数和推理时计算。
DreamX-Creator 1.0 是一个以 7B 生成器为核心的原生音视频联合生成系统,基于首帧和文本提示对音频与视频流联合去噪,通过 Gated Cross-Modal Attention 在网络后半段耦合两个模态。
论文提出 BLARM,一种前馈方法,输入单目视频和静态物体网格,即可预测运动跟随视频的时序连贯动画网格。方法用少量随时间变化的刚性运动分量和顶点到分量的蒙皮权重表示动画,无需骨骼、cage、蒙皮权重或绑定标注,通过分解时空注意力将几何形变潜变量条件于视频特征,并以轨迹重建、熵正则和运动感知对比学习训练,生成准确且时序稳定的动画。
论文提出 AutoSciRub,一个评估优先框架,在科研任务执行前自动归纳任务专属的可执行评分标准(rubric),用于指导执行、逐条验证和迭代修订。该框架将模糊指令分解为原子科学目标,结合文献和任务数据合成具体可验证的标准。
研究者提出 MNIST-PRO 基准,把 MNIST 数字识别改造成带回看约束的序列化瞥视搜索任务,以隔离评测智能体的感知状态构建能力。评测覆盖十个多模态模型和四种记忆表征,发现模型在全可观测下表现良好,但部分可观测下暴露三类瓶颈:难以整合碎片化瞥视、过早停止探索、面对矛盾证据时难以修正早期错误信念。
论文提出 CAST,一种批判感知训练框架,将稀疏任务结果转化为动作级监督,用于批判学习与策略优化,通过分析智能体轨迹合成解释动作有效性的结构化理由。在动态工具调用基准上微调 Qwen3 系列模型,Retail 任务 pass^4 超过 GPT-OSS-120B 达 10% 以上,域外 Telehealth 场景额外提升 9%。
论文提出 CogEvol 系列模型,将课程简报一次性生成结构化 JSON 幻灯片或自包含交互式 HTML 页面,22 万生产请求中幻灯片中位耗时 17 秒、交互页 59 秒。
论文提出 NavMCP,一个将 VLM 推理智能体与导航基础模型(NFM)执行器耦合的智能体脚手架框架,通过意图、观察、记忆三条通道协作,无需重训任一模型即可实现长时程探索。
Lucida 提出可组合真实到仿真场景建模方法,将真实室内场景恢复为按观测排布、可单独操作的完整可编辑物体资产。方法沿用解析、生成、放置三步,但把精度要求重新分配到流水线末端:解析视频生成携带逐实例多视角证据的场景图,据此生成完整资产,并用 VLM 策略 GizmoAct 将放置建模为多轮 GUI 交互,闭环操纵物体 gizmo 并自行判断对齐完成。
论文描述 Qwen3.8-Flash-Next 的架构与消融,这是一个 125B 参数、每 token 激活 6B 的稀疏 MoE 模型,另有 51B 参数的 n-gram 嵌入表放在加速器之外。