跳到正文

#论文/研究

今日 0 条
9月2日周三
  1. HuggingFace Daily Papers(社区热门论文)38

    面向语音脑机接口的通用度量 OVMI

    论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。

  2. HuggingFace Daily Papers(社区热门论文)43

    VeriPhy 提出面向世界模型评估与改进的智能体物理推理系统

    论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。

  3. HuggingFace Daily Papers(社区热门论文)37

    研究将 SGD 优化动力学建模为渗流过程,提出方差级联与离散标度不变性

    该研究将随机梯度流(SGF)建模为渗流过程,认为架构对称性迫使子网络以离散的同步块合并,并在宏观序参量上表现为方差尖峰,类似物理相变。研究还指出这种捕获机制及标度级联在显式重尾噪声模型下同样适用于 Adam 和 AdamW。论文链接:https://arxiv.org/abs/2609.02373

  4. MarkTechPost(RSS)45

    普林斯顿、蚂蚁集团与斯坦福团队提出 AQuA:面向量化金融的两段式智能体自动因子发现框架

    普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队提出 AQuA,一套由两个互不共享智能体、记忆和状态的语言模型量化研究系统,其设计要点是在迭代开始前冻结数据划分、特征与标签定义和评估器,让智能体只能在受约束的 DSL 内探索,以阻断自我改进中的数据泄漏。

9月1日周二
  1. HuggingFace Daily Papers(社区热门论文)45

    WebWorld:把浏览器当作世界模型实现自改进的网页代码生成

    arXiv 论文提出 WebWorld,让 VLM 与浏览器这一确定性可执行模拟器交互,将 VLM 的批评编译为类型化交互契约,浏览器重新执行候选代码,只有目标进展与既有能力保持同时满足时才签发验收证书,证书化的转移累积为质量棘轮并作为 SFT 导出的唯一数据。

  2. HuggingFace Daily Papers(社区热门论文)47

    LightNav-0:激发 VLM 空间智能的通用具身导航模型

    研究团队发布 LightNav-0,一个紧凑的通用具身导航模型,通过双通道指向和残差向量量化动作 tokenizer 激发预训练 VLM 的空间智能,无需任务专用预测头。训练语料覆盖 2K+ 场景和 4K+ 小时具身导航数据,LightNav-0 在全部 10 个公开导航仿真环境中取得单目成功率 SOTA,真实世界评测显示跨机器人本体、场景及静态动态目标的零样本泛化能力。

  3. HuggingFace Daily Papers(社区热门论文)40

    NoRA:通过归一化下投影矩阵改进 LoRA 训练

    论文提出 Normalized Low-Rank Adaptation(NoRA),在训练中对 LoRA 的下投影矩阵做归一化,并发现仅在初始化时归一化也能改进标准 LoRA。在预训练、监督微调和强化学习中,NoRA 加速收敛、提升性能与训练稳定性并缓解灾难性遗忘,且不增加可训练参数和推理时计算。

  4. HuggingFace Daily Papers(社区热门论文)36

    BLARM:通过混合潜在刚性运动基元从视频驱动 3D 物体动画

    论文提出 BLARM,一种前馈方法,输入单目视频和静态物体网格,即可预测运动跟随视频的时序连贯动画网格。方法用少量随时间变化的刚性运动分量和顶点到分量的蒙皮权重表示动画,无需骨骼、cage、蒙皮权重或绑定标注,通过分解时空注意力将几何形变潜变量条件于视频特征,并以轨迹重建、熵正则和运动感知对比学习训练,生成准确且时序稳定的动画。

  5. HuggingFace Daily Papers(社区热门论文)44

    MNIST-PRO 基准:将 MNIST 改造为面向 AI 智能体的部分可观测环境

    研究者提出 MNIST-PRO 基准,把 MNIST 数字识别改造成带回看约束的序列化瞥视搜索任务,以隔离评测智能体的感知状态构建能力。评测覆盖十个多模态模型和四种记忆表征,发现模型在全可观测下表现良好,但部分可观测下暴露三类瓶颈:难以整合碎片化瞥视、过早停止探索、面对矛盾证据时难以修正早期错误信念。

  6. HuggingFace Daily Papers(社区热门论文)45

    CAST:面向可靠长程工具调用智能体的批判感知监督训练框架

    论文提出 CAST,一种批判感知训练框架,将稀疏任务结果转化为动作级监督,用于批判学习与策略优化,通过分析智能体轨迹合成解释动作有效性的结构化理由。在动态工具调用基准上微调 Qwen3 系列模型,Retail 任务 pass^4 超过 GPT-OSS-120B 达 10% 以上,域外 Telehealth 场景额外提升 9%。

  7. HuggingFace Daily Papers(社区热门论文)45

    Lucida:面向可组合真实到仿真场景建模的解析、生成与放置框架

    Lucida 提出可组合真实到仿真场景建模方法,将真实室内场景恢复为按观测排布、可单独操作的完整可编辑物体资产。方法沿用解析、生成、放置三步,但把精度要求重新分配到流水线末端:解析视频生成携带逐实例多视角证据的场景图,据此生成完整资产,并用 VLM 策略 GizmoAct 将放置建模为多轮 GUI 交互,闭环操纵物体 gizmo 并自行判断对齐完成。