跳到正文

#论文/研究

今日 0 条
9月24日周四
  1. HuggingFace Daily Papers(社区热门论文)52

    JitMem 提出读取时任务自适应记忆整理方法,提升 LLM 智能体表现

    论文提出 Just-in-Time Memory(JitMem),保留原始轨迹并把记忆整理推迟到读取时,由整理器根据当前任务合成任务自适应的紧凑载荷。在 ALFWorld、WebShop 和 τ^2-bench 上,JitMem 分别超过最强基线 16.2、16.3 和 3.9 个绝对成功率点,未训练的整理器也已与基线相当或更优。

  2. HuggingFace Daily Papers(社区热门论文)53

    Hunyuan-A13B 技术报告发布:80B 总参数、13B 激活的开源 MoE 模型

    腾讯混元发布开源 MoE 大语言模型 Hunyuan-A13B,总参数 80B、推理仅激活 13B,以平衡能力、效率与部署成本。模型在经严格筛选的 20T token 语料上预训练并加强 STEM 数据,再经 SFT 和大规模强化学习;引入双模式 Chain-of-Thought 框架,简单问题用快思考、复杂多步问题用慢思考。

  3. HuggingFace Daily Papers(社区热门论文)57

    上海AI实验室发布 InternW0 物理世界模型基础版

    上海AI实验室推出 InternW 物理世界模型系列的首个模型 InternW0,通过非对称视频动作架构结合 flow matching 联合学习未来视觉动态与连续机器人控制,视频专家提供长时程预测上下文,轻量动作专家以更快频率运行,并通过复用层间 K/V 和观察条件上下文路由避免每次动作更新都重新生成未来。

  4. IT之家(RSS)68

    Anthropic 成立生命科学团队和实验室,Claude 自主发现新型酶系统 ART

    Anthropic 于 9 月 23 日宣布成立生命科学研究团队及自有分子生物学实验室,并公布 Claude 参与的首项成果。约 950 个 Claude 智能体在 21 小时内消耗约 2.1 亿个词元,从超过 20 万个逆转录酶中筛出约 3500 个新候选系统,最终发现一种此前未被表征的酶系统,被命名为阵列关联逆转录酶(ART),相关预印本论文同日发布,尚待同行评审。

  5. HuggingFace Daily Papers(社区热门论文)43

    Rolling-WAM:带滚动想象的世界动作模型

    Rolling-WAM 将视频-动作联合去噪分散到连续的重规划周期中,通过滑动窗口在不同噪声水平上维护视频-动作块,每步完整去噪即将执行的动作块、部分精炼更远的未来块。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上,该方法取得有竞争力的操作性能,相比标准联合 WAM 实现 4.5 倍稳态重规划加速。

  6. HuggingFace Daily Papers(社区热门论文)55

    TrackEverything:突破长视频稠密3D点追踪的显存瓶颈

    TrackEverything提出一种新的3D点追踪模型,通过去重3D场景表示解决稀疏长时与稠密短时追踪的权衡问题。该模型利用体素化去重、端点细化器及3D WAFT技术,将模型复杂度与视频时长解耦。它是首个能在40GB显存内对超过1000帧视频进行全可见点追踪的3D追踪器,在TAPVid-3D基准上表现优于现有开源稠密追踪器。

  7. HuggingFace Daily Papers(社区热门论文)45

    Jev模型生态系统数据分析研究

    该研究对GitHub上2170个公开Jev项目进行了大规模数据分析,探讨Jev这一低成本决策模型在自然语言问答、二元判断和评分等场景中的应用。研究发现Jev作为可复用决策组件,其功能随工作流变化,且公众关注度集中在路由和接口代理,而非项目数量本身。

  8. HuggingFace Daily Papers(社区热门论文)38

    SAGE:通过拓扑引导缓解长程推理偏差

    研究者提出 SAGE(Structural Admissibility-Guided Exploration)框架,通过代数稀疏化与双曲结构引导两种结构先验,缓解长程推理中的探索偏差与累积偏差。在 12 个基准、7 个模型族上,SAGE 优于竞争基线,在 Andrews-Curtis 问题上取得最高 8 倍提升。代码已开源。

  9. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    OpenAI 联合 80 多位心理健康专家发布开放基准 MentalHealthBench

    OpenAI 发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现,由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。

    推荐理由:原文给出基准的构建方法、评分权重设计和开放发布方式,研究者可据此复现或扩展心理健康方向的模型评测。

  10. Anthropic:Newsroom(网页)76

    Anthropic 成立生命科学实验室,Claude 自主发现类 CRISPR 的新型酶系统 ART

    Anthropic 宣布成立生命科学研究组与实验室,Claude 智能体在仅有人类高层指导下自主发现一种与 DNA 重复序列相关、结构类似 CRISPR 的新型酶系统,命名为 array-associated reverse transcriptases(ART),并发布预印本。

    推荐理由:原文给出 Claude 发现新酶系统的具体过程与规模数据,读者可了解 AI 智能体如何参与基础生物学发现的工作方式。

  11. Microsoft Research 博客(RSS)78

    微软研究院:机器人推理卸载至边缘/云端可显著提升性能与续航

    微软研究院发布关于物理AI机器人推理基础设施的研究。通过系统评估移动操作任务,发现将推理从机载GPU卸载至边缘或云端,能解决机载算力限制模型规模、导致响应延迟(最高383%)及精度下降的问题。实验显示,卸载推理不仅提升了任务成功率,还通过替换高功耗机载GPU为轻量硬件(如树莓派),使机器人电池寿命延长高达160%。此外,微软推出了基于Kubernetes的Physical AI Toolchain工具集,支持自动化容器化与分布式推理部署。

9月23日周三
  1. HuggingFace Daily Papers(社区热门论文)41

    TimeEvo:时间序列智能体的失败驱动自进化

    TimeEvo 提出一种失败驱动的时间序列智能体自进化方法,通过将诊断出的失败聚类为能力缺口、为每个缺口规划度量、合成仅基于证据的工具,并经配对准入机制筛选候选工具库。在十个时间序列 QA 任务和三个骨干模型上,TimeEvo 从空工具库起步,在每个任务和每个骨干上都提升了准确率,且在廉价模型上成长出的工具库装入更强模型后仍能带来增益。

  2. HuggingFace Daily Papers(社区热门论文)53

    Learning to Discover Interesting Mathematics:用有趣度指标引导模型自动发现数学定理

    论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。

  3. Epoch AI:研究、数据与评测66

    Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47%

    Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。

    推荐理由:报告用五个基准三年数据量化达到同等性能的成本下降速度,还区分了刚成为 SOTA 与两年后两种情形,数字和方法都值得细看。

9月22日周二
  1. HuggingFace Daily Papers(社区热门论文)45

    FoMo:利用扩散模型轨迹分叉时刻自动生成感知距离标签

    该论文提出 FoMo(Forking Moment),一种全自动数据生成管线,用于在无需人工标注的情况下生成图像对之间的点式感知距离标签。方法利用扩散模型的生成动态,认为早期时间步决定粗结构,晚期决定细节;图像在生成轨迹中“分叉”越早,感知距离越远。实验表明该方法能对齐人类视觉系统,并用于训练参考型图像质量评估指标,在多个基准上超越依赖人工标注的数据集。

9月21日周一
  1. HuggingFace Daily Papers(社区热门论文)43

    D-JEPA:面向决策对齐的潜在世界模型

    D-JEPA 是一种决策对齐的潜在世界模型,通过学习已执行结果中候选未来之间的决策相关关系,弥补预测精度与决策质量之间的"决策局部预测差距"。它在 PushT 上达到 87.89% 成功率,在 RoboTwin 上平均提升 15.04 分,在物理机器人任务上提升 17 分。该方法兼容 JEPA 未来表征,可通过原生潜在距离规划部署。

  2. IT之家(RSS)53

    IDC 报告:2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,宇树、云深处、智元等中国厂商领先

    IDC 发布《全球四足机器人市场份额,1H26》报告,2026 上半年全球四足机器人出货量超 4.9 万台,同比增长 92.5%,市场规模超 4 亿美元。教育科研和家用消费贡献约 60% 出货量但收入不足三分之一;行业级应用市场规模超 2.7 亿美元,同比增长 125.1%,部署量同比增长 260.5%,云深处科技位居行业级应用市场首位。