#论文/研究
#论文/研究
今日 0 条
DAIR.AI@dair_aiAI 评分4545
Rohan Paul@rohanpaul_aiAI 评分5757
Cohere@cohereAI 评分4848Cohere Labs 发布 Agentic Task Ecosystem 数据集,包含 69 万以上为 AI 智能体构建的工具。在测试工具能否独立完成一项职业任务的实验中,仅 2.6% 通过。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 Last Translation Benchmark 发布,用人工评审的多模态样本测试机器翻译模型极限
研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 DRACO:用动态评分标准做长程智能体训练的细粒度信用分配
DRACO 提出在结果信号缺失的长程智能体训练中,动态生成评分标准并按轨迹打分,再把判断以闭式方法重分配到相关步骤,在 GRPO 中产生差异化逐步优势,不引入任何训练的归因模块。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6666 Productrise 研究:Google AI Mode 展示的同类商品价格比传统搜索高21.6%
Productrise 在2026年8月9日至31日的23天里追踪了超过10万个 SERP 和 AI Mode 响应中的200多万条商品列表,发现同一商品在 Google AI Mode 中的标价平均比传统搜索高21.6%。
DAIR.AI@dair_aiAI 评分4848Qwen 团队发布 Terminal-Universe 论文,从既有 agent 轨迹回放文件操作以重建可执行终端环境,而非从零生成。
elvis@omarsar0AI 评分5555
DAIR.AI@dair_aiAI 评分5959IT之家(RSS)AI 评分6969 华为何庭波发布 τ 定律论文,麒麟 2026 晶体管密度提升 55% 且功耗大降
华为工程师何庭波在 ChinaXiv 发布预印本论文《Huawei's τ Chip Was Supposed to Melt?》,披露 τ(韬)缩放定律原理及麒麟 2026 实测数据。
elvis@omarsar0AI 评分3737HuggingFace Daily Papers(社区热门论文)AI 评分4949 长视频多模态模型视觉token分配受控研究:选择、压缩与再分配
arXiv 论文《Select, Compress, Reinvest》在固定评分器、分辨率策略与回答模型的前提下,逐一检验长视频 MLLM 的视觉token分配决策,覆盖六种免训练选择规则、三个长视频基准和两个回答模型。
Rohan Paul@rohanpaul_aiAI 评分4343HuggingFace Daily Papers(社区热门论文)AI 评分4141 Scal3R 提出多相对位姿查询方法,提升长视频在线 3D 重建稳定性
Scal3R 将在线 3D 重建重新表述为多参考相对位姿查询,用约占参数 1% 的可学习 token 通过非对称注意力注入冻结骨干,并结合带回环闭合的在线位姿图优化抑制长程漂移。
Rohan Paul@rohanpaul_aiAI 评分5757ByteDance 等机构发布论文 HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
Rohan Paul@rohanpaul_aiAI 评分4747HuggingFace Daily Papers(社区热门论文)AI 评分3333 PACE 数据集与 PaceMaker 框架:识别用户请求中的隐性冲突
论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。
HuggingFace Daily Papers(社区热门论文)AI 评分4747 Compile by Training:将自然语言规格编译为可复用的本地神经函数
论文提出 compile by training,把自然语言规格编译为可复用的神经函数:编译时由教师模型生成任务样例,训练紧凑解释器的小型 adapter,运行时无需教师模型,可像普通软件一样存储、版本化和组合。
Rohan Paul@rohanpaul_aiAI 评分4545HuggingFace Daily Papers(社区热门论文)AI 评分3535 LatentStream:面向流式视频理解的渐进式潜在记忆演化框架
论文提出 LatentStream,将流式视频记忆从 store-and-retrieve 转向 retrieve-and-internalize,用潜在工作记忆内化历史证据以支持严格因果与有限内存下的推理。框架包含分层流式记忆、分层潜在记忆演化和置信度引导的潜在记忆优化三个组件,并在现有在线与离线视频基准上取得新的 SOTA 结果。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 Puffin-World 提出原生 3D 世界状态的统一多模态世界模型并开源
Puffin-World 是一个统一多模态架构,不依赖外部离线模块即可实现物理理解、空间模拟和 3D 世界生成与重建。该框架联合建模物理(重力场与纬度)、几何(深度)和外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示与跨未来帧传播物理动态的策略,在单一生成过程中同时合成未来视图并重建底层几何。
HuggingFace Daily Papers(社区热门论文)AI 评分5151 大模型 On-Policy Distillation 再思考 II:一条训练样本就够了
研究探讨 on-policy distillation(OPD)中训练数据的作用,发现仅用 1 条 query 训练即可持续提升数百步并恢复全量数据 OPD 的大部分增益。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 Random Attention 提出随机驱逐 KV cache 以提升长推理效率
Salesforce AI Research 提出 Random Attention,不对缓存 token 打分,而是保留提示词并在每个注意力头内均匀随机驱逐,在四个模型、六个推理任务上匹配最强先验驱逐方法,vLLM 部署下吞吐量高出 32-43%。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 WorldReward 提出面向相机条件世界模型的 VLM 奖励建模方法
WorldReward 是一个基于 VLM 的成对偏好奖励模型,为相机条件世界模型统一评估动作一致性与视觉质量。方法将视频分解为动作对齐的块并投票聚合,配套发布人工标注的 WorldReward-Bench,在三个维度上分别超过 GPT-5.5 约 3.42、1.45 和 3.56 个百分点,用于 HY-WorldPlay 1.5 的 RL 后训练可同时提升动作执行与视觉质量。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 FlashRender:基于相机控制视频 MeanFlow 的少步生成渲染框架
论文提出 FlashRender,一个少步生成渲染框架,可在数秒内沿目标相机轨迹重新渲染源视频。方法引入 RETA 将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再用 MeanFlow 目标微调并结合 on-policy flow map 蒸馏。实验显示其在视频质量和几何一致性上匹配多步基线,采样成本降低 25 倍,并在分布外目标相机轨迹下具备更强的相机可控性。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6868 Armature 分析 16,893 次会话:Claude Code、Codex 和 Cursor 如何选择第三方工具
Armature 通过 16,893 次实验会话分析 Claude Code、Codex 和 Cursor 在真实代码库任务中选择哪些第三方工具,经筛选保留 5,292 个有效会话,覆盖 51 个代码库和 18 个行业。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 Minima 论文解释 Gated DeltaNet 为何能在 NVFP4 W4A4 4-bit 量化下保持性能
Minima 对 Qwen3.8-27B(48 层 GDN、16 层注意力)的全部 496 个线性层(含 GDN)应用 NVFP4 W4A4 量化,在 MMLU-Pro。
HuggingFace Daily Papers(社区热门论文)AI 评分5555 LLaDA-Image 发布:用完全开放的训练配方构建强图像生成模型
LLaDA-Image 是一个统一框架,包含从零训练的 6B Diffusion Transformer 和基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块。
HuggingFace Daily Papers(社区热门论文)AI 评分4646 Terminal-Universe:把智能体轨迹转化为可扩展的终端环境
Terminal-Universe 框架通过回放轨迹中的文件操作恢复原工作区,并借助补全智能体补齐缺失文件,将现有智能体轨迹重建为可复用、可执行的环境,在广度(跨代码库查询)和深度(多轮会话)两个方向合成新任务。
HuggingFace Daily Papers(社区热门论文)AI 评分5858 Principia 基准:通过成对物体的关系不变量评测视频模型的物理推理
论文提出 Principia 基准,用 529 个真实场景中的配对物体关系不变量评测视频生成模型和 VLM 的牛顿物理一致性,覆盖重力、摩擦、转动惯量等 8 种现象。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 Environment Evolution:为终端 Agent 提供持续学习信号的环境进化方法
论文提出环境进化方法,通过 off-policy 地递进增加环境难度并按代调度,为终端 Agent 训练提供持续学习信号。
HuggingFace Daily Papers(社区热门论文)AI 评分4848 Editable Visual Design 论文提出基于 Coding Agent 的可编辑视觉设计新范式
论文提出 Editable Visual Design 范式,由 Coding Agent 驱动,将 VLM 作为理解需求、规划任务和审美判断的创意大脑,将图像生成模型作为按需合成独立视觉素材的视觉世界模拟器。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 CORE 论文提出用重排器蒸馏改进多模态嵌入的组合推理
论文提出 CORE,通过合成五个组合匹配级别的候选列表和 Rank-KL 目标,把多模态模型作为重排器时的组合判断蒸馏进嵌入模型。
DAIR.AI@dair_aiAI 评分6767
Rohan Paul@rohanpaul_aiAI 评分4444
AK@_akhaliqAI 评分2626
AK@_akhaliqAI 评分2424
AK@_akhaliqAI 评分2525
Rohan Paul@rohanpaul_aiAI 评分4242Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。
Epoch AI:研究、数据与评测精选AI 评分6565 Epoch AI 分析华为 AI 芯片路线图,判断 2030 年前难以追上 Nvidia
Epoch AI 报告估计华为 2026 年将生产约 150 万颗 Ascend 芯片,折合 88 万 H100e,不足 Nvidia 算力产出的 4%,芯片性能落后 Nvidia 三到四年,单芯片纸面差距明年扩至约 17.5 倍。
推荐理由:报告用逐项建模拆解华为与 Nvidia 的算力差距,指出瓶颈将从 HBM 供给转向单芯片性能,结论可检验。