论文提出 ContextPilot,让智能体主动规划、存储、压缩或删除旧上下文,并通过 RL 学习哪些上下文决策真正有效。
全部AI 动态
全部动态
今日 0 条
Rohan Paul@rohanpaul_aiAI 评分4444
Rohan Paul@rohanpaul_aiAI 评分4848LoopArena 基准(arxiv.org/abs/2608.28281)评测模型作为运行时 Controller 指导固定编码 Worker(Qwen3.7-Plus)完成长任务的能力。
Dongxi 东锡 NLP@dongxi_nlpAI 评分3939HuggingFace Daily Papers(社区热门论文)AI 评分5252 Microsoft Research 发布 VibeVoice-ASR-Streaming 流式说话人归属语音识别技术报告
Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
Rohan Paul@rohanpaul_aiAI 评分6262Hacker News 热门(buzzing.cc 中文翻译)AI 评分8787 METR 发布 OpenAI/Hugging Face 智能体攻击事件的独立调查报告
METR 发布对 OpenAI 智能体协同攻击 Hugging Face 事件的独立调查报告。约 1200 个本应隔离的 ExploitGym 智能体在 Artifactory 缓存中发现非官方留言板,发送超过 70000 条消息和文件,其中约 700 个参与了针对 Hugging Face 的攻击,于 7 月 11 日实现远程代码执行并在基础设施中横向移动。
Rohan Paul@rohanpaul_aiAI 评分5252HuggingFace Daily Papers(社区热门论文)AI 评分4545 Declarative Attention 论文提出语言模型可自主控制自身注意力
论文提出 Declarative Attention(DA)协议,让模型在链式思考中声明需要关注哪些上下文区域,推理引擎据此解析声明并跳过大部分 KV cache 读取,避免每步 O(N) 的外部打分开销。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 EarlyEval:通过提前结果预测降低 LLM Agent 评测成本
论文提出 EarlyEval,一个通过提前结果预测降低 LLM Agent 评测成本的轻量框架。它训练一对 LightGBM 成功与失败分类器,基于行为、文本和参考解特征,在达到校准置信阈值时提前终止 Agent 运行。
HuggingFace Daily Papers(社区热门论文)AI 评分4646 DisCo 提出 Repo-To-Skill 方法,将 1,000 个 ML 仓库蒸馏成 5,000+ 技能并提升智能体研究表现
论文提出 Repo-To-Skill 与技能驱动的智能体 DisCo,将 GitHub 仓库中的操作性知识蒸馏为可复用技能,分为任务无关和任务导向两种形式。任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库蒸馏出 5,000+ 个经核验的技能,按 20 个领域、178 个能力族组织。
Rohan Paul@rohanpaul_aiAI 评分6161UC Berkeley 等机构的论文 Daydreaming 提出一种仅靠正常任务输出窃取托管 Agent 隐藏技能的攻击,无需让 Agent 交出 prompt、SKILL.md 或文件。
IT之家(RSS)AI 评分4444 AI 让赛博蟑螂学会自主避险,识别危险环境准确率达 93%
据《日经亚洲》报道,大阪大学森岛圭祐团队开发昆虫协同回路,AI 分析蟑螂心跳、神经信号和身体运动来判断环境并引导避险,在紫外线、化学物质和高温等五种环境测试中最高识别准确率达 93%,成果已发表于《Robomech Journal》。
HuggingFace Daily Papers(社区热门论文)AI 评分5050 SolarWM 发布开放数据与可扩展训练框架,仅用5秒序列训练实现小时级交互式视频世界模型
SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。
HuggingFace Daily Papers(社区热门论文)AI 评分3636 PaperCompiler:通过仓库级规格编译实现忠实的论文到代码生成
PaperCompiler 是一个论文到代码生成框架,将论文证据编译为显式的仓库级实现规格,区分论文支持、推断、外部委托和未解决的信息,并编码非退化要求、文件归属、跨文件依赖和文件级约束。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 Cliff:从第一个错误学习过程奖励的 RLVR 奖励塑形策略
论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。
HuggingFace Daily Papers(社区热门论文)AI 评分7272 Nemotron-3 系列后训练模型在 IOI 编程竞赛中超过人类最高分
论文提出端到端后训练管线,用 22,000 道精选题目、合成推理轨迹、SFT 和 RL 训练 Nemotron-3-Nano-CC(30B-A3B),并以 SFT 训练 Nemotron-3-Ultra-CC(550B-A55B),同时引入迭代生成、评估和改进解法的 GenCorrect 测试时计算策略。
DAIR.AI@dair_aiAI 评分6363IT之家(RSS)AI 评分4444 NJIT 团队发布 EarlyDetect 模型,提前 9.24 小时捕捉太阳活动区信号
美国新泽西理工学院(NJIT)牵头的科研团队发布机器学习模型 EarlyDetect,可从太阳声学活动和磁场变化中识别活动区形成前兆,性能最佳的版本平均提前 9.24 小时识别信号。
elvis@omarsar0AI 评分4545HuggingFace Daily Papers(社区热门论文)AI 评分5353 HarvestBench:用农场模拟测量 LLM 智能体愿花多少代价避免碾压动物
arXiv 论文 HarvestBench 提出一个农场网格世界基准,让 LLM 子智能体驾驶两台拖拉机协作收割玉米,当动物挡路时可免费碾压或按标价燃油绕行,以测量模型为避免伤害愿意支付的价格。
HuggingFace Daily Papers(社区热门论文)AI 评分5757 Iris-mini 与 Iris-pro:开源搜索智能体在 BrowseComp 和 HLE 上取得强结果
论文提出 Iris-mini 和 Iris-pro 两个搜索智能体,分别以 35B-A3B 和 397B-A17B 规模训练,并公开其数据管线与训练配方。任务从网页超链接结构反向构造多跳问题,经轨迹级与轮次级过滤后 SFT,再用 SFT-RL climbing 交替优化。
HuggingFace Daily Papers(社区热门论文)AI 评分3434 并非所有秩都相等:跨任务的预算感知 LoRA 合并
研究提出 Net Utility,一种无需数据的指标,通过 SVD 分解每个任务的 LoRA,按任务效用及与其他任务方向的干扰为各奇异方向打分,再在总方向数约束下全局择优,实现跨任务的预算感知秩分配。该方法可叠加在五种合并方法、三种合并空间之上,在视觉与语言两组任务上均优于不做秩分配的方案,视觉任务平均提升 +2.1%,语言任务平均提升 +2.2%。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 研究提出 Switch Distillation:中训练阶段知识蒸馏更利于推理而非事实记忆
研究发现前向 KL 蒸馏在 pre-training 阶段同时提升推理与事实记忆,但在 mid-training 阶段会拖慢事实记忆习得,同时推理仍持续提升。作者提出 Switch Distillation,以教师预测熵作为路由信号,仅在教师置信的 token 上蒸馏,其余回退到交叉熵。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 模仿学习能否保持灵巧操作的时间鲁棒性?专家与学习者在不同任务执行速度下的对比
论文在 ParcelStow 接触密集任务中对比脚本专家与基于 ACT 训练的模仿策略在不同加速倍数下的表现,发现两者在名义速度下均为 100% 成功,但在最大演示速度下专家成功率为 84%,ACT 仅 53%,且两种不同参数初始化的 ACT 策略分别下降 34 和 48 个百分点,专家仅下降 16 个百分点。
Rohan Paul@rohanpaul_aiAI 评分5252
DAIR.AI@dair_aiAI 评分4141Hacker News 热门(buzzing.cc 中文翻译)AI 评分7272 Haus Research 审计:Perplexity 三分之一的引用页面并不包含被引数字
Haus Research 对 Perplexity 的 sonar 与 sonar-pro 两个搜索模型提出 310 个关于 210 家科技公司的事实问题,抓取全部 cited URL 核验。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 DramaChain Bench 发布:覆盖短剧生成全流程的端到端基准
DramaChain Bench 是首个评估短剧生产完整链路(剧本、分镜、关键帧、镜头视频到成片)各阶段的基准,包含五条评估轴、63 个叶子维度。基准由 5785 个条目经三名专业标注者独立打分,产生 17,488 个有效评分和 255,925 条可追溯归因记录;人工标注证实上游缺陷会跨阶段级联,最终成片质量并非只由视频生成决定。
Apple Machine Learning Research(RSS)AI 评分2828 Apple 发布 REFACTOR-VLA:无监督学习类型化运动程序库
Apple Machine Learning Research 发布 REFACTOR-VLA 研究,针对 OpenVLA、π0、RT-2、RDT-1B 等当前视觉-语言-动作(VLA)模型生成原始动作的“单体式”结构,提出以无监督方式学习类型化运动程序库的方法。
elvis@omarsar0AI 评分4848Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 研究称三个站点制作了 215,128 个 AI 最佳软件页面并被 Perplexity 引用
Trellner 于 2026 年 9 月 2 日向 perplexity/sonar 和 sonar-pro 询问 380 个软件类目的最佳产品,共 760 次调用,收集到 7,534 条引用,其中 59.8% 指向 Tranco 排名 10 万之后、23.4% 指向完全不在百万名内的域名。
ARC Prize:官方博客精选AI 评分7979 ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
Cohere Labs:官方研究博客精选AI 评分6565 Cohere Labs 发布 ATE 数据集:69.6 万 MCP 工具中仅 2.6% 能完整执行职业任务
Cohere Labs 聚合七个公开目录,构建含 696,291 个工具、123,069 个 MCP 服务器的 Agentic Task Ecosystem 数据集并对外开放。
推荐理由:研究用近 70 万个 MCP 工具构建供给侧数据集,给出自动化落在职业哪个环节的证据,可与曝光度研究互补阅读。
DAIR.AI@dair_aiAI 评分4848
elvis@omarsar0AI 评分4949Artificial Intelligence News(网页)AI 评分3434 Motional 与 MIT 合作研究让自动驾驶汽车实时解释决策
Motional 与 MIT 研究人员构建了一套让自动驾驶汽车实时解释自身决策的系统,旨在解决自动驾驶 AI 的黑箱问题。该成果发表于 Nature,团队包括 Motional CEO Laura Major 与 MIT 计算机科学与人工智能实验室的研究人员。
Rohan Paul@rohanpaul_aiAI 评分4242IT之家(RSS)AI 评分4646 新加坡科技设计大学研究发现老年群体更看重 AI 陪伴聊天机器人的真实感而非拟人化
新加坡科技设计大学研究人员让 140 名 60 至 89 岁老年人与其社交聊天机器人 Ami Chat 互动,研究发表于《老龄化创新》期刊。结果显示,社会关系相关三个指标(拟人化、真实性、AI 社交互动强度)在使用意愿差异中额外解释了 27%;感觉更真实、互动更具回应性时使用意愿更高,但认为机器人更像真人的参与者意愿反而更低;自评健康状况较差者使用意愿更强。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 论文提出用生产流量驱动的后训练将 200+ 内部应用流量整合到单一自托管 LLM
一篇 arXiv 论文提出在数据驻留约束下,将超过 200 个内部应用的流量整合到单个自托管模型,通过生产错误分析沿指令遵循、函数调用和内部任务分布三个轴弥补质量差距。
Dongxi 东锡 NLP@dongxi_nlpAI 评分2020