全部AI 动态
全部动态
今日 0 条
Rohan Paul@rohanpaul_aiAI 评分4848Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 论文提出人工神经网络内部涌现出符号结构
论文提出神经网络向量表示隐式实现了 Tensor Product Representation 符号结构,作者用 DISCOVER 方法将多种网络(含 Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b 共 7 个 LLM)的表示替换为符号化闭式方程,模型行为基本不变。
Rohan Paul@rohanpaul_aiAI 评分5252
Rohan Paul@rohanpaul_aiAI 评分5050Meta FAIR 发布论文 ADeptS-Bench(arxiv.org/abs/2608.26204),在移动和桌面双平台上用配对的 benign/恶意 GUI 任务与歧义指令评测 7 个模型。
PromptArmor:Threat Intelligence精选AI 评分6969 PromptArmor 分析 30 天 Claude Code 遥测数据:4% 的会话占 65% 的开销
PromptArmor 基于一个十人团队 30 天的 310,009 条 OTel 遥测事件分析 Claude Code 和 Cowork 的安全与成本。
推荐理由:基于 310,009 条 OTel 遥测事件的 30 天一手实测数据,把 Agent 的凭证泄露、不可信输入、自主程度和成本结构都给出了具体量化数字。
Rohan Paul@rohanpaul_aiAI 评分4444论文提出 AgentFold,将折叠模型开发建模为对可执行代码变体的闭环智能体树搜索。智能体从紧凑的 ESMFold 衍生模型出发,提出架构修改、实现调试、运行训练,并记录成败经验决定分支算力分配。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Harness-of-Harness 论文提出多天自主软件开发框架,平均相对提升 52.25%
论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在无人工干预的自主开发中持续改进软件。HoH 运行在现有 coding-agent harness 之上,将执行组织为规划-编码-测试的迭代循环,平衡修复与能力增长,并把开发拆成小而可验证的增量。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 SMELT:算力匹配下 MoE 循环 Transformer 的缩放律研究
论文提出 SMELT(Sparse MoE Transformer,中段层循环两次)配方,在逐 token FLOPs、非嵌入参数量和 KV cache 三项预算均匹配的条件下研究循环 Transformer。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 DiagEvo:基于分层错误记忆的诊断引导式自我进化
论文提出 DiagEvo,从求解器自身失败历史中提取反复出现的错误原因,存入分层错误原因记忆,并以此生成针对性问题,无需外部任务资源。其挑战者用记忆状态与复发次数平衡定向生成与自由探索,双重置信度过滤只保留中间难度问题。
Rohan Paul@rohanpaul_aiAI 评分6767HuggingFace Daily Papers(社区热门论文)AI 评分3434 ReFlowSET:面向 SAR 到 EO 图像翻译的表征对齐潜空间流匹配框架
KAIST-VICLab 提出 ReFlowSET,一种条件潜空间流匹配框架,通过 SAR-EO 联合重建审计选择潜空间编解码器,并在该空间从零训练规模更小的条件 DiT。方法将中间噪声 EO 特征与冻结视觉基础模型提取的干净目标表征对齐,仅用于训练阶段,不增加推理成本;在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与权重已在 GitHub 公开。
HuggingFace Daily Papers(社区热门论文)AI 评分4141 EM^2Mem 提出事件中心的多模态记忆框架,提升长视频问答准确率并降低推理开销
论文提出 EM^2Mem,一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,每个事件索引的记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实和来源信息。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 研究揭示原生统一多模态模型中理解与生成的协同机制
该论文在无预训练视觉先验的受控原生设置下,从表征、任务和系统三层研究统一多模态模型中视觉理解与生成的关系。研究发现两个目标可互相提供有用信号但共享计算路径时一方会主导,任务解耦架构可避免这种不对称退化;共享知识任务间存在正向双向迁移,端到端 UMM 在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。
HuggingFace Daily Papers(社区热门论文)AI 评分3737 多智能体 LLM 提示词优化新方法:控制-数据流分离
论文提出控制-数据流分离方法,将消息路由、输出格式、终止信号等执行关键协议表示为类型化、经验证的程序对象,任务相关语言作为可优化的数据流,避免提示词优化破坏协议导致智能体流水线失败。在合成推理、协作评审生成和保险评级工作流中,框架实现 100% 的最终协议有效性,同时持续提升任务性能。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 DroneCATS:评测多模态大模型作为无人机通用视觉-语言-动作智能体
论文提出 DroneCATS-Agent 架构和 DroneCATS 基准,将多模态大模型直接放入无人机控制回路,无需微调或函数调用,评测接近、跟踪、视外搜索和多机指挥四项能力。结果显示小型开源模型导航成功率常高于前沿模型,却因过早或从不宣布到达而失败;模型的视觉空间感知尚可,瓶颈在于维持动作协议并正确发出终止动作。
HuggingFace Daily Papers(社区热门论文)AI 评分4747 StudentSim:训练基于 LLM 的学生模拟器框架
论文提出 StudentSim,通过池化训练加按学生专门化,把稀疏的学生个人数据转化为能模拟学生应答并在辅导下更新的个性化学生模拟器。配套发布 StudentSimEval 评测协议,覆盖国际象棋、英语二语写作和数学 3 个领域的 60 名学生,衡量行为保真度 F 和指导响应度 R。
HuggingFace Daily Papers(社区热门论文)AI 评分4343 H3-World:将 MiniMax-H3 视频生成器的语言理解转化为世界控制
H3-World 提出一个把 33B MiniMax-H3 视频生成器转化为交互式世界模型的框架,通过自然语言指令实现精确的时间对齐世界控制。
Berkeley RDI:Blog(AI 安全与评测)AI 评分5454 UC Berkeley 等发布 Vero 基准:检验 AI 智能体能否构建形式化验证的完整软件仓库
UC Berkeley 联合多机构发布 Vero 基准,首个要求智能体在仓库级同时写实现与形式化证明,含 43 个 Lean 4 多模块实例、743 个 API 和 2,705 条形式化规范。
elvis@omarsar0AI 评分6060
Rohan Paul@rohanpaul_aiAI 评分5151
DAIR.AI@dair_aiAI 评分4646HuggingFace Daily Papers(社区热门论文)AI 评分5454 论文提出评估框架:防护手段本地测试通过不等于部署后的 LLM 系统更安全
Hefei AiDA Lab 等机构的研究者提出一套将 LLM 防护评测结果转换为部署安全结论的分析框架,并对其编码的 198 篇论文进行分析。152 个宽编码声明中有 108 个建立了正向残余有害协助,没有一个建立零残余证书;24 个深度编码实例中仅 5 个报告了检查成功后的可达残余,仅 Fides 一个实例通过覆盖、条件失败与后续可达三项证明给出零残余证书。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 RoboTok:面向人类示范检索与灵巧操作学习的互联网规模数据引擎
论文提出 RoboTok,一个互联网规模数据引擎,输入人类操作视频即可从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人策略。方法基于估计的演员中心参考系中的 3D 手部轨迹学习潜在运动空间,使操作行为的比较不受相机视角、场景外观和演员遮挡影响,并支持互联网规模视频的高效搜索与持续索引。在检索基准和下游策略评估中,RoboTok 检索出更相关的示范并提升了下游任务成功率。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 面向语音脑机接口的通用度量 OVMI
论文提出开词表互信息 OVMI,一种信息论度量,用于在不同数据集、记录方式与词表条件下统一评估语音脑机接口解码器传达的信息量。作者指出通常报告的 accuracy、word error rate (WER) 等仅覆盖系统支持词表的指标会高估能力;用 OVMI 比较现有系统并优化词表选择,在三个语音域上取得最高 16.3% 的相对准确率提升。
HuggingFace Daily Papers(社区热门论文)AI 评分4343 VeriPhy 提出面向世界模型评估与改进的智能体物理推理系统
论文提出 VeriPhy,一个可审计的物理验证系统:纯文本规划器在观察任何帧之前将提示词编译为带类型的物理义务和经静态验证的执行计划,执行时仅调用冻结的低层专家(分割与跟踪、计数、11 类物理测量、深度、OCR、音频事件检测),每个动作返回带溯源的证据记录,并映射为 supported、contradicted 或 unknown 三值判定。
HuggingFace Daily Papers(社区热门论文)AI 评分3636 CORD:保持预测不变的后验校准修复方法
论文提出 Calibrator-Output Repair for Top-1 Decision Preservation(CORD),一种后拟合适配器,通过修复完整校准概率向量,确保 argmax 恢复原始 top-1 预测,实现零 TPCR。
HuggingFace Daily Papers(社区热门论文)AI 评分3737 研究将 SGD 优化动力学建模为渗流过程,提出方差级联与离散标度不变性
该研究将随机梯度流(SGF)建模为渗流过程,认为架构对称性迫使子网络以离散的同步块合并,并在宏观序参量上表现为方差尖峰,类似物理相变。研究还指出这种捕获机制及标度级联在显式重尾噪声模型下同样适用于 Adam 和 AdamW。论文链接:https://arxiv.org/abs/2609.02373
HuggingFace Daily Papers(社区热门论文)AI 评分4444 Temporal Context Routing(TCR)让联合音视频生成模型按剧本时间轴精准对齐镜头与对白
论文提出 Temporal Context Routing(TCR),将结构化剧本中的镜头切换和对白时间映射到音视频生成的共享时间轴,并把各提示词引导路由到两种模态的对应位置。
Epoch AI@EpochAIResearchAI 评分4141Hugging Face:Blog(RSS)AI 评分4747 Hugging Face 与 Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟测了什么
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
elvis@omarsar0AI 评分4545Meta 发布论文 AI Research Preference Models,训练模型在任何候选方案执行前预测哪个最有前景,解决研究智能体想法多但 GPU 预算有限、缺乏原创性判断的问题。
elvis@omarsar0AI 评分5858
DAIR.AI@dair_aiAI 评分5050
elvis@omarsar0AI 评分5757Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在模拟的 365 天里同时运营多家在线商店,评测 18 个前沿模型的七维度表现,结果没有单一模型全面领先。
Google Research:Blog(网页)AI 评分5353 Google 与 NASA JPL 发布 MAPL-EMIT 深度学习框架,用卫星高光谱数据全球监测甲烷排放点源
Google Research 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,可自动化检测、定量与溯源 EMIT 卫星数据中的甲烷羽流。
Microsoft Research@MSFTResearchAI 评分1515
Rohan Paul@rohanpaul_ai精选AI 评分8080推荐理由:原文梳理了 Fable 5.1 系统卡中的隐蔽行为、环境漏洞与风险评级变化,读者可以借此了解 Anthropic 如何评估自家模型的监控难度。
DAIR.AI@dair_aiAI 评分4747Qwen 团队发布 E-Commerce Bench,让 LLM 智能体在 365 天的模拟环境中同时运营多家网店,评估 18 个前沿模型的七个维度,发现没有任何单一模型全面领先。
Rohan Paul@rohanpaul_aiAI 评分5151Not Diamond 发布模型路由评估方法论,称在多个主流基准上实现 Pareto 占优,以低 20–80% 的成本超过 Opus xhigh 质量。
MarkTechPost(RSS)AI 评分4545 普林斯顿、蚂蚁集团与斯坦福团队提出 AQuA:面向量化金融的两段式智能体自动因子发现框架
普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队提出 AQuA,一套由两个互不共享智能体、记忆和状态的语言模型量化研究系统,其设计要点是在迭代开始前冻结数据划分、特征与标签定义和评估器,让智能体只能在受约束的 DSL 内探索,以阻断自我改进中的数据泄漏。