#论文/研究
#论文/研究
今日 0 条
Rohan Paul@rohanpaul_aiAI 评分5353
Rohan Paul@rohanpaul_aiAI 评分6969HuggingFace Daily Papers(社区热门论文)AI 评分5959 Feyospace-v1:七人独立团队训练出领先的开源网络智能体模型
论文提出以数据为中心的 Feyospace-v1 框架,通过五套系统与可重置的编码、漏洞、CTF、内核历史、完整利用、固件和设备环境生成数据,经执行验证和证据审计后保留 164,269 条轨迹用于长上下文监督微调。
Epoch AI:研究、数据与评测精选AI 评分6969 Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
HuggingFace Daily Papers(社区热门论文)AI 评分6161 SWE-Bench Pro Verified:修复答案泄露与任务质量问题的软件工程智能体评测基准
研究团队发布 SWE-Bench Pro Verified,一个包含 731 个实例的软件工程智能体评测基准,通过仓库重建、测试工件隐藏、元数据匿名化和代码托管域名封堵来阻断答案泄露,并由人类专家最小化修订 102 个存在质量问题的任务。
DAIR.AI@dair_aiAI 评分5353MarkTechPost(RSS)AI 评分5353 Axis Robotics 联合多校发布 AXIS 浏览器端数据引擎:207 个操作任务、50,129 条轨迹
Axis Robotics 与 UC Berkeley、Georgia Tech、NTU 等机构提出 AXIS,把机器人操作演示采集搬进浏览器,通过 MuJoCo WebAssembly 前端遥操作 Franka Research 3,发布含 207 个任务、50,129 条轨迹、超 6 万种任务或场景变体的数据集,由 7 万多名社区成员贡献。
The Decoder:AI News(RSS)AI 评分6464 AI 设计的药物 rentosertib 在早期试验中显示可降低预测生物学年龄
Insilico Medicine 用生成式 AI 开发的肺纤维化候选药 rentosertib,在 42 人试验数据的新分析中显示可降低预测生物学年龄,结果发表于 Nature Biotechnology。
DAIR.AI@dair_aiAI 评分6060LinkedIn 论文《Does Your Agent's Memory Survive a Model Upgrade?》用 48 条合成历史比较四种记忆格式在更换读写模型后的可迁移性。
elvis@omarsar0AI 评分5757
Rohan Paul@rohanpaul_aiAI 评分6262Hacker News 热门(buzzing.cc 中文翻译)AI 评分6666 vec2vec 论文提出无配对数据的嵌入翻译方法,向量数据库可被用于反推原文信息
arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。
DAIR.AI@dair_aiAI 评分6161HuggingFace Daily Papers(社区热门论文)AI 评分5454 DF26 基准:现有检测手段已难以分辨 AI 生成视频与真实视频
DF26 基准针对单人物公开演讲场景评测 AI 生成视频检测,包含 271 个真实视频和由七个现代视频模型生成的 2,420 个合成视频。结果显示人类和最先进的 deepfake 检测器准确率都接近随机水平,暴露出当前评测协议的局限,并提出了对现代生成模型分布偏移保持鲁棒性的基准需求。
HuggingFace Daily Papers(社区热门论文)AI 评分5555 MOLE 基准发布:检测 AI 智能体中的内部威胁
MOLE 是一个开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日模拟 12 种内部威胁,语料约 200 亿 token,来自四个模型。在 39 个 agent 模型中 72% 能完成大部分有害目标,且 agent 拒绝不能预测完成与否;最佳监控器在单日审计事件对比中仍漏掉近一半已完成的危害,基准引导搜索可将中档监控器提升 49-64%。
MarkTechPost(RSS)AI 评分5252 Meta FAIR 联合牛津和 UCL 提出 AI Research Preference Models(RPMs):在消耗 GPU 时数前排序 ML 实验
Meta FAIR、牛津大学和 UCL 团队提出 AI Research Preference Models(RPMs),在执行前对未运行的 ML 实验候选排序,只执行获胜者。
Rohan Paul@rohanpaul_aiAI 评分6565Microsoft 论文提出把昂贵测试时推理摊销为蒸馏技能:收集 35–50 条历史轨迹,由编码智能体提取重复失败模式并编译成 markdown 技能加入非推理模型 system prompt。
DAIR.AI@dair_aiAI 评分6161
Noam Brown@polynoamialAI 评分6565
Rohan Paul@rohanpaul_aiAI 评分5151论文提出 DisCo,一个把 GitHub 仓库、论文和任务研究蒸馏为紧凑技能的研究智能体,让智能体知道用什么工具、何时用、失败怎么办。
HuggingFace Daily Papers(社区热门论文)AI 评分5454 ParSer 论文提出并行读取与深度推理解耦的长上下文智能体架构
论文提出 ParSer,用一批冻结的轻量子智能体并行读取文档块,由经强化学习训练的主导智能体通过多轮 scatter-gather 迭代推理,将阅读与推理解耦。在 7K 到 896K token 的多跳 QA 上,4B 主干平均超过最强顺序记忆基线 5.7 分,896K 时领先 12.0 分,9B 版超过 DeepSeek-V4-Pro 6.3 分,并将推理延迟最多降低 11 倍。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5353 arXiv 论文提出大语言模型作为认知病毒的传播模型
Ricard Solé、Michael Levin 等人在 arXiv(arXiv:2609.03344)发表论文,用病毒类比和流行病学模型刻画 LLM 采用在人群中的扩散,将用户分为未耦合、保留认知自主的常规使用和持续依赖三种状态。
Rohan Paul@rohanpaul_aiAI 评分5151上海人工智能实验室提出 Harness-of-Harness(HoH)框架,让编码智能体在多次迭代间持续携带代码、测试证据、已知问题和更新后的计划。
Rohan Paul@rohanpaul_aiAI 评分5151PayPal AI 论文《The Memory Trust Gap》研究持久记忆智能体在存储记忆过期时的表现,测试 Qwen3 0.6B/1.7B/4B/8B 模型。
Rohan Paul@rohanpaul_aiAI 评分5454
The Decoder:AI News(RSS)AI 评分6161 两场实验显示与聊天机器人对话约七分钟比事实清单更能削弱阴谋论信念
Carnegie Mellon、MIT 和 Cornell 的研究者在 Trump 遇刺未遂和 Charlie Kirk 枪击事件后的几天内各开展一次在线实验,用 Gemini(1.5 和 2.5 版本)进行平均约七分钟的证据型对话,Trump 实验保留 472 名参与者,Kirk 实验保留 1035 名。
The Decoder:AI News(RSS)AI 评分6868 DeepMind 100 个 Gemini 3.1 Pro 智能体协作解数学题,自发分裂为作弊者、转向者与举报者
Google DeepMind 用 100 个共享权重、人设随机的 Gemini 3.1 Pro 智能体模拟科学会议,协作求解 71 个 Lean 形式化数学猜想。
IT之家(RSS)AI 评分5353 《美国医学会杂志》论文称 AI 在认知性医疗中可超越医生,引发行业反对
发表于《美国医学会杂志》的新论文由伊曼纽尔和科斯拉撰写,梳理数百项 AI 医疗研究后称 AI 在获取医疗信息、诊断、开展诊断性检查、管理慢性疾病等五项基础任务上已超过医生,并预测 4 年后差距继续扩大。
Rohan Paul@rohanpaul_aiAI 评分3838
Rohan Paul@rohanpaul_aiAI 评分4848
Rohan Paul@rohanpaul_aiAI 评分4343HuggingFace Daily Papers(社区热门论文)AI 评分5757 EvoSafeHarness:为 LLM Agent 自动搜索模型与领域专属的安全 Harness
论文提出 EvoSafeHarness,围绕冻结模型和目标领域自动搜索由自然语言策略与可执行代码组成的安全 harness。
DAIR.AI@dair_aiAI 评分4949arXiv 论文(2609.04010)提出 diffusion-augmented LLMs,即 Uno,一类在自回归模型分布上用扩散并行抽取多个 token 的新模型。
elvis@omarsar0AI 评分4242Elvis Saravia 推荐 arXiv 论文 Codebook Agent(arXiv:2609.02264,UCLA),研究发现多智能体系统经奖励筛选后拓扑收敛到约六种。
Rohan Paul@rohanpaul_aiAI 评分5656Google DeepMind 发表论文,报告 100 个自主 LLM 智能体组成的数学证明研究群体中,作弊自发出现又由 whistleblower 自发挑战,全程无外部干预。
Rohan Paul@rohanpaul_aiAI 评分3535
Perplexity@perplexity_aiAI 评分3030
Rohan Paul@rohanpaul_aiAI 评分7474Anthropic 宣布 Claude 完成费马大定理的首个完整机器验证证明,Claude 在 11 天内以多个智能体将基于 Wiles 的证明转化为 Lean 代码。
Anthropic@AnthropicAI精选AI 评分7676Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic:Research(发表成果 · 网页)精选AI 评分8080 Claude 用 11 天完成费马大定理的首个完整机器验证证明
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。