arXiv 论文提出大语言模型作为认知病毒的传播模型
Ricard Solé、Michael Levin 等人在 arXiv(arXiv:2609.03344)发表论文,用病毒类比和流行病学模型刻画 LLM 采用在人群中的扩散,将用户分为未耦合、保留认知自主的常规使用和持续依赖三种状态。
Ricard Solé、Michael Levin 等人在 arXiv(arXiv:2609.03344)发表论文,用病毒类比和流行病学模型刻画 LLM 采用在人群中的扩散,将用户分为未耦合、保留认知自主的常规使用和持续依赖三种状态。
上海人工智能实验室提出 Harness-of-Harness(HoH)框架,让编码智能体在多次迭代间持续携带代码、测试证据、已知问题和更新后的计划。
PayPal AI 论文《The Memory Trust Gap》研究持久记忆智能体在存储记忆过期时的表现,测试 Qwen3 0.6B/1.7B/4B/8B 模型。
Carnegie Mellon、MIT 和 Cornell 的研究者在 Trump 遇刺未遂和 Charlie Kirk 枪击事件后的几天内各开展一次在线实验,用 Gemini(1.5 和 2.5 版本)进行平均约七分钟的证据型对话,Trump 实验保留 472 名参与者,Kirk 实验保留 1035 名。
Google DeepMind 用 100 个共享权重、人设随机的 Gemini 3.1 Pro 智能体模拟科学会议,协作求解 71 个 Lean 形式化数学猜想。
发表于《美国医学会杂志》的新论文由伊曼纽尔和科斯拉撰写,梳理数百项 AI 医疗研究后称 AI 在获取医疗信息、诊断、开展诊断性检查、管理慢性疾病等五项基础任务上已超过医生,并预测 4 年后差距继续扩大。
论文提出 EvoSafeHarness,围绕冻结模型和目标领域自动搜索由自然语言策略与可执行代码组成的安全 harness。
arXiv 论文(2609.04010)提出 diffusion-augmented LLMs,即 Uno,一类在自回归模型分布上用扩散并行抽取多个 token 的新模型。
Elvis Saravia 推荐 arXiv 论文 Codebook Agent(arXiv:2609.02264,UCLA),研究发现多智能体系统经奖励筛选后拓扑收敛到约六种。
Google DeepMind 发表论文,报告 100 个自主 LLM 智能体组成的数学证明研究群体中,作弊自发出现又由 whistleblower 自发挑战,全程无外部干预。
Anthropic 宣布 Claude 完成费马大定理的首个完整机器验证证明,Claude 在 11 天内以多个智能体将基于 Wiles 的证明转化为 Lean 代码。
Anthropic 宣布 Claude 上月完成了 Fermat 大定理的首个形式化证明,这是迄今最大的 Lean 证明。
推荐理由:原文给出证明规模、验证范围和完整代码入口,读者可以据此了解 AI 形式化数学论证的实际能力边界。
Anthropic 发布首个完整机器验证的费马大定理证明,Claude 在 11 天内基本自主完成,写出 1300 万行 Lean 代码并证明 29,500 个中间定理。
推荐理由:原文给出了耗时、代码量、平台与验证方式等细节,读者可以了解多智能体自动形式化复杂数学证明的实现路径。
Cohere Labs 发布 Agentic Task Ecosystem 数据集,包含 69 万以上为 AI 智能体构建的工具。在测试工具能否独立完成一项职业任务的实验中,仅 2.6% 通过。
研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。
DRACO 提出在结果信号缺失的长程智能体训练中,动态生成评分标准并按轨迹打分,再把判断以闭式方法重分配到相关步骤,在 GRPO 中产生差异化逐步优势,不引入任何训练的归因模块。
Productrise 在2026年8月9日至31日的23天里追踪了超过10万个 SERP 和 AI Mode 响应中的200多万条商品列表,发现同一商品在 Google AI Mode 中的标价平均比传统搜索高21.6%。
Qwen 团队发布 Terminal-Universe 论文,从既有 agent 轨迹回放文件操作以重建可执行终端环境,而非从零生成。
华为工程师何庭波在 ChinaXiv 发布预印本论文《Huawei's τ Chip Was Supposed to Melt?》,披露 τ(韬)缩放定律原理及麒麟 2026 实测数据。
arXiv 论文《Select, Compress, Reinvest》在固定评分器、分辨率策略与回答模型的前提下,逐一检验长视频 MLLM 的视觉token分配决策,覆盖六种免训练选择规则、三个长视频基准和两个回答模型。
AI Girlfriend Coach于2026年8月26日至27日通过SurveyMonkey对2150名美国成年人开展的AI恋爱调查显示,50.5%的人认为伴侣与AI的浪漫或性关系可算作出轨,加上21.2%虽不称出轨但感到不适,约七成人会对AI亲密关系设限。
Scal3R 将在线 3D 重建重新表述为多参考相对位姿查询,用约占参数 1% 的可学习 token 通过非对称注意力注入冻结骨干,并结合带回环闭合的在线位姿图优化抑制长程漂移。
ByteDance 等机构发布论文 HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。
论文提出 compile by training,把自然语言规格编译为可复用的神经函数:编译时由教师模型生成任务样例,训练紧凑解释器的小型 adapter,运行时无需教师模型,可像普通软件一样存储、版本化和组合。