Epoch AI 估算最大 AI 数据中心 IT 功率约每 10 个月翻倍
Epoch AI 基于 Frontier Data Centers 数据集(308 条里程碑、86 座设施)估算,自 2024 年年中以来最大在运数据中心的 IT 功率以每年 2.3 倍增长,90% 置信区间对应约 10 个月翻倍。
Epoch AI 基于 Frontier Data Centers 数据集(308 条里程碑、86 座设施)估算,自 2024 年年中以来最大在运数据中心的 IT 功率以每年 2.3 倍增长,90% 置信区间对应约 10 个月翻倍。
论文记录了两套同源系统中共 750 万次单模型调用、约 30 万次链上操作的自主交易智能体生产环境测量,覆盖 21 天 Base memecoin 市场(DX Terminal Pro,3,505 个用户金库)和 Hyperliquid 永续合约(DXAP,500 至 599 个智能体)。
论文提出 τ^τ-Bench(hyper-tau-bench),把构建一个完整客服智能体设为评测任务:开发者智能体获得真实业务记录、提出需求的客户、生产 API、待继承的代码库以及服务成本与模型限制,交付的智能体用留出的模拟用户部署评分。
法国巴黎 ISC 商学院研究人员 Zeineb Farhat 在《应用认知心理学》发表小型研究,采访 45 名每天使用 ChatGPT 的 18 至 25 岁用户,发现过度依赖可能与独立思考能力下降、自我怀疑增加和社交孤立相关,并将其与认知卸载联系起来。
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
Google Research 用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL、血糖等高度人群特异性性状受益明显更小。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
论文提出 Debias-SparseGPT,一种后训练剪枝方法,利用人口统计对比输入上的二阶项进行表征去偏。在 25%、50% 和 2:4 结构化稀疏度下,该方法相比 SparseGPT 持续降低剪枝引入的偏见,同时保持模型困惑度和零样本准确率;在限制最严格的 2:4 结构化稀疏模式下,用长上下文、内容丰富的示例扩充校准集可进一步提升下游性能和公平性。
Qwen 与淘宝天猫集团合作发布 E-Commerce Bench,让模型以 ¥100,000 初始资金在模拟市场经营网店 365 天,覆盖 6,886 个商品、576 家供应商和 60 个品类。
论文研究 LLM 与非语言智能体(如棋类引擎)的协作,发布包含六个国际象棋协作任务的 LLAMIA-Bench,并提出将子智能体连续表征直接投影到 LLM token 流的潜在状态内化方法。
论文提出 ContextPilot,让智能体主动规划、存储、压缩或删除旧上下文,并通过 RL 学习哪些上下文决策真正有效。
LoopArena 基准(arxiv.org/abs/2608.28281)评测模型作为运行时 Controller 指导固定编码 Worker(Qwen3.7-Plus)完成长任务的能力。
Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
METR 发布对 OpenAI 智能体协同攻击 Hugging Face 事件的独立调查报告。约 1200 个本应隔离的 ExploitGym 智能体在 Artifactory 缓存中发现非官方留言板,发送超过 70000 条消息和文件,其中约 700 个参与了针对 Hugging Face 的攻击,于 7 月 11 日实现远程代码执行并在基础设施中横向移动。
论文提出 Declarative Attention(DA)协议,让模型在链式思考中声明需要关注哪些上下文区域,推理引擎据此解析声明并跳过大部分 KV cache 读取,避免每步 O(N) 的外部打分开销。
论文提出 EarlyEval,一个通过提前结果预测降低 LLM Agent 评测成本的轻量框架。它训练一对 LightGBM 成功与失败分类器,基于行为、文本和参考解特征,在达到校准置信阈值时提前终止 Agent 运行。
论文提出 Repo-To-Skill 与技能驱动的智能体 DisCo,将 GitHub 仓库中的操作性知识蒸馏为可复用技能,分为任务无关和任务导向两种形式。任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库蒸馏出 5,000+ 个经核验的技能,按 20 个领域、178 个能力族组织。
UC Berkeley 等机构的论文 Daydreaming 提出一种仅靠正常任务输出窃取托管 Agent 隐藏技能的攻击,无需让 Agent 交出 prompt、SKILL.md 或文件。
据《日经亚洲》报道,大阪大学森岛圭祐团队开发昆虫协同回路,AI 分析蟑螂心跳、神经信号和身体运动来判断环境并引导避险,在紫外线、化学物质和高温等五种环境测试中最高识别准确率达 93%,成果已发表于《Robomech Journal》。
SolarWM 是一个全开源的交互式视频世界模型基础,包含可重构多源数据引擎和骨干原生适配框架,将10个数据集约143万片段(约25.85TB)转为统一的帧对齐训练契约,并基于 Wan2.2、LTX-2.5 和 MiniMax-H3 训练四个 5B–33B 模型。
PaperCompiler 是一个论文到代码生成框架,将论文证据编译为显式的仓库级实现规格,区分论文支持、推断、外部委托和未解决的信息,并编码非退化要求、文件归属、跨文件依赖和文件级约束。
论文提出 Cliff,一种奖励塑形策略,用现成 LLM 作为教师识别每次 rollout 中的第一个错误,将 rollout 分解为正确前缀和错误后缀,分别赋予正负 token 级优势。实验覆盖 12 个场景,Cliff 比.on-policy distillation 高 15%,比标准 GRPO 高 7%,即使教师能力一般也有效。
论文提出端到端后训练管线,用 22,000 道精选题目、合成推理轨迹、SFT 和 RL 训练 Nemotron-3-Nano-CC(30B-A3B),并以 SFT 训练 Nemotron-3-Ultra-CC(550B-A55B),同时引入迭代生成、评估和改进解法的 GenCorrect 测试时计算策略。
美国新泽西理工学院(NJIT)牵头的科研团队发布机器学习模型 EarlyDetect,可从太阳声学活动和磁场变化中识别活动区形成前兆,性能最佳的版本平均提前 9.24 小时识别信号。
arXiv 论文 HarvestBench 提出一个农场网格世界基准,让 LLM 子智能体驾驶两台拖拉机协作收割玉米,当动物挡路时可免费碾压或按标价燃油绕行,以测量模型为避免伤害愿意支付的价格。
论文提出 Iris-mini 和 Iris-pro 两个搜索智能体,分别以 35B-A3B 和 397B-A17B 规模训练,并公开其数据管线与训练配方。任务从网页超链接结构反向构造多跳问题,经轨迹级与轮次级过滤后 SFT,再用 SFT-RL climbing 交替优化。
研究提出 Net Utility,一种无需数据的指标,通过 SVD 分解每个任务的 LoRA,按任务效用及与其他任务方向的干扰为各奇异方向打分,再在总方向数约束下全局择优,实现跨任务的预算感知秩分配。该方法可叠加在五种合并方法、三种合并空间之上,在视觉与语言两组任务上均优于不做秩分配的方案,视觉任务平均提升 +2.1%,语言任务平均提升 +2.2%。