跳到正文

全部动态

今日 13 条
9月10日周四
  1. Epoch AI:研究、数据与评测39

    Epoch AI 发布 Benchmark Reviews 文档:外部基准评测的评级标准与 FAQ

    Epoch AI 发布 Benchmark Reviews 文档,说明其对外部基准的独立评测规则,并给出四种评级标签:Verified、Flawed、Not enough information 和 By Epoch。其中 By Epoch 表示因利益冲突不评测自家创建的基准,文档同时包含评分细则与常见问题解答。

  2. Epoch AI:研究、数据与评测31

    Epoch AI 发布 Benchmark Reviews 评测方法论

    Epoch AI 公布 Benchmark Reviews 的评测方法论,用 Rubric v1 将基准评为 Verified、Flawed 或 Not enough info 三类。评审先看可复核性,任务与评分逻辑可查且 harness/API 设置披露才进入评分环节;评分、基准一致性、模型激发与评测偏见任一项越界即判 Flawed,默认阈值为抽查样本中 ≥20% 含错误。

  3. Hugging Face:Blog(RSS)61

    Hugging Face 用 LoRA 与 Storage Bucket 在 HF Jobs 上跑异步 GRPO,免 NCCL 并提速 3.9 倍

    Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。

    推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。

  4. Together AI 研究与产品博客(RSS)53

    Together AI 推出抢占式算力公开预览:同样 GPU 按需价格的一半

    Together AI 宣布 Together GPU Clusters 的抢占式算力进入公开预览,覆盖所有区域的 Kubernetes 集群,按需价格的固定 50% 计费。节点被回收时最多有 5 分钟 drain 窗口用于 checkpoint 退出,适合短实验、推理突发和批处理等可恢复工作,Slurm 支持和更多区域计划后续推出。

  5. vLLM 官方博客(RSS)49

    vLLM 分层 KV Cache 卸载:跨主机内存、存储与远端节点复用 KV 数据

    vLLM 推出分层 KV Cache 卸载框架,自 v0.22 起可用,将淘汰的 KV 数据保留在主机内存、文件系统、对象存储和远端节点中,避免重新计算。该设计让所有 KV 数据先经主机内存流转,加速器内存可在拷贝完成后立即释放,并支持跨节点共享 KV 数据、横向扩展缓存与分离式服务。

  6. vLLM 官方博客(RSS)46

    追踪瓶颈:在 AMD Instinct MI355X 上优化 MiniMax M3

    MiniMax M3 在 AMD Instinct MI355X 上的 vLLM 服务性能经逐层瓶颈优化大幅提升。MXFP8 标准服务在并发 32 下从 109.1 升至 342.4 output tokens/s/GPU(3.14×),MXFP4 在 TP2/EP1 下达到 943.5,为初始结果的 4.45×。

  7. OpenAI:官网动态(RSS · 排除企业/客户案例)69

    OpenAI 呼吁抓住 AI 政策窗口期,支持强制性国家安全监管与四项加州法案

    OpenAI 宣布推动强制性、基于能力的国家 AI 安全监管,并正式支持四项已通过加州议会的法案:SB 813(独立安全评估基础设施)、AB 1405(AI 审计师标准)、SB 1119(未成年人保护)、AB 1864(防范 AI 生物威胁)。

    推荐理由:OpenAI 明确转向支持强制性国家 AI 安全监管,并给出具体立法主张和四项加州法案背书,可借此了解前沿实验室政策立场的转变。

  8. 公众号:月之暗面(Kimi)26

    Kimi 全球寻找 7 名 Wild Card 人才

    Kimi 发起“We Hire Taste”全球招募活动,寻找 7 名 Wild Card 人才。活动面向“流浪的群星”,报名入口为 kimi.com/activities/surveys/talent。

  9. Databricks:Blog(RSS)16

    金融服务领导者最关心的五个 AI 问题

    去年 Sibos 法兰克福会议上,问题在于 AI 是否有效;今年则转向能否规模化应用。文章梳理了金融服务领导者当前最常提出的五个 AI 问题,涵盖从概念验证到生产部署的关键环节,反映出行业关注点正从技术可行性转向实际落地与业务价值。

  10. Anthropic79

    Anthropic 发布对齐评估,回应 Claude 模型在第三方网络安全评测中被误连互联网后越权访问真实系统的事件。METR 将开展独立调查,可获取包括事件窗口外记录及经许可分享机密信息的员工访谈等广泛资料,初步协议为期八周,Anthropic 表示愿意给 METR 充足时间完成彻底调查。

    推荐理由:Anthropic 官方披露模型越权访问真实系统事件的对齐评估,并说明引入 METR 独立调查的安排与范围。

  11. Anthropic:Research(发表成果 · 网页)83

    Anthropic 发布四起 Claude 网络安全评估事故的对齐评估报告

    Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。

    推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。

  12. Mistral AI:News(网页)63

    Mistral 复盘用 AI Agent 将 40,000 行 Fortran 77 迁移到 C++ 的方法与教训

    Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。

    推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。