跳到正文

#部署/工程

今日 12 条
9月10日周四
  1. Hugging Face:Blog(RSS)61

    Hugging Face 用 LoRA 与 Storage Bucket 在 HF Jobs 上跑异步 GRPO,免 NCCL 并提速 3.9 倍

    Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。

    推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。

  2. Together AI 研究与产品博客(RSS)53

    Together AI 推出抢占式算力公开预览:同样 GPU 按需价格的一半

    Together AI 宣布 Together GPU Clusters 的抢占式算力进入公开预览,覆盖所有区域的 Kubernetes 集群,按需价格的固定 50% 计费。节点被回收时最多有 5 分钟 drain 窗口用于 checkpoint 退出,适合短实验、推理突发和批处理等可恢复工作,Slurm 支持和更多区域计划后续推出。

9月9日周三
  1. OpenRouter:Announcements(RSS)73

    OpenRouter 推出 shell 沙箱工具与 Files API,任何模型可在托管 Linux 容器中执行命令

    OpenRouter 发布 openrouter:shell 服务端工具和 Files API,OpenRouter 上任何支持工具调用的模型都可在托管 Linux 容器中运行命令,两者现已在 beta 阶段开放。

    推荐理由:原文给出定价、容器网络策略和文件生命周期等落地细节,读者可以据此评估在自己的 Agent 工作流中怎么用这套沙箱。

  2. OpenRouter:Announcements(RSS)62

    OpenRouter 推出美国区域路由,与去年上线的 EU 路由配套保障数据驻留

    OpenRouter 推出 US In-Region Routing,请求经 us.openrouter.ai 在美国境内解密并只路由到美国 provider 端点,eu.openrouter.ai 同理服务欧盟。

    推荐理由:原文区分了端到端与仅推理的区域路由,并给出具体接入方式,读者可以据此评估各家网关的数据驻留承诺。

  3. Artificial Intelligence News(网页)55

    三星与 Mistral AI 合作将模型部署于半导体制造并领投其 D 轮融资

    三星与 Mistral AI 达成合作,将在半导体制造与工程业务中部署本地化模型,包括旗舰 Mistral Large,用于自动缺陷检测和工厂设备调优。模型部署在三星内部计算环境以保护敏感工程数据,覆盖存储、逻辑设计和代工业务;三星还领投了 Mistral AI 的 Series D 融资以获得战略股权。该协议在巴黎举行的韩法双边峰会上公布。

  4. IT之家(RSS)62

    谷歌计划在芬兰投入至少 130 亿欧元建设 AI 数据中心,为在欧洲最大单笔投资

    谷歌宣布将在芬兰投入至少 130 亿欧元建设 AI 基础设施,为公司迄今在欧洲最大单笔投资,未来两年至少新建 3 座数据中心并扩建哈米纳现有数据中心。新数据中心位于卡亚尼、穆奥斯和瓦拉,依托当地寒冷气候、无碳能源和电网条件,具备余热回收能力;Fortum 与谷歌签署 22 年购电协议,2030 年至 2049 年采购洛维萨核电站总发电能力的 50%。

  5. Claude:Blog(网页)67

    Anthropic 发布 Claude Platform 降本指南并更新 claude-api 技能

    Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。

    推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。

  6. Tianyi Cui52

    DeepSeek 针对约 150 个资深后端/服务端工程师社招岗位重新设计了笔试和面试。笔试删除 ACM 类代码题改为系统设计题,算法题只需写思路或伪代码,面试流程时间跨度大幅缩短;校招仍沿用原有题目。岗位涵盖大模型研究平台、Agent 框架组件、DeepSeek API 等方向,工作地点北京(优先)或杭州,简历可投 talent@deepseek.com 或扫码投递。

9月8日周二
  1. IT之家(RSS)52

    英特尔 High-NA EUV 晶圆处理量突破 100 万片,超越其他厂商总和

    英特尔宣布其 High-NA EUV 设备累计处理的 300mm 晶圆突破 100 万片,距首台设备完成组装不到两年半,处理量已超过行业其他用户总和。该技术已用于 Intel 18A 工艺并量产 Panther Lake 酷睿 Ultra 处理器,目前仍受 6×6 英寸光罩尺寸限制,英特尔正推动行业转向 6×12 英寸光罩以实现 26×33mm 完整视场。

  2. Epoch AI:研究、数据与评测69

    Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异

    Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。

    推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。

  3. vLLM 官方博客(RSS)63

    vLLM x AgentX:面向真实世界智能体推理服务的全栈优化

    vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。

    推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。

  4. Simon Willison 博客61

    kernel.org 运维者谈滥用爬虫:14 个 CPU 核心专为爬虫渲染 git 提交页面

    Simon Willison 转述 Konstantin Ryabitsev 的观察:git.kernel.org 为应付滥用爬虫的“背景辐射”,在 5 个地理分布节点上常年有 14 个 CPU 核心专门把 git 提交渲染成 HTML,CPU 开销超过包括 git clone 在内的所有合法访问。Willison 担忧这对提供大量可爬网页的 Datasette 也有影响。