跳到正文

#部署/工程

今日 12 条
9月13日周日
9月12日周六
  1. Simon Willison 博客60

    Simon Willison 介绍使用 OpenRouter 的供应商路由陷阱与对策

    Simon Willison 转述 Mohamed Moustafa 对 OpenRouter 自动路由的问题分析。不同供应商的推理软件、优化设置不同,同一端点可能行为不一致,部分供应商的视觉模型缺少视觉能力,reasoning effort 参数的处理方式也有差异。可用 provider.only 指定供应商,并通过 /endpoints 方法查询某模型可用供应商列表。

  2. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)61

    OpenAI 详解存储平台 Habitat 如何扩展支撑超 10 亿 ChatGPT 用户(上篇)

    OpenAI 发文(系列上篇)讲述其在线存储平台 Habitat 的演进:现每秒处理超 7000 万请求、服务每周超 10 亿用户、管理超 500PB 数据,覆盖近 40 个地区。

    推荐理由:原文披露了 Habitat 从 Python 库到 Rust 服务的完整演进细节,含 asyncio 调优、连接池等可迁移经验。

  4. Dwarkesh Patel:Podcast & Blog(RSS)67

    Beren Millidge、John Schulman、Charlie O'Neill 对谈递归自我改进离我们还有多远

    Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。

    推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。

9月11日周五
  1. OpenRouter:Announcements(RSS)67

    OpenRouter 发布 Fusion 复合模型,让多个模型辩论后合成最终答案

    OpenRouter 发布 Fusion 复合推理系统,将一个提示词并行发给 1 到 8 个面板模型,由 judge 比较共识与分歧后由调用模型写出最终答案。默认三模型面板成本约为单次完成的四到五倍、延迟两到三倍,在 DRACO 深度研究基准上预算面板得 64.7%、前沿面板得 69.0%。

    推荐理由:官方详解 Fusion 的多模型辩论机制、四到五倍成本与两到三倍延迟,并给出适用与不适用的具体场景。

  2. Hacker News 热门(buzzing.cc 中文翻译)73

    Google 将在芬兰投资 130 亿欧元并购买 Loviisa 核电站一半电力

    Google 宣布在芬兰进行 130 亿欧元投资,为其在欧洲最大单笔投资,将购买 Loviisa 核电站最多 50% 的电力输出,与 Fortum 签订 22 年合同。资金用于在 Kajaani、Muhos 和 Vaala 新建三座数据中心并扩建 Hamina 现有设施,以支撑 Gemini、Search 等服务的 AI 算力需求,建设计划在 2027 至 2028 年进行。

  3. IT之家(RSS)64

    消息称微软计划到 2032 年将数据中心容量提升至 38GW,为当前 12GW 的三倍有余

    彭博社援引消息人士报道称,微软计划到 2032 年持有 38GW 数据中心容量,是当前 12GW 的三倍以上,也将超出纽约州当前高峰时段用电量。目前 12GW 中仅 2GW 用于 AI 专用芯片,到 2032 年约 1/3 算力(12~13GW)将服务 AI 芯片;算力缺乏已导致 Azure 将部分订单送给竞争对手,该计划仍可能因客户偏好变化和新技术出现而调整。

  4. IT之家(RSS)75

    OpenAI Agents API 开放公测:支持代码执行、工具调用和跨上下文长任务

    OpenAI 于 9 月 10 日推出 Agents API 公测版,开发者可一次 API 调用创建云端 AI 智能体,复用 Codex 背后的执行框架。智能体支持运行代码、处理文件、跨上下文窗口执行数小时甚至数天的任务、多智能体并行协作,沙盒可选 OpenAI 托管或 Blaxel、Cloudflare、E2B、Vercel 等合作方环境。

  5. Together AI 研究与产品博客(RSS)63

    Together AI 扩展微调服务:新增模型、实验跟踪与更细训练控制

    Together AI 扩展 Together Fine-Tuning 服务,新增对 GLM-5.3、Kimi K2.7、Qwen 3.5 系列等最新开源权重模型的支持,并上线实时实验跟踪、数据集预览验证等能力。

    推荐理由:原文给出新模型支持、Expert LoRA 实测对比、自动早停和降价幅度等具体细节,读者可据此评估微调工作流的实际改进。

  6. Baseten 工程博客(网页)52

    Blaxel 并入 Baseten,共建智能体云基础设施

    Blaxel 宣布并入 Baseten,目标是在一个平台上同时提供模型训练、推理和长时间运行的智能体执行能力。Blaxel 此前构建了智能体所需的沙箱、Agent Drive 分布式文件系统和网络连接层,其中沙箱可在 25 毫秒内挂起和恢复,空闲时接近零成本;Baseten 的推理栈已在数十个地区规模化运行。

9月10日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)57

    OpenAI 与美国 GSA 达成 OneGov 协议,向各级政府提供免费授权与 5 折用量优惠

    OpenAI 与美国 GSA 宣布多年期协议,为联邦、州、地方和部落政府提供原本 $15 每用户每月的许可费降至 $0、用量 5 折优惠,覆盖约 2300 万公共部门员工。协议期 27 个月(2026年10月1日至2028年12月31日),所有经核验的政府实体还可获批 5 折的 Daybreak Blue 网络防御访问及配套培训。

  2. Hacker News 热门(buzzing.cc 中文翻译)81

    Shopify 宣布从 React Native 全面迁回 Swift 和 Kotlin 原生开发

    Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。

    推荐理由:当事方完整披露迁移理由、开源库去向和 Helix 工作流,读者可以据此评估编码智能体对跨平台技术选型的影响。

  3. OpenRouter66

    OpenRouter 推出新的有状态服务端工具 Shell,任何 OpenRouter 上的模型都可以在托管的 Linux 容器中运行命令。该功能今日起以 beta 形式提供,代号为 `openrouter:shell`,同时新增 Files API 用于在容器内外传输文件。

    推荐理由:OpenRouter 官方介绍新 Shell 工具和 Files API 的能力与开放方式,模型调用方可以据此判断如何接入有状态命令执行。

  4. IT之家(RSS)59

    DeepSeek V4.1 Flash 模型上线国家超算互联网

    DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。

  5. Mistral AI:News(网页)55

    Mistral AI 与 Cloudera 达成合作,提供主权企业AI解决方案

    Mistral AI 宣布与数据平台公司 Cloudera 建立合作伙伴关系。双方将把 Mistral 的模型集成到 Cloudera 的混合数据平台中,允许企业在私有云、公有云、本地甚至完全隔离的环境中运行推理。此外,Mistral 还将支持企业利用其专有数据在受控环境中训练定制模型,旨在满足金融、制造等受监管行业对“主权AI”的需求,确保数据、智能和计算完全由客户控制。

  6. Hugging Face:Blog(RSS)65

    Hugging Face 用 Gradio Workflow 重建 Workflow1111,复刻 AUTOMATIC1111 主要功能

    Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。

    推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。

  7. MarkTechPost(RSS)87

    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

    推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。

  8. IT之家(RSS)59

    成都 AI 系统治理龟速车,覆盖城区快速路及绕城高速,试行路段慢车降约 20%

    成都交警去年上线的治理龟速车 AI 智慧系统近期在城区所有快速路及绕城高速完成部署。系统整合 ETC、卫星定位与视频感知数据识别超低速行驶车辆,通过 LED 屏提示,并核查驾车打电话等违法行为;自 2025 年 4 月试运行以来累计发布 LED 提示 3.1 万余次,监测路段龟速车数量同比下降约 20%。报道还提到成都一社区为独居老人安装毫米波雷达跌倒检测器,累计处置预警 66 条。