vLLM 优化 Kimi K3 服务性能:吞吐提升 2.2–2.8 倍
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
Fireworks 发布 2026 年开源 LLM 选型指南,覆盖 GLM 5.2、Kimi K3、Kimi K2.7 Code、DeepSeek-V4-Pro/Flash、MiniMax M3、Qwen3.7 Plus、gpt-oss-120b 和 Gemma 4 31B IT 九款模型。
开发者 kennethwolters 发布开源项目 litelm,将 litellm 的模型路由、消息翻译、流式输出、tool use、嵌入等核心调用路径抽取为约 2900 行、仅依赖 openai 和 httpx 的精简库。
OpenAI 发文介绍其在线存储平台 Habitat 从 Python 迁移至 Rust 的过程,该平台每秒处理超 7000 万次请求、每周服务超 10 亿用户、管理数据超 500PB。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
Simon Willison 转述 Mohamed Moustafa 对 OpenRouter 自动路由的问题分析。不同供应商的推理软件、优化设置不同,同一端点可能行为不一致,部分供应商的视觉模型缺少视觉能力,reasoning effort 参数的处理方式也有差异。可用 provider.only 指定供应商,并通过 /endpoints 方法查询某模型可用供应商列表。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
Canary Media 报道 xAI 在孟菲斯数据中心建成大规模电池储能,已通过 MLGW 的 power interruption 计划获批并网,可支撑数据中心脱离电网四小时削峰。
OpenAI 发文(系列上篇)讲述其在线存储平台 Habitat 的演进:现每秒处理超 7000 万请求、服务每周超 10 亿用户、管理超 500PB 数据,覆盖近 40 个地区。
推荐理由:原文披露了 Habitat 从 Python 库到 Rust 服务的完整演进细节,含 asyncio 调优、连接池等可迁移经验。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。
推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。
OpenRouter 发布 Fusion 复合推理系统,将一个提示词并行发给 1 到 8 个面板模型,由 judge 比较共识与分歧后由调用模型写出最终答案。默认三模型面板成本约为单次完成的四到五倍、延迟两到三倍,在 DRACO 深度研究基准上预算面板得 64.7%、前沿面板得 69.0%。
推荐理由:官方详解 Fusion 的多模型辩论机制、四到五倍成本与两到三倍延迟,并给出适用与不适用的具体场景。
作者用同一台 M4 MacBook Pro(24GB)和 llama.cpp 服务 Qwen 3.8 27B,对 9 套编程线束跑 8 道 Exercism 题目实测。
Sakana AI 发布 Fugu 系列两款新模型 Fugu Max 和 Fugu Ultra v2,通过单一 OpenAI 兼容 API 在多个模型间路由任务。
OpenRouter 发布 Presets 使用教程,preset 是一个命名且带版本的配置,统一存放模型或 fallback 列表、system prompt、provider 路由和采样参数,在任何请求中以 "model": "@preset/名称" 引用。
一项名为 Detokenization Leaks 的研究提出新攻击,通过观察本地部署 LLM 去分词时的 CPU 缓存活动重建生成文本,无需读取模型内存。
Google 宣布在芬兰进行 130 亿欧元投资,为其在欧洲最大单笔投资,将购买 Loviisa 核电站最多 50% 的电力输出,与 Fortum 签订 22 年合同。资金用于在 Kajaani、Muhos 和 Vaala 新建三座数据中心并扩建 Hamina 现有设施,以支撑 Gemini、Search 等服务的 AI 算力需求,建设计划在 2027 至 2028 年进行。
彭博社援引消息人士报道称,微软计划到 2032 年持有 38GW 数据中心容量,是当前 12GW 的三倍以上,也将超出纽约州当前高峰时段用电量。目前 12GW 中仅 2GW 用于 AI 专用芯片,到 2032 年约 1/3 算力(12~13GW)将服务 AI 芯片;算力缺乏已导致 Azure 将部分订单送给竞争对手,该计划仍可能因客户偏好变化和新技术出现而调整。
OpenAI 于 9 月 10 日推出 Agents API 公测版,开发者可一次 API 调用创建云端 AI 智能体,复用 Codex 背后的执行框架。智能体支持运行代码、处理文件、跨上下文窗口执行数小时甚至数天的任务、多智能体并行协作,沙盒可选 OpenAI 托管或 Blaxel、Cloudflare、E2B、Vercel 等合作方环境。
Together AI 扩展 Together Fine-Tuning 服务,新增对 GLM-5.3、Kimi K2.7、Qwen 3.5 系列等最新开源权重模型的支持,并上线实时实验跟踪、数据集预览验证等能力。
推荐理由:原文给出新模型支持、Expert LoRA 实测对比、自动早停和降价幅度等具体细节,读者可据此评估微调工作流的实际改进。
Redis 发布全托管语义缓存服务 LangCache,现已在 Redis Cloud 以公开预览形式提供,通过 REST API 及 Python、JavaScript SDK 接入。
SpaceX CFO Bret Johnsen 表示公司又 secured 一份 AI 算力托管协议,价值每月 11 亿美元,自 2026 年 12 月 1 日起生效。
Blaxel 宣布并入 Baseten,目标是在一个平台上同时提供模型训练、推理和长时间运行的智能体执行能力。Blaxel 此前构建了智能体所需的沙箱、Agent Drive 分布式文件系统和网络连接层,其中沙箱可在 25 毫秒内挂起和恢复,空闲时接近零成本;Baseten 的推理栈已在数十个地区规模化运行。
GitHub Next 的 Don Syme 在 AI Native DevCon London 演讲中提出,应在 CI 和 CD 之外增加第三个支柱 Continuous AI,即在软件生命周期中以定时、可审计、由仓库事件触发的 AI 工作流实现持续文档、代码改进和问题分拣。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
推荐理由:Augment 复盘其软件工厂九个月的落地过程,给出了具体的量化结果和按瓶颈逐步自动化 SDLC 的可迁移方法。
OpenAI 与美国 GSA 宣布多年期协议,为联邦、州、地方和部落政府提供原本 $15 每用户每月的许可费降至 $0、用量 5 折优惠,覆盖约 2300 万公共部门员工。协议期 27 个月(2026年10月1日至2028年12月31日),所有经核验的政府实体还可获批 5 折的 Daybreak Blue 网络防御访问及配套培训。
Shopify 宣布将全部移动应用从 React Native 迁回 Swift 和 Kotlin,判断是 LLM 智能体大幅降低了跨平台重复开发成本这一核心假设被改变。
推荐理由:当事方完整披露迁移理由、开源库去向和 Helix 工作流,读者可以据此评估编码智能体对跨平台技术选型的影响。
推荐理由:OpenRouter 官方介绍新 Shell 工具和 Files API 的能力与开放方式,模型调用方可以据此判断如何接入有状态命令执行。
SemiAnalysis 发布长文分析数据中心表后(BTM)供电的现状与难点,其 Energy Model 追踪到 75GW 面向 BTM AI 算力的确定性订单,2026 年底预计美国约 3GW 数据中心 IT 容量由表后电站供电。
Nvidia 与 Palantir 合作用 AI 管理供应链,首个部署对象是 Nvidia 自家横跨数百万零部件、数千供应商的供应体系,单个 Vera Rubin 机架含 130 万个组件。
DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
Mistral AI 宣布与数据平台公司 Cloudera 建立合作伙伴关系。双方将把 Mistral 的模型集成到 Cloudera 的混合数据平台中,允许企业在私有云、公有云、本地甚至完全隔离的环境中运行推理。此外,Mistral 还将支持企业利用其专有数据在受控环境中训练定制模型,旨在满足金融、制造等受监管行业对“主权AI”的需求,确保数据、智能和计算完全由客户控制。
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。
推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。
推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。
作者 Hugo Vergnes 用租用的 8× B200 在 43 小时内以 $998 训练了 3.8B 参数模型 little-lm,在 65.3B tokens 上达到 CORE 0.384,超过 GPT-2 1.5B 的 0.2565。
成都交警去年上线的治理龟速车 AI 智慧系统近期在城区所有快速路及绕城高速完成部署。系统整合 ETC、卫星定位与视频感知数据识别超低速行驶车辆,通过 LED 屏提示,并核查驾车打电话等违法行为;自 2025 年 4 月试运行以来累计发布 LED 提示 3.1 万余次,监测路段龟速车数量同比下降约 20%。报道还提到成都一社区为独居老人安装毫米波雷达跌倒检测器,累计处置预警 66 条。
GitHub 发布 2026 年 8 月可用性报告,复盘了 8 月 6 日、17 日、20 日、26 日、27 日五起事故,包括 GitHub Actions、Issues、Pull requests 和 Copilot 的故障影响与修复措施。
LandingAI 发布 Agentic Document Extraction Gen2,改用 DPT-3 Pro 和 DPT-3 Verity 双解析模型,产品已正式可用。