vLLM 优化 Kimi K3 服务性能:吞吐提升 2.2–2.8 倍
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
Fireworks 发布 2026 年开源 LLM 选型指南,覆盖 GLM 5.2、Kimi K3、Kimi K2.7 Code、DeepSeek-V4-Pro/Flash、MiniMax M3、Qwen3.7 Plus、gpt-oss-120b 和 Gemma 4 31B IT 九款模型。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
OpenAI 发文(系列上篇)讲述其在线存储平台 Habitat 的演进:现每秒处理超 7000 万请求、服务每周超 10 亿用户、管理超 500PB 数据,覆盖近 40 个地区。
推荐理由:原文披露了 Habitat 从 Python 库到 Rust 服务的完整演进细节,含 asyncio 调优、连接池等可迁移经验。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。
推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。
OpenRouter 发布 Fusion 复合推理系统,将一个提示词并行发给 1 到 8 个面板模型,由 judge 比较共识与分歧后由调用模型写出最终答案。默认三模型面板成本约为单次完成的四到五倍、延迟两到三倍,在 DRACO 深度研究基准上预算面板得 64.7%、前沿面板得 69.0%。
推荐理由:官方详解 Fusion 的多模型辩论机制、四到五倍成本与两到三倍延迟,并给出适用与不适用的具体场景。
OpenRouter 发布 Presets 使用教程,preset 是一个命名且带版本的配置,统一存放模型或 fallback 列表、system prompt、provider 路由和采样参数,在任何请求中以 "model": "@preset/名称" 引用。
Together AI 扩展 Together Fine-Tuning 服务,新增对 GLM-5.3、Kimi K2.7、Qwen 3.5 系列等最新开源权重模型的支持,并上线实时实验跟踪、数据集预览验证等能力。
推荐理由:原文给出新模型支持、Expert LoRA 实测对比、自动早停和降价幅度等具体细节,读者可据此评估微调工作流的实际改进。
Blaxel 宣布并入 Baseten,目标是在一个平台上同时提供模型训练、推理和长时间运行的智能体执行能力。Blaxel 此前构建了智能体所需的沙箱、Agent Drive 分布式文件系统和网络连接层,其中沙箱可在 25 毫秒内挂起和恢复,空闲时接近零成本;Baseten 的推理栈已在数十个地区规模化运行。
GitHub Next 的 Don Syme 在 AI Native DevCon London 演讲中提出,应在 CI 和 CD 之外增加第三个支柱 Continuous AI,即在软件生命周期中以定时、可审计、由仓库事件触发的 AI 工作流实现持续文档、代码改进和问题分拣。
Augment Code 发布长文,复盘其九个月建设的软件工厂:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台在需求、工单、PR、生产四个环节部署 PR Author。
推荐理由:Augment 复盘其软件工厂九个月的落地过程,给出了具体的量化结果和按瓶颈逐步自动化 SDLC 的可迁移方法。
OpenAI 与美国 GSA 宣布多年期协议,为联邦、州、地方和部落政府提供原本 $15 每用户每月的许可费降至 $0、用量 5 折优惠,覆盖约 2300 万公共部门员工。协议期 27 个月(2026年10月1日至2028年12月31日),所有经核验的政府实体还可获批 5 折的 Daybreak Blue 网络防御访问及配套培训。
推荐理由:OpenRouter 官方介绍新 Shell 工具和 Files API 的能力与开放方式,模型调用方可以据此判断如何接入有状态命令执行。
Mistral AI 宣布与数据平台公司 Cloudera 建立合作伙伴关系。双方将把 Mistral 的模型集成到 Cloudera 的混合数据平台中,允许企业在私有云、公有云、本地甚至完全隔离的环境中运行推理。此外,Mistral 还将支持企业利用其专有数据在受控环境中训练定制模型,旨在满足金融、制造等受监管行业对“主权AI”的需求,确保数据、智能和计算完全由客户控制。
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。
推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。
GitHub 发布 2026 年 8 月可用性报告,复盘了 8 月 6 日、17 日、20 日、26 日、27 日五起事故,包括 GitHub Actions、Issues、Pull requests 和 Copilot 的故障影响与修复措施。
Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。
推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。
Together AI 宣布 Together GPU Clusters 的抢占式算力进入公开预览,覆盖所有区域的 Kubernetes 集群,按需价格的固定 50% 计费。节点被回收时最多有 5 分钟 drain 窗口用于 checkpoint 退出,适合短实验、推理突发和批处理等可恢复工作,Slurm 支持和更多区域计划后续推出。
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 API 提供,定价为每百万输入 token $10、输出 token $50。
Baseten 优化了 pyannote 最新的开源模型 Community-1 与闭源模型 Precision-2,长音频延迟最高提升 9.6 倍,Precision-2 吞吐量提升 3.2 倍。
OpenRouter 发布 openrouter:shell 服务端工具和 Files API,OpenRouter 上任何支持工具调用的模型都可在托管 Linux 容器中运行命令,两者现已在 beta 阶段开放。
推荐理由:原文给出定价、容器网络策略和文件生命周期等落地细节,读者可以据此评估在自己的 Agent 工作流中怎么用这套沙箱。
OpenRouter 推出 US In-Region Routing,请求经 us.openrouter.ai 在美国境内解密并只路由到美国 provider 端点,eu.openrouter.ai 同理服务欧盟。
推荐理由:原文区分了端到端与仅推理的区域路由,并给出具体接入方式,读者可以据此评估各家网关的数据驻留承诺。
Epoch AI 推出 AI Chip Users explorer,以 Nvidia H100 等效值(H100e)估算 OpenAI、Google DeepMind、Anthropic、Meta Superintelligence Labs 和 SpaceXAI 用于研究、训练和推理的算力。
Cohere 发布首个围绕 decode megakernel 构建的完整 LLM 文本生成服务系统,性能最高比 vLLM 快 1.58x。该系统为 North Mini Code 打造,完全开源。
Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。
推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。
Anthropic 团队文章指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 三个手段可在不牺牲性能的情况下降低成本。
推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
面壁智能 OpenBMB 在开源 MiniCPM5-2B 后,进一步开源其背后的 RL 训练栈。Meshy 是服务化 RL 训练框架,将推理、rollout 和训练解耦为统一数据平面上的独立服务。
IBM Research 联合 Red Hat、Google 的开源项目 llm-d 展示在 544 块 NVIDIA H100 GPU 上部署 753B 参数的开放权重 MoE 模型 GLM-5.2(约 39B 激活),在数百到 3000 个并发编码智能体负载下峰值输出超 6.6M tokens 每分钟,零抢占。
Katie McLaughlin 在 Google AI 的 AI 评测系列最终篇中,介绍如何将 Inspect AI 评测的 CSV 数据接入 Data Studio,通过克隆 Master Dashboard Template 并绑定 Google Sheets 数据源,约 30 秒完成无代码交互式仪表盘搭建。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。
推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。
vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。