跳到正文

#部署/工程

今日 10 条
9月30日周三
9月29日周二
  1. Databricks:Blog(RSS)65

    Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

    Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

    推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。

  2. Mistral AI:News(网页)53

    Mistral 在慕尼黑设立德国中心,发力工业 AI 与 Physics AI

    Mistral 宣布在慕尼黑开设新中心,设立专注 Physics AI 和工业 AI 的研究团队,并直接服务企业客户。2026 年 5 月收购 Emmi AI 后,超过 30 名物理与工程 AI 研究人员加入;目前正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)利用其风洞设施研发汽车空气动力学数字孪生。

9月28日周一
  1. 公众号:千问APP(阿里)37

    千问APP接入中国移动算力套餐,支持Token额度直接抵扣

    2026年9月28日,千问APP与PC端宣布接入中国移动算力套餐。已订阅该套餐的用户可在千问“工作助理”中直接使用本人中国移动账户内的Token额度,相关消耗将从对应账户扣除。双方还推出联名版,办理指定套餐可获千问会员权益。该合作率先在广东、湖南、湖北、江苏等地试推,后续将推向全国。

9月25日周五
  1. GitHub Blog64

    GitHub 如何通过迁移 CSS Modules 将 SSR 时间降低 55%

    GitHub 工程师 Josh Black 复盘将 Primer 设计系统从 CSS-in-JS 迁移到 CSS Modules 的历程。截至 2024 年 12 月 Primer 全部组件迁移完成,服务端渲染时间减少 55%,组件初始化时间减少 25%。

    推荐理由:原文给出大厂从 CSS-in-JS 迁移到 CSS Modules 的完整路径和量化收益,可迁移到类似的前端架构改造。

  2. vLLM 官方博客(RSS)66

    vLLM 新增基于 Gumbel-max 的无失真文本水印功能

    vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。

    推荐理由:原文给出水印算法原理、双键与去重方案及实测吞吐数据,读者可评估在生产环境启用水印的可行性与代价。

9月24日周四
  1. Liquid AI 模型与工程博客(网页)57

    Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言 drafter 模型,边缘端解码最高提速 3.13 倍

    Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。

  2. 公众号:蚂蚁百灵(Ling)67

    蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。

    推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。

  3. ClaudeDevs68

    Claude Code 云会话正式可用,结束研究预览阶段,可在笔记本合盖后继续在 Anthropic 托管的基础设施上运行。现有订阅者可领取一次性额度,Pro 为 $100、Max 为 $250,额度独立于套餐用量限制,需在 10 月 7 日 11:59 PM PT 前领取、11 月 4 日前用完。

    推荐理由:云会话正式结束预览期,Pro 和 Max 订阅者可领取一次性额度,在本地受限或合盖后仍能继续任务。

  4. Modal 官方工程博客(RSS)62

    Modal 详解如何以万亿 token 规模服务 Kimi K2.6 编码 Agent 推理

    Modal 分享为编码 Agent 提供万亿参数模型 Kimi K2.6 推理服务的优化实践,优化后单副本每用户性能提升 2.8x、副本整体吞吐提升 5.6x,单个服务日处理数千亿 token。

    推荐理由:原文以一线实践拆解编码 Agent 推理优化的完整路径,读者可以迁移其瓶颈定位与 KV 缓存路由方法。

  5. Google DeepMind:Blog(RSS)54

    Google DeepMind 为 Private AI Compute 增加安全的服务端持久记忆

    Google DeepMind 宣布将为 Private AI Compute 平台引入私密的服务端持久记忆,使 AI 助手能跨设备长期保留上下文。数据密封在云端专用加密存储中,解密密钥仅保存在用户设备上,请求通过端到端加密通道在隔离的安全飞区中临时解密处理,即使 Google 也无法访问。