跳到正文

#部署/工程

今日 12 条
9月26日周六
9月25日周五
  1. GitHub Blog64

    GitHub 如何通过迁移 CSS Modules 将 SSR 时间降低 55%

    GitHub 工程师 Josh Black 复盘将 Primer 设计系统从 CSS-in-JS 迁移到 CSS Modules 的历程。截至 2024 年 12 月 Primer 全部组件迁移完成,服务端渲染时间减少 55%,组件初始化时间减少 25%。

    推荐理由:原文给出大厂从 CSS-in-JS 迁移到 CSS Modules 的完整路径和量化收益,可迁移到类似的前端架构改造。

  2. HuggingFace Daily Papers(社区热门论文)39

    提出连续深度批处理技术,实现循环语言模型的高效自适应推理

    针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。

  3. IT之家(RSS)55

    高通骁龙峰会宣布 Modular 平台将进入骁龙产品线,Mojo 编程语言获 Windows 原生支持

    高通在 2026 骁龙峰会宣布 Modular 平台将进入骁龙等完整产品组合,微软与 Modular 合作让 Mojo 编程语言原生支持 Windows。高通于 2026 年 7 月 29 日完成对 Modular 约 39-40 亿美元的收购,Mojo 1.0 已发布并开源标准库、编译器和工具链,目标是让同一套 AI 软件在 GPU、NPU、数据中心 ASIC 等架构及本地与云端间运行。

  4. vLLM 官方博客(RSS)66

    vLLM 新增基于 Gumbel-max 的无失真文本水印功能

    vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。

    推荐理由:原文给出水印算法原理、双键与去重方案及实测吞吐数据,读者可评估在生产环境启用水印的可行性与代价。

9月24日周四
  1. Liquid AI 模型与工程博客(网页)57

    Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言 drafter 模型,边缘端解码最高提速 3.13 倍

    Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。

  2. 公众号:蚂蚁百灵(Ling)67

    蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。

    推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。

  3. ClaudeDevs68

    Claude Code 云会话正式可用,结束研究预览阶段,可在笔记本合盖后继续在 Anthropic 托管的基础设施上运行。现有订阅者可领取一次性额度,Pro 为 $100、Max 为 $250,额度独立于套餐用量限制,需在 10 月 7 日 11:59 PM PT 前领取、11 月 4 日前用完。

    推荐理由:云会话正式结束预览期,Pro 和 Max 订阅者可领取一次性额度,在本地受限或合盖后仍能继续任务。