#部署/工程
#部署/工程
今日 12 条
SemiAnalysis@SemiAnalysis_AI 评分5858
OpenCode@opencodeAI 评分5858opencode 宣布其平台上 DeepSeek v4.1 Flash 的 60 美元用量额度转为永久提供,此前该额度为阶段性活动。
MarkTechPost(RSS)AI 评分5353 Aikido Security 发布开源权重安全模型 Altar-1,由 GLM-5.3 压缩至 328 GB
Aikido Security 发布首个开源权重安全模型 Altar-1,将 Z.AI 的 GLM-5.3 经 AWQ 4-bit 量化和 Cerebras REAP 专家剪枝(每层保留 168/256 个专家)从 1,506.7 GB 压缩到 328 GB,缩小 78.2%。
GitHub Blog精选AI 评分6464 GitHub 如何通过迁移 CSS Modules 将 SSR 时间降低 55%
GitHub 工程师 Josh Black 复盘将 Primer 设计系统从 CSS-in-JS 迁移到 CSS Modules 的历程。截至 2024 年 12 月 Primer 全部组件迁移完成,服务端渲染时间减少 55%,组件初始化时间减少 25%。
推荐理由:原文给出大厂从 CSS-in-JS 迁移到 CSS Modules 的完整路径和量化收益,可迁移到类似的前端架构改造。
Google AI:DEV 作者专属(RSS)AI 评分5353 Postgres 中向量内联存储与独立表对比:AlloyDB Omni 实测 join 开销
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
The Decoder:AI News(RSS)AI 评分7171 Meta Muse 为每位用户提供运行 Ubuntu Linux 的免费云端电脑
Meta Superintelligence Labs 工程副总裁 David Singleton 表示,每位 Muse 用户可获得一台免费云端电脑,运行完整 Ubuntu Linux 镜像,可安装软件、编译代码或浏览网页。
IT之家(RSS)AI 评分6464 英国最大 AI 超算劳顿项目因供电问题或推迟到 2030 年代中期
据英国《卫报》报道,被称为英国最大 AI 超级计算机的埃塞克斯郡劳顿数据中心项目无法按原定 2027 年启用,UKPN 告知建设方 Nscale 电网要到 2030 年代初至中期才能提供足够电力。
Artificial Intelligence News(网页)AI 评分5656 为什么 AI 工作负载在排队而 GPU 看似闲置:Kubernetes GPU 分配问题解析
文章解释 AI 工作负载在 GPU 看似闲置时仍排队的原因:利用率指标只反映计算活动,不代表容量可用。Kubernetes 默认独占分配整块 GPU,此外内存占用、放置约束和应用层瓶颈也会造成排队。
MarkTechPost(RSS)AI 评分5858 Fastino 发布 GLiNER2.5-Decide:可在 CPU 上运行的 340M 开源权重决策模型
Fastino Labs 发布 340M 参数开源权重决策模型 GLiNER2.5-Decide,接受文本和类型化问题 schema,返回带概率分布、置信度和约束可行性元数据的结构化答案,权重采用 Apache 2.0,可运行于 CPU、GPU 或气隙环境。
Rohan Paul@rohanpaul_aiAI 评分5757HuggingFace Daily Papers(社区热门论文)AI 评分3636 G^2PTQ:用广义梯度补偿改进 LLM 训练后量化
论文提出 G^2PTQ,一个在全局监督、逐块优化目标下同时整合一阶与二阶信息的统一 PTQ 框架,通过在量化每个 Transformer 块前刷新梯度与 Hessian 估计,避免以往全局方法的估计过时问题。
OpenAI NewsAI 评分2222 Wayfair 用 OpenAI 模型提升商品目录准确率与客服速度
Wayfair 使用 OpenAI 模型改进电商客服与商品目录准确性,自动完成工单分类,并大规模优化数百万条商品属性。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 Softmax 重参数化:面向输出头量化的后训练方法
研究者提出 softmax 重参数化,一种在量化前选取功能等价输出头的后训练方法,通过从每个输出行减去词汇行均值的标量倍数,并按验证 KL 分别为 RTN、激活加权 MSE 和 full-Hessian GPTQ 选择系数。
HuggingFace Daily Papers(社区热门论文)AI 评分3939 提出连续深度批处理技术,实现循环语言模型的高效自适应推理
针对循环语言模型(Looped LMs)中不同 token 循环次数不同导致无法使用标准批处理系统的问题,研究者提出了“连续深度批处理”(CDB)方法。该方法通过在循环步骤间动态构建新批次、管理 KV 缓存及预测退出时机,实现了高效的深度自适应推理。实验表明,全循环架构最适合此方法,CDB 可实现高达 99% 的预估最大加速比。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6262 Opus 5.5 制作讲解视频的开源 agent 方案 shipvideo 发布
作者发布 launchvideo.io 与 diggerhq/shipvideo 仓库,用 anthropic/claude-opus-5.5 通过 OpenComputer serverless agent 把一个 URL 或提示词直接渲染成 MP4 讲解视频,单次运行无人工编辑。
IT之家(RSS)AI 评分5555 高通骁龙峰会宣布 Modular 平台将进入骁龙产品线,Mojo 编程语言获 Windows 原生支持
高通在 2026 骁龙峰会宣布 Modular 平台将进入骁龙等完整产品组合,微软与 Modular 合作让 Mojo 编程语言原生支持 Windows。高通于 2026 年 7 月 29 日完成对 Modular 约 39-40 亿美元的收购,Mojo 1.0 已发布并开源标准库、编译器和工具链,目标是让同一套 AI 软件在 GPU、NPU、数据中心 ASIC 等架构及本地与云端间运行。
AK@_akhaliqAI 评分5252The Verge:AI(RSS)AI 评分5656 The Verge 批评 Nvidia CEO 黄仁勋称 AI 需先造成痛苦才能拯救气候
The Verge 记者 Justine Calma 评析黄仁勋在 The Ezra Klein Show 上的言论,黄仁勋称 AI 拯救气候前不得不先使用化石燃料、造成痛苦。
Aravind Srinivas@AravSrinivasAI 评分5151The Decoder:AI News(RSS)AI 评分5858 Google Suncatcher 项目拟用太阳能把 AI 数据中心送入轨道,试验卫星 MVP 定于 10 月 1 日发射
Google 的 Suncatcher 项目计划在轨道上以太阳能运行 AI 基础设施,一颗冰箱大小的试验卫星 MVP 定于 10 月 1 日搭乘 SpaceX Falcon 9 从加州 Vandenberg Space Force Base 发射。
vLLM 官方博客(RSS)精选AI 评分6666 vLLM 新增基于 Gumbel-max 的无失真文本水印功能
vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。
推荐理由:原文给出水印算法原理、双键与去重方案及实测吞吐数据,读者可评估在生产环境启用水印的可行性与代价。
Ars Technica:AI(RSS)AI 评分6161 Google 首颗 Project Suncatcher 轨道数据中心试验卫星定于 10 月 1 日发射
Google 将于 10 月 1 日通过 SpaceX Falcon 9 的 Transporter-18 拼车任务发射首颗 Project Suncatcher 试验卫星 MVP,验证轨道 AI 数据中心的可行性。
Factory 研究 / 产品(RSS)AI 评分5555 Factory Router 生产环境推理成本节省升至 63%,并在 Factory Private 开放私有预览
Factory 宣布 Factory Router 的生产环境推理成本节省从 6 月下旬的 42% 升至截至 9 月 13 日当周的 63%,同期路由会话量增长约四倍。
Google Developers Blog(RSS)AI 评分5151 Google 团队在 TPU 上用 MaxText 复现 Ai2 的 Olmo 3 7B 预训练
Google 团队用 MaxText 在 Google Cloud TPU 上从头复现 Ai2 的 Olmo 3 7B,完成 stage-1 预训练(约5.93T token。
OpenCode@opencodeAI 评分5757Google Cloud:Databases(RSS)AI 评分5151 Google 发布 AlloyDB 智能体数据库架构,开放 AlloyDB PostgreSQL for agents 预览
Google Cloud 推出 AlloyDB 新的智能体数据库架构并开放 AlloyDB PostgreSQL for agents 预览,通过 MCP 接入独立 microVM 代理节点池,直接读取 Colossus 存储实现与生产集群物理隔离。
Google Cloud:Databases(RSS)AI 评分5252 AlloyDB 推出面向 Agent 的 PostgreSQL 预览版,实现秒级沙箱实例与工作负载隔离
Google Cloud 宣布 AlloyDB 推出面向 Agent 的 PostgreSQL(预览版),通过在数秒内动态配置沙箱化数据库实例实现完整工作负载隔离,Agent 任务完成后自动缩容到零并按活跃推理循环计费。
Liquid AI 模型与工程博客(网页)AI 评分5757 Liquid AI 发布 LFM2.5-VL-DSpark 视觉语言 drafter 模型,边缘端解码最高提速 3.13 倍
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
The Verge:AI(RSS)AI 评分7171 Google 将于 10 月 1 日发射搭载 TPU 的 AI 卫星,测试太空 AI 算力
Google 将于 10 月 1 日通过 SpaceX Falcon 9 火箭发射一颗搭载 TPU 的卫星,测试芯片能否承受航天物理应力、辐射和极端温度,这是 Project Suncatcher 计划迈向轨道 AI 数据中心的第一步。
Hugging Face:Blog(RSS)AI 评分5757 Liquid AI 发布 LFM2.5-VL-DSpark 视觉草稿模型加速 VLM 推理
Liquid AI 在 Hugging Face 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取推理加速。
NVIDIA BlogAI 评分88 《CONTROL Resonant》登陆 GeForce NOW,Googlebooks 将支持云游戏
Remedy Entertainment 的《CONTROL Resonant》本周在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
Google AI:DEV 作者专属(RSS)AI 评分5151 用 google-cloud-developer 插件让智能体按 Google Cloud 最佳实践完成部署实测
Remigiusz Samborski 用 Antigravity CLI 实测 Google 的 google-cloud-developer 插件,一条命令安装五个技能和 Developer Knowledge MCP 服务器,支撑 Claude Code、Codex CLI 等智能体。
elsewhere:文章(RSS)AI 评分6565 十字路口Crossing解析大模型「斩杀线」:效率如何重塑模型竞争格局
文章以「斩杀线」概念分析2026年模型竞争重心从智能转向智能与成本的前沿。作者复盘小米 MiMo 从 V2-Flash 到 V2.6 的四次迭代,称 9 月 22 日发布并开源的 MiMo-V2.6 系列三款模型智能接近前代两倍。
公众号:蚂蚁百灵(Ling)精选AI 评分6767 蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
Hacker News:AI 热帖AI 评分5656 virtio-nvgpu 开源:让 KVM 虚拟机以接近裸机性能直接使用 NVIDIA GPU
开源项目 virtio-nvgpu 在驱动 ABI 层转发 NVIDIA 内核驱动 ioctl,使 Linux guest 运行未修改的 NVIDIA 用户态驱动,在 RTX 3060(驱动 595.99.02)上帧时间 2ms 以上的负载达到裸机 98–100% 的性能,CPU 开销与裸机相同。
IT之家(RSS)AI 评分5959 微软开源 Windows Developer Config:1 条 PowerShell 命令配置 Win11 开发环境
微软开源 Windows Developer Config 项目,可通过 1 条 PowerShell 命令将全新 Windows 11 部署为开发工作站,含 11 个阶段和 50 个步骤,全程约 30 分钟,需 15GB 剩余空间。
Thariq@trq212AI 评分6464
ClaudeDevs@ClaudeDevs精选AI 评分5151推荐理由:作者分享了用 Claude 测量、调试并提升 claude.ai 性能的具体方法,并附上提示词,读者可参考复用。
ClaudeDevs@ClaudeDevs精选AI 评分6868推荐理由:云会话正式结束预览期,Pro 和 Max 订阅者可领取一次性额度,在本地受限或合盖后仍能继续任务。
Boris Cherny@bchernyAI 评分5757