跳到正文

#部署/工程

今日 12 条
9月3日周四
  1. Meta Engineering Blog(RSS)53

    Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识

    Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。

  2. SemiAnalysis30

    SemiAnalysis 发文分析,随着行业转向 Co-Packaged 和 Near-Packaged Optics,光纤连接被迫直接落在 PIC 上。光纤耦合需微米级精度,边缘耦合器要求纤芯与波导偏差约半微米以内,否则耦合损耗在高带宽吞吐下不可承受;主动对准采用亚微米级串行定位加胶合,难以支撑高光纤数量且不可拆卸,而被动对准依靠机械结构将光纤保持在公差内,可实现可重复甚至可重新插拔的连接。

  3. GitHub Blog62

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

    推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。

  4. Cursor Blog68

    Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

    Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。

    推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。

  5. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  6. Google AI:DEV 作者专属(RSS)66

    Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

    Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

    推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。

9月2日周三
  1. IT之家(RSS)60

    谷歌拆解退役服务器回收 DDR4 内存,重新部署至新型 AI 服务器

    据 Wccftech 报道,谷歌供应链基础设施高级总监尼基尔·切里安在峰会论坛上透露,AI 产业已由算力受限转变为内存受限,高性能内存约占单台 AI 服务器物料成本的 75%。谷歌为此拆解退役服务器回收 DDR4 内存模组,并设计专用转接卡,在部分场景用 DDR4 替代新型 AI 服务器原规划的 DDR5;同时谷歌还在优化底层函数库、模型架构及 KV 缓存压缩算法以降低内存开销。

  2. IT之家(RSS)36

    美光探索近 GPU NAND 闪存,可支撑更大规模 AI 模型

    据 DigiTimes 9 月 2 日报道,美光正在研究高耐久性 NAND 闪存模块,计划部署在距离 GPU 更近的位置,当前被称为“近 GPU NAND”。该方案可让 GPU 直接访问数百 GB 的 NAND 存储池,放置在 GPU 封装内部或 PCB,工作方式类似 HBM、GDDR7;与传统 TLC 或 QLC NAND 相比密度更低,重点提升 I/O 速度和带宽。

  3. Baseten 工程博客(网页)62

    Baseten 解析后训练最佳开源模型并按成本分档推荐

    Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。

    推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。

  4. IT之家(RSS)49

    腾讯 WorkBuddy 开放平台上线,全面开放 Agent 基座能力

    腾讯 WorkBuddy 开放平台于 9 月 2 日上线,首批入驻共创伙伴超百家,面向智能硬件、行业应用与开发者开放底层 Agent 基座能力。开发者通过资质审核后可进行技能、专家、连接器、外部应用接入等开发管理;现场还发布了 9 款联名智能硬件,合作方包括 Plaud、Rokid、影石、科大讯飞、安克等,30 余个行业应用覆盖金融、法律、医疗等 20 多个领域。

  5. Microsoft:Official Blog(RSS)33

    Microsoft 谈 AI 基础设施的“良率”命题:从芯片到智能体

    Microsoft 提出 AI 基础设施的“良率命题”,主张用半导体行业 60 年来的良率思维衡量 AI 投入的实际产出,而非只看建了多少算力。文中指出全球 AI 渗透率仅为劳动人口的 18%,且单个智能体任务的 token 消耗可达普通对话的 3400 倍以上,电力、内存与封装正成为瓶颈。