#部署/工程
#部署/工程
今日 12 条
elvis@omarsar0AI 评分4545Databricks:Blog(RSS)AI 评分1717 Databricks 介绍 Southern Company 的 SCOUT 风暴情报方案后续
Databricks 官方博客发布 Southern Company 的 SCOUT 风暴情报案例续篇,延续此前一篇对该公司相关实践的文章,补完风暴情报的整体故事。
ginobefun@hongming731AI 评分5050本期早报围绕能力、工作过程与最终成本展开,精讲三篇:Google 发布 Gemini 3.8 Flash 系列含通用 Flash 与 Flash Cyber,内部漏洞发现成功率超 70%。
Rohan Paul@rohanpaul_aiAI 评分7070Meta Engineering Blog(RSS)AI 评分5353 Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
Aravind Srinivas@AravSrinivasAI 评分6060GitHub BlogAI 评分5454 GitHub 播客解读 AI 开发新术语:loop engineering、Ralph loops、squads、harness 与 hill climbing
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
SemiAnalysis@SemiAnalysis_AI 评分3030
Aravind Srinivas@AravSrinivasAI 评分3131
Rohan Paul@rohanpaul_aiAI 评分4646Sam Altman 称每 38,000 次 ChatGPT 查询的用水量约等于加州生产一颗杏仁,并称现代大型数据中心用水量相当于一栋办公楼。
MarkTechPost(RSS)AI 评分5454 NVIDIA 开源 Switchyard:用 Rust 代理在 OpenAI 与 Anthropic API 间路由和翻译 LLM 流量
NVIDIA 发布 Switchyard,一个 Apache 2.0 协议的 Rust 代理和库,用于在多个后端之间路由 LLM 流量,并双向翻译 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 三种格式,包括流式事件。
GitHub Blog精选AI 评分6262 GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
Simon Willison 博客AI 评分3434 llm-gemini 0.34 发布,支持 Gemini 3.8 Flash 并修复异步响应问题
llm-gemini 0.34 新增对 Gemini 3.8 Flash 模型 gemini-3.8-flash 的支持,提供 low、medium 和 high 三档思考级别。修复了异步响应未能记录已解析模型版本的问题(#146,感谢 Charlie Tonneslan),另含 #137 修复。
Cursor Blog精选AI 评分6868 Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
Rohan Paul@rohanpaul_aiAI 评分4848X Square Robot 发布 TwinDEX,一对协同设计的三指九自由度灵巧操作接口,一个可穿戴用于数据采集,一个用于机器人部署,两者共享相同的运动学、接触面、外观和传感器。
SemiAnalysis@SemiAnalysis_AI 评分1818
elvis@omarsar0AI 评分3232
OpenRouter@OpenRouterAI 评分2323MarkTechPost(RSS)AI 评分7575 Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber:同一核心模型、两种访问方式
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,两者基于同一核心智能,区别在于安全包络和访问方式。
Claude:Blog(网页)精选AI 评分7979 Anthropic 发布 Claude 电商智能体构建指南及参考实现
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
Google AI:DEV 作者专属(RSS)精选AI 评分6666 Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。
Google DeepMind:Blog(RSS)AI 评分4747 Google DeepMind 推出 Fairwind Program,用 Gemini 3.8 Flash Cyber 与 CodeMender 主动防御网络威胁
Google DeepMind 推出 Fairwind Program,一项面向政府和可信合作伙伴的有限准入计划,提供 Gemini 3.8 Flash Cyber 网络安全模型与 CodeMender,可自主发现、验证并修复漏洞,在组织安全云环境中数分钟内生成可部署补丁。
IT之家(RSS)AI 评分6060 谷歌拆解退役服务器回收 DDR4 内存,重新部署至新型 AI 服务器
据 Wccftech 报道,谷歌供应链基础设施高级总监尼基尔·切里安在峰会论坛上透露,AI 产业已由算力受限转变为内存受限,高性能内存约占单台 AI 服务器物料成本的 75%。谷歌为此拆解退役服务器回收 DDR4 内存模组,并设计专用转接卡,在部分场景用 DDR4 替代新型 AI 服务器原规划的 DDR5;同时谷歌还在优化底层函数库、模型架构及 KV 缓存压缩算法以降低内存开销。
The Decoder:AI News(RSS)AI 评分6868 特朗普称反对AI数据中心抗议正中中国下怀
特朗普在Truth Social上强烈回击美国各地对AI数据中心的反对声浪,称拒绝数据中心的社区将变得"落后和贫穷",中国会很乐见这一反数据中心运动,因为美国建设放缓会让北京在AI竞赛中占优。
IT之家(RSS)AI 评分3636 美光探索近 GPU NAND 闪存,可支撑更大规模 AI 模型
据 DigiTimes 9 月 2 日报道,美光正在研究高耐久性 NAND 闪存模块,计划部署在距离 GPU 更近的位置,当前被称为“近 GPU NAND”。该方案可让 GPU 直接访问数百 GB 的 NAND 存储池,放置在 GPU 封装内部或 PCB,工作方式类似 HBM、GDDR7;与传统 TLC 或 QLC NAND 相比密度更低,重点提升 I/O 速度和带宽。
Hugging Face:Blog(RSS)AI 评分3535 IBM 与 Confluent 发布 Granite 时间序列模型 Early Access,可在流数据上实时预测与检测异常
IBM 与 Confluent 宣布四款 IBM Granite 时间序列基础模型(PatchTST-FM、FlowState、TTM、TSPulse)以 Early Access 形式上线 Confluent Cloud。
Unsloth AI@UnslothAI精选AI 评分6666推荐理由:原文给出了 MTP 加速的具体倍数、显存门槛和各量化档位内存需求,读者可以据此判断自己的设备能否跑通。
SiliconFlow@SiliconFlowAIAI 评分3434IT之家(RSS)AI 评分6161 月之暗面宣布 Kimi API 原生支持 Codex 和 Claude Code
月之暗面宣布 Kimi API 已支持 OpenAI 的 Responses API 格式(base_url 为 https://api.moonshot.cn/v1)和 Anthropic 的 Messages API 格式(base_url 为 https://api.moonshot.cn/anthropic)。
IT之家(RSS)AI 评分3232 宏碁推出 SFF RTX Spark 迷你主机,最高可选 128GB 统一内存
宏碁在全球市场推出 SFF RTX Spark 迷你主机,采用英伟达 RTX Spark 平台。新品搭载 20 核 RTX Spark Superchip 芯片,集成 Blackwell 架构 GPU,含 6144 个 CUDA 核心,最高可选 128GB 统一内存,配备一个 HDMI、一个 RJ45 以太网和四个 USB Type-C 接口,上市时间和售价暂未公布。
Baseten 工程博客(网页)精选AI 评分6262 Baseten 解析后训练最佳开源模型并按成本分档推荐
Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。
推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 论文提出用生产流量驱动的后训练将 200+ 内部应用流量整合到单一自托管 LLM
一篇 arXiv 论文提出在数据驻留约束下,将超过 200 个内部应用的流量整合到单个自托管模型,通过生产错误分析沿指令遵循、函数调用和内部任务分布三个轴弥补质量差距。
公众号:卡尔的AI沃茨AI 评分7474 实测 Claude Fable 5.1:长时 Agent 任务与浏览器自动化表现突出
作者实测 Anthropic 新发布的 Claude Fable 5.1,认为其在长时间 Agent 任务和浏览器自动化上超过 GPT 5.6。
Rohan Paul@rohanpaul_aiAI 评分4848Hacker News 热门(buzzing.cc 中文翻译)AI 评分3737 Baseten 工程师解析 LLM 推理的有效边界与两类优化技术
Baseten 工程师 Philip Kiely 撰文解析 LLM 推理的"有效边界"框架,将推理技术分为两类:在延迟与吞吐之间做取舍以命中边界上某一点的技术,以及把整条边界外推、创造整体效率提升的技术。
IT之家(RSS)AI 评分4949 腾讯 WorkBuddy 开放平台上线,全面开放 Agent 基座能力
腾讯 WorkBuddy 开放平台于 9 月 2 日上线,首批入驻共创伙伴超百家,面向智能硬件、行业应用与开发者开放底层 Agent 基座能力。开发者通过资质审核后可进行技能、专家、连接器、外部应用接入等开发管理;现场还发布了 9 款联名智能硬件,合作方包括 Plaud、Rokid、影石、科大讯飞、安克等,30 余个行业应用覆盖金融、法律、医疗等 20 多个领域。
IT之家(RSS)AI 评分3737 合见工软发布国内首款三维芯片物理设计工具 UniVista 3DIC Designer
合见工软在 2026 IDAS 设计自动化产业峰会期间发布国内首款三维芯片物理设计工具 UniVista 3DIC Designer,宣称专为国产先进工艺节点打造,适配逻辑折叠与韬定律技术路线。
Microsoft:Official Blog(RSS)AI 评分3333 Microsoft 谈 AI 基础设施的“良率”命题:从芯片到智能体
Microsoft 提出 AI 基础设施的“良率命题”,主张用半导体行业 60 年来的良率思维衡量 AI 投入的实际产出,而非只看建了多少算力。文中指出全球 AI 渗透率仅为劳动人口的 18%,且单个智能体任务的 token 消耗可达普通对话的 3400 倍以上,电力、内存与封装正成为瓶颈。
MarkTechPost(RSS)AI 评分6262 Meta Superintelligence Labs 发布 Muse Voice Transcribe:一个实时模型同时完成流式 ASR、说话人分离和端点检测
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将流式 ASR、20+ 说话人的说话人分离和端点检测合并为一个自回归模型,无需后处理。
MarkTechPost(RSS)AI 评分6666 Perplexity 在 Mac 上推出 Hybrid Compute,云端智能体把敏感步骤下发给本地模型并由端侧隐私门控把关
Perplexity 在 Mac 上推出 Hybrid Compute,Computer 任务从云端前沿模型起步,遇到私有文件时把该步骤下发给本地模型再合并结果。