#部署/工程
#部署/工程
今日 10 条
OpenCode@opencodeAI 评分2828Claude Code:GitHub Releases(RSS)AI 评分4646 Claude Code v2.1.261 发布:新增 /skill-doctor 与输出上限配置,修复大量问题
Claude Code 发布 v2.1.261,新增 /skill-doctor 显示未使用技能及其上下文开销,bashOutputMaxChars 和 taskOutputMaxChars 可将命令与后台任务的内联输出上限提升至 128K 字符,并支持 --append-subagent-system-prompt-file 从文件读取子代理系统提示词。
Databricks:Blog(RSS)AI 评分2222 Databricks 讲解如何通过专用 GPU kernel 生成实现极致推理效率
Databricks 发文介绍如何通过专用 GPU kernel 生成实现极高效率。文章指出传统生产推理系统依赖通用 kernel 处理多样化负载,并探讨专用 kernel 的优化路径。
MiniMax (official)@MiniMax_AIAI 评分2424xAI:News(网页)精选AI 评分6262 xAI 用 Grok Bot 搭建采购智能体 Haggle Bot,找出超 10 万美元直接节省
xAI 给 Grok Bot 开放供应商支出、合同和使用数据,搭建了名为 Haggle Bot 的采购智能体,已找出超过 10 万美元直接节省。SaaS 审计中发现一个产品有 43 个付费席位 90 天无活跃,节省 $14,220,另一个产品每年有 $85,662 未使用 SKU;办公用品比价一次将 $14,629 的订单压到 $6,143,降幅 58%。
推荐理由:原文公开了完整系统提示词与具体省钱数字,读者可以直接参考其意图表达和权限边界的搭建方式。
Tomer Tunguz 博客(VC 分析)精选AI 评分6161 Tom Tunguz 分析 4 万亿美元 AI 数据中心债务浪潮
Tom Tunguz 分析称,未来五年美国数据中心容量将从 25 吉瓦增至 70 吉瓦,全球建设成本约 5 万亿美元,其中约 4 万亿美元需靠债务融资,相当于美国公司债市场扩容 34%,并超过全球私募信贷市场。
推荐理由:作者把 4 万亿美元 AI 数据中心债务放到主要信贷市场规模中对比,并测算出 2030 年前需要的 AI 收入门槛,提供了一个宏观信用视角。
公众号:火山引擎AI 评分3737 广汽集团与火山引擎推动一线员工用 TRAE 等工具开发 Agent,落地研产供销全流程
广汽集团与火山引擎通过火山杯Agent创新大赛,鼓励一线员工用 TRAE、ArkClaw 等工具开发 Agent,覆盖 NVH 研发、物流设备管理、智能座舱故障诊断和智驾路测等场景。
Claude Code:GitHub Releases(RSS)AI 评分4444 Claude Code v2.1.260 发布
Claude Code 发布 v2.1.260,新增全屏模式 diff 面板(/diff 切换)、/cost 显示提示缓存未命中原因、/reload-plugins 及文本形式 /advisor 命令。
Epoch AI:研究、数据与评测AI 评分5555 Epoch AI 估算最大 AI 数据中心 IT 功率约每 10 个月翻倍
Epoch AI 基于 Frontier Data Centers 数据集(308 条里程碑、86 座设施)估算,自 2024 年年中以来最大在运数据中心的 IT 功率以每年 2.3 倍增长,90% 置信区间对应约 10 个月翻倍。
ClaudeDevs@ClaudeDevsAI 评分4747xAI:News(网页)精选AI 评分6060 xAI 发布 Grok Bot 企业版,Grok 与 Cursor Enterprise 客户两周免费
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用并邀请全组织成员,包括没有现有席位的员工。
推荐理由:原文给出企业版 Bot 的管控能力、真实使用场景和两周免费安排,企业用户可据此评估是否引入现有工作流。
Databricks:Blog(RSS)AI 评分2424 Databricks 讲解如何构建高质量且可信的数据产品
Databricks 发布博客,介绍组织在迈向 AI 与数据驱动时,如何借助 Databricks 构建高质量且可信的数据产品。正文从企业在 AI 和数据驱动转型中需要交付数据产品这一需求展开。
Cohere@cohereAI 评分1818
OpenRouter@OpenRouterAI 评分2626
Luma@LumaLabsAIAI 评分3131Luma AI 宣布 Luma 的企业治理功能正式上线。新功能包括独立团队、按项目设置 credit 上限,以及额度到顶时不会中断的计费方式。
Google AI:DEV 作者专属(RSS)精选AI 评分7171 Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent
Shir Meir Lador 在 Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。
推荐理由:原文给出在 Cloud Run instances 上以每月 $5.70 常驻运行 Agent 的完整部署步骤和适用边界,方法可直接迁移到其他后台 Agent 场景。
NVIDIA Technical Blog:Agentic AI / Generative AI精选AI 评分6969 NVIDIA 讲解如何在 Jetson 上部署和优化推理模型
NVIDIA 发布教程,讲解在 Jetson 上部署新一代开放推理模型的方法,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。
推荐理由:官方教程给出模型选型、NVFP4 量化与投机解码配置和实测吞吐数据,可迁移到自己的 Jetson 部署流程。
NVIDIA Technical Blog:Agentic AI / Generative AIAI 评分5454 NVIDIA 用 NemoClaw 构建记忆驱动的企业智能体并给出五条设计经验
NVIDIA 团队基于 NemoClaw 构建了一个记忆驱动的 Chief of Staff 智能体,用结构化 Markdown 的 self model 维护人员、项目和优先级等长期记忆,并通过 NVIDIA OpenShell 沙箱在运行时强制安全边界。
LlamaIndex:产品、工程与评测AI 评分5555 LlamaIndex 复盘使用 Stainless 生成 SDK 的经验与迁移
LlamaIndex 撰文复盘其使用 Stainless 生成 LlamaParse 与 LlamaCloud 官方 SDK 和 CLI 的经验。2026 年 5 月 18 日 Stainless 团队加入 Anthropic 并关停 SDK 生成器等托管产品,LlamaIndex 正在迁移。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分4242 蚂蚁 Ling 3.0 flash Fin 发布,首个金融增强模型,124B 总参数 5.1B 激活
蚂蚁集团发布 Ling 3.0 flash Fin,作为 Ant Ling 系列首个金融增强模型,基于 Ling 3.0 flash 用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
公众号:小红书技术(dots.llm)AI 评分5555 小红书与 vivo 联合打通 3D 图片全链路技术实践
小红书与 vivo 联合打通从 vivo 相册生成 3D 图到小红书发布、分发与消费的完整 3D 内容链路,并共同设计面向移动社交场景的新型 3D 格式。
OpenCode@opencodeAI 评分2626公众号:龙猫LongCat(美团)AI 评分4040 美团智播解析数字人直播技术:形象生成、动作驱动与万路并发方案
美团智播官方发布技术长文,介绍AI数字人直播的完整技术闭环,涵盖高保真形象生成与编辑(SDIP、SREdit)、文本驱动动作生成(MoTiGA)、语音手势协调生成(StreamingTalk)和视觉token压缩推理加速(Glance2Gaze)。
Huawei Cloud@HuaweiCloud1AI 评分2222LangChain:Blog(RSS)AI 评分3535 Schneider Electric、Vodafone 和 monday.com 如何在欧洲与中东规模化落地 Agent
LangChain 发布指南,介绍 Schneider Electric、Vodafone 和 monday.com 在欧洲与中东规模化落地生产级 AI 的做法。内容涵盖建立共享 Agent 平台与 LLMOps 实践,以及设计具备更强可观测性、评估和控制能力的多智能体架构。
Replit ⠕@ReplitAI 评分2727Replit 宣布为用户已发布的应用提供深度洞察,帮助构建更好的产品。用户可以查看用户参与情况,并深入分析数据,以此指导下一个功能开发。
Databricks:Blog(RSS)AI 评分1717 Databricks 介绍 Southern Company 的 SCOUT 风暴情报方案后续
Databricks 官方博客发布 Southern Company 的 SCOUT 风暴情报案例续篇,延续此前一篇对该公司相关实践的文章,补完风暴情报的整体故事。
Meta Engineering Blog(RSS)AI 评分5353 Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
GitHub BlogAI 评分5454 GitHub 播客解读 AI 开发新术语:loop engineering、Ralph loops、squads、harness 与 hill climbing
GitHub Podcast 一期节目配套文章由 Cassidy Williams 与 Marlene Mhangami 等解读当下 AI 开发常见新术语。
GitHub Blog精选AI 评分6262 GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。
推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。
Cursor Blog精选AI 评分6868 Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
OpenRouter@OpenRouterAI 评分2323Claude:Blog(网页)精选AI 评分7979 Anthropic 发布 Claude 电商智能体构建指南及参考实现
Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。
推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。
Google AI:DEV 作者专属(RSS)精选AI 评分6666 Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。
推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。
Google DeepMind:Blog(RSS)AI 评分4747 Google DeepMind 推出 Fairwind Program,用 Gemini 3.8 Flash Cyber 与 CodeMender 主动防御网络威胁
Google DeepMind 推出 Fairwind Program,一项面向政府和可信合作伙伴的有限准入计划,提供 Gemini 3.8 Flash Cyber 网络安全模型与 CodeMender,可自主发现、验证并修复漏洞,在组织安全云环境中数分钟内生成可部署补丁。
Hugging Face:Blog(RSS)AI 评分3535 IBM 与 Confluent 发布 Granite 时间序列模型 Early Access,可在流数据上实时预测与检测异常
IBM 与 Confluent 宣布四款 IBM Granite 时间序列基础模型(PatchTST-FM、FlowState、TTM、TSPulse)以 Early Access 形式上线 Confluent Cloud。
Unsloth AI@UnslothAI精选AI 评分6666推荐理由:原文给出了 MTP 加速的具体倍数、显存门槛和各量化档位内存需求,读者可以据此判断自己的设备能否跑通。
SiliconFlow@SiliconFlowAIAI 评分3434Baseten 工程博客(网页)精选AI 评分6262 Baseten 解析后训练最佳开源模型并按成本分档推荐
Baseten 发文解析开源模型后训练的成本驱动因素,指出活跃参数量是 RL 后训练成本的最大来源,总参数和 KV cache 主要限制推理速度,并按成本档位推荐 DeepSeek-V4-Flash、GLM-5.2、Kimi K2.6、Kimi K2.7 Code、Nemotron-3-Super-120B 和 Qwen3 系列。选型建议关注库支持、基准表现和后训练循环成本三方面。
推荐理由:原文把后训练成本拆解为活跃参数、总参数和 KV cache 三个因素,并按成本档位比较了多款开源模型,方法可直接迁移到选型。
Microsoft:Official Blog(RSS)AI 评分3333 Microsoft 谈 AI 基础设施的“良率”命题:从芯片到智能体
Microsoft 提出 AI 基础设施的“良率命题”,主张用半导体行业 60 年来的良率思维衡量 AI 投入的实际产出,而非只看建了多少算力。文中指出全球 AI 渗透率仅为劳动人口的 18%,且单个智能体任务的 token 消耗可达普通对话的 3400 倍以上,电力、内存与封装正成为瓶颈。