推荐理由:来自 Cursor 团队经验的完整 agent harness 降本 prompt,给出实测数字、执行顺序和常见陷阱,可直接复用。
部署工程
全部主题把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
最新精选
第 21–40 条 · 共 81 条
eric zakariasson@ericzakariasson精选AI 评分7777Modal 官方工程博客(RSS)精选AI 评分6262 Modal 详解如何以万亿 token 规模服务 Kimi K2.6 编码 Agent 推理
Modal 分享为编码 Agent 提供万亿参数模型 Kimi K2.6 推理服务的优化实践,优化后单副本每用户性能提升 2.8x、副本整体吞吐提升 5.6x,单个服务日处理数千亿 token。
推荐理由:原文以一线实践拆解编码 Agent 推理优化的完整路径,读者可以迁移其瓶颈定位与 KV 缓存路由方法。
vLLM 官方博客(RSS)精选AI 评分7474 vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务
vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。
推荐理由:官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。
OpenRouter:Announcements(RSS)精选AI 评分6262 OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本
OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。
推荐理由:原文用同一测试流程给出两家模型的准确率、延迟与成本数据,并演示了基于置信度的级联路由方法,便于读者按自身流量权衡选型。
Claude:Blog(网页)精选AI 评分7171 Anthropic 详解 Opus 5.5 上一次 Claude Code 任务的成本构成
Anthropic 官方博客拆解 Claude Code 任务在 Opus 5.5 上的成本构成,轮次、缓存读取、输出 token 和模型选择决定账单,Opus 5.5 API 输入输出每百万 token 降价 20%、缓存读取降 60% 至 $0.20。
推荐理由:原文把一次任务的 token 成本拆成轮次、缓存、输出和模型选择四项,并给出 effort 设置与缓存维护的可迁移省钱方法。
LlamaIndex:产品、工程与评测精选AI 评分6666 LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 路由 API
LlamaIndex 发布 LiteParse 2.14.6 更新,通过对自维护 PDFium fork 做内存分配优化(内置 mimalloc)等手段,将文本提取耗时降低 20-25%,平均 2.76ms/页,markdown 渲染 3.94ms/页。
推荐理由:原文给出速度、表格准确率等实测对比数据和新增 API,读者可据此评估是否替换现有 PDF 解析方案。
OpenRouter:Announcements(RSS)精选AI 评分7070 OpenRouter 推出 Batch API,批量推理可享半价
OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。
推荐理由:公告给出折扣幅度、70+ 模型覆盖和 beta 期 230k+ 批次的实测完成时间,还提示了提交时段对速度的影响。
Hugging Face:Blog(RSS)精选AI 评分7373 transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp
Hugging Face 宣布 transformers 支持直接运行 GGUF 量化模型,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核。
推荐理由:官方宣布 transformers 直接加载 GGUF,给出在 Apple Silicon 上接近 llama.cpp 的实测吞吐和加载方法,可帮助本地推理用户选择工作流。
OpenRouter:Announcements(RSS)精选AI 评分6262 OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用
OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。
推荐理由:OpenRouter 结合自家端点数据拆解 Nemotron 3.5 Lightning 的定位、上下文和调用差异,读者可据此评估它在 Agent 执行层的适用性。
Linear:Now(RSS)精选AI 评分6262 Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟
Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。
推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。
Tomer Tunguz 博客(VC 分析)精选AI 评分6666 Tomer Tunguz 谈 AI 优化 if-then 判断:专用决策器把分类成本降近百倍
Tomer Tunguz 撰文提出最新一波 AI 正在接管软件中的 if-then 判断原语,Jev 与 SemIf 这类专用决策器以数百毫秒返回结果,成本比传统生成式调用低约 76x 到 209x。作者在自己的 Agent 中替换了约四分之一的调用,在 98 条人工核验的生产邮件线程上,Jev 达到 80%、本地 SemIf 达到 82% 的分类准确率,高于生产模型的 47%。
推荐理由:作者结合自身 Agent 的替换实验给出成本与准确率对比,为判断专用小模型何时可替代前沿模型提供参照。
Fireworks AI(网页)精选AI 评分6161 Fireworks AI 推出 Specialized Intelligence Index 领域基准索引
Fireworks AI 推出 Specialized Intelligence Index(SII),汇集开放、闭源与专用模型在真实工作任务基准上的表现,首批覆盖医疗、法律、网络安全、金融、客服、生产力和软件七个领域。
推荐理由:Fireworks 联合多家行业实践方推出领域基准索引,不做跨领域综合排名,读者可按成本和时长自行权衡模型选择。
OpenRouter:Announcements(RSS)精选AI 评分6363 OpenRouter 实测 Jev 决策模型对比 LLM,何时该用决策模型替代生成文本
OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。
推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。
Unsloth AI@UnslothAI精选AI 评分6868推荐理由:官方介绍了新 Docker 镜像和 Desktop 应用,列出本地训练运行模型的硬件支持与效率数字,读者可据此评估本地部署方式。
GitHub Blog精选AI 评分8787 GitHub 用 Copilot 智能体将 Copilot 运行时从 TypeScript 迁移到 83 万行 Rust
GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。
推荐理由:当事工程师复盘用 AI 智能体在数月内将 Copilot 运行时迁往 Rust 的全过程,策略、回归样本和成本数据对同类迁移有直接参考价值。
Aravind Srinivas@AravSrinivas精选AI 评分6969推荐理由:原文给出成本节省数字和构建方式,图片补充了批次读取延迟的具体对比数据。
Claude:Blog(网页)精选AI 评分6565 Claude for Small Business 新增 43 个 workflow 与 27 个集成
Anthropic 为 Claude for Small Business 新增 43 个 workflow 和 27 个集成,覆盖 Shopify、Salesforce、TikTok、Zoom、Stripe、Zapier 等工具,该产品自 5 月上线以来安装量超过 90 万次。
推荐理由:原文给出43个workflow、27个新集成和默认审批模式的控制方式,读者可以据此判断它怎样接入小店现有的工具链。
Fireworks AI(网页)精选AI 评分7272 Fireworks 上线 DeepSeek-V4.1-Flash,DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
Claude:Blog(网页)精选AI 评分6666 Anthropic 工程师复盘:智能体编程压力下如何扩展测试影响分析服务
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
SiliconFlow@SiliconFlowAI精选AI 评分6666推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。