OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目
OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。
推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。
OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。
推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。
SpaceXAI 发布长文,介绍 Cursor 并入后如何让 Grok Bot 参与客户支持运营。合并团队工单量增长 175% 但未新增人手,否则可能需多招 200 人。
Anthropic 官方博客拆解 Claude Code 任务在 Opus 5.5 上的成本构成,轮次、缓存读取、输出 token 和模型选择决定账单,Opus 5.5 API 输入输出每百万 token 降价 20%、缓存读取降 60% 至 $0.20。
推荐理由:原文把一次任务的 token 成本拆成轮次、缓存、输出和模型选择四项,并给出 effort 设置与缓存维护的可迁移省钱方法。
作者让 Meta 的 Muse 把其会话的 Linux 环境打包发到 Google Drive,得到约 2.7 GB 压缩、6.8 GB 解压的文件,内含系统文件、内部文档、约 68 个技能目录、113 条子代理记录、SSH 密钥文件和 Markdown 记忆体系。
作者借鉴论文 Language Modeling is Compression 中压缩与预测等价的原理,用 zlib/DEFLATE 实现了 gzipt,纯标准库 Python、无任何神经网络的压缩器语言模型。
OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。
推荐理由:OpenRouter 结合自家端点数据拆解 Nemotron 3.5 Lightning 的定位、上下文和调用差异,读者可据此评估它在 Agent 执行层的适用性。
Georgia Tech 团队开发的 Transformer Explainer 是一个交互式可视化工具,在浏览器中实时运行 124M 参数的 GPT-2 (small) 模型(由 Andrej Karpathy 的 nanoGPT 项目转换到 ONNX Runtime)。
Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。
推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。
Imprint 工程负责人记录了在公司内落地软件工厂模式的实践,核心是 /linear-project-loop 技能,它审计 Linear 项目的目标定义(Notion RFC、Datadog 或 Snowflake 指标),补齐缺失工具后自动增删 issue、处理非阻塞任务并定期重跑循环。
DAIR.AI 发布 Jev 新手指南,Jev 是 TypeSafe 推出的通用 System One 模型,专为快速、聚焦的判断设计,而非长推理或开放式写作。
作者认为 AI 编码不会必然拉低代码质量,关键在分层管理质量,其团队在把产出提高 2-3x 的同时让 bug 保持稳定甚至减少。
作者针对 AI 生成的社区活动海报风格高度雷同的问题,用 ChatGPT 为同一个虚构春季市集指定不同设计美学,先后生成 Bauhaus 几何极简、Stamp/Letterpress。
作者卡尔的AI沃茨分享名为 QBS(Question→Book→Skill)的方法:让 GPT-6 找一本能解决当前问题的书,完整读相关章节后提炼成可直接使用的 skill,并用新任务试跑验证。
MarkTechPost 发布一篇 LLM 模型格式与量化方法科普,先区分存储容器(safetensors、GGUF)与量化方法(GPTQ、AWQ、bitsandbytes NF4 等),再逐个讲解 GGUF 的量化命名、GPTQ 与 AWQ 原理、EXL2/EXL3 及 MLX 等格式。
OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。
推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。
作者 m-hodges 自称用约一个月业余时间和约 400 亿 token(约 95% 为缓存读取,ChatGPT 估算 API 成本约 4 万美元),得出 Conway 50 年前提出的 omnific 整数精细化猜想的 Lean 证明,该证明已通过 Palomar 注册表的机械检查,但尚未经数学家独立验证。
EvoSkill v2 通过持久化 Agent 技能实现免重训的自我提升:coach agent 阅读失败运行后写出技能文件,worker 在下次遇到类似任务时加载,不改动任何权重。
OpenRouter 发布教程,讲解如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据和 google/gemini-3-flash-preview 等模型。
Tessl 博客复盘前 Docker CTO Justin Cormack 在 AI Native DevCon London 的演讲,分享用 AI 构建约 35 万行 Rust 的 S3 兼容对象存储的经验。
推荐理由:作者用 35 万行 Rust 复刻 S3 的实测经历,总结出测试先知、覆盖率陷阱、flaky 测试纪律和追踪等一套可迁移的 AI 智能体评估方法。
Trail of Bits 在审计 Miden zkVM 前,让 Agent 用六个月从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean VM 执行器模型。这些工具发现了可让恶意 prover 伪造 Falcon 签名盗取资金的高危漏洞,静态分析定位了 400 多处类型验证缺陷,Lean 工作产出 95 个机器验证的正确性证明,还发现两个单元测试未捕获的细微 bug。
推荐理由:原文给出用 Agent 在审计前自建工具链与形式化证明的完整路径,含真实高危发现,方法可迁移到其他安全审计场景。
该指南从文档完善度、许可证、维护状态和安全控制等维度盘点 11 个开源 Agent harness,包括 OpenCode、Pi、Goose、Cline、OpenHands、Aider、Codex CLI、Qwen Code、Kilo Code、Hermes Agent 和 OpenClaw。
作者提出 LLM 直接当分类器缺乏校准和可解释性,更好的做法是把 LLM 判定当作特征,外接逻辑回归等标准机器学习模型。
作者提出用 LLM 写作的两条规则:不接受 LLM 建议的任何具体措辞,并禁止模型给出鼓励性夸奖,以免强化初稿的坏习惯。
Simon Willison 提出 LLM 辅助写作规则:不得使用模型建议的任何具体措辞。他不让 LLM 替自己写博客内容,但用其做事实核查、拼写语法检查和同义词参考,并引用 Thomas 展示的个人 LLM 文案校对工具及其自建提示词。
作者解读《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告,指出该模型虽名为 V4.1 Flash,但架构变化足以视作 V5 级迭代。
作者用GPT6搭配Hyper3D Rodin的MCP,花一下午做出了可逛、可交互的3D个人作品集网页,场景含35个精细建模。流程为GPT-6画参考图并写交互代码,Rodin生成3D模型,BANG把模型按结构拆成独立零件以实现零件级动画,作者还把整个流程打包成skill发布在github.com/LearnPrompt/3Dworkshop。
GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。
推荐理由:当事工程师复盘用 AI 智能体在数月内将 Copilot 运行时迁往 Rust 的全过程,策略、回归样本和成本数据对同类迁移有直接参考价值。
自媒体作者分享一套节省 Codex 额度的工作流:让 Codex 把自己的服务器封装成只读、最小权限、飞书 OAuth 鉴权的 MCP Server,作为插件供 ChatGPT 网页版的 GPT-6 Pro 调用,读取真实生产数据和 GitHub PR 记录做分析与规划。
推荐理由:作者给出一条可复用的工作流,把业务数据封装成只读 MCP 插件,让 GPT-6 Pro 承担规划以节省 Codex 周额度。
Rohan Bansal 通过 off-policy 蒸馏 GPT-6 Astra 轨迹和智能体强化学习,将 Qwen 4B 模型训练为查询优化智能体,在 Join Order Benchmark 113 条 join 密集查询上实现 1.81x 几何平均加速和 44.7% 总延迟下降。
Odevo 在 AI Native DevCon London 分享了其 AI Native 转型经验:这家住宅物业管理公司七年内管理房屋从约 5 万套增至约 250 万套、员工从约 1000 人增至 14000 人,2024 年起步时仅约 30% 开发者使用 GitHub Copilot 等工具。
OpenRouter 梳理其目录中的 DeepSeek V4 系列图像输入支持情况:V4.1 Flash 原生读图(2026年9月10日上线,$0.15/$0.60 每百万 token)。
推荐理由:原文逐一列出 DeepSeek V4 各型号是否支持图像输入、价格和调用方式,并给出文本-only 型号配视觉模型的两段式替代方案。
作者与 Niklas 用 Codex 和 Claude 在约一个月内为 M4 Mac Mini 与 MacBook Neo 构建了完全符合 OpenGL ES 3.0 的 Linux GPU 驱动,Minecraft 可跑 200fps。
vLLM 团队扩展 Speculators 训练库,为 2.8T 参数的 Kimi K3 训练出 DSpark 投机解码 draft 模型,将数学推理单流交互速度从约 110 提升至约 435 tok/s/user,并发负载下输出吞吐最高提升约 3.5 倍。
NVIDIA 技术博客讲解 dense 与 MoE 架构在参数激活、吞吐和部署上的差异,以 Nemotron 3.5 Lightning 为例说明 MoE 每词元仅激活约 3B 参数、总参数 30B 仍需约 60 GB 显存。文章给出按显存预算、并发、微调和量化需求选型的建议,并对比 Gemma 4 31B、Qwen3.8-27B、Mistral Small 4 等模型的输出速度与价格数据。
Google 开发者博客发布零信任智能体系列第二部分,把安全检查从构建期移到 Gemini Enterprise Agent Platform 运行时,用 Model Armor、Semantic Governance Policies 和 Agent Anomaly Detection 三项托管控制拦截构建期规则放过的攻击。