美团龙猫LongCat发布《Agent评测白皮书》系列首篇:Agent评测全览
美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。
美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。
Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。
推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。
Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。
Google AI 作者 Tilde A. Thurium 与 Annie Wang 对谈,讲解 Loop Engineering 即构建智能体系统反复迭代直到达成可度量目标的四种常见失效模式及修复方法。
Google Developers Blog 发布关于 AI 编码 Agent harness 工程的实践文章,主张用行为评估补充 Terminal-Bench、SWE-bench 等端到端基准。
推荐理由:Google 团队分享用行为评估迭代和守护 AI 编码 Agent 的方法,给出可复用的三步测试循环与示例代码。
Baseten 优化了 pyannote 最新的开源模型 Community-1 与闭源模型 Precision-2,长音频延迟最高提升 9.6 倍,Precision-2 吞吐量提升 3.2 倍。
卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。
推荐理由:作者基于烧完两个200刀会员的第一手使用体感,给出推理等级的通俗解释和分档位省Token的具体用法。
Together AI 发布深度解析文章,介绍开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由 Model、Inference、Gateways、Harness、Tools 组成的 MIGHT 框架。
推荐理由:原文给出开放权重模型编码栈的分层框架,读者可据此按任务选模型、按价格选供应商并保持工作流稳定。
OpenRouter 发布教程,演示通过 API 向 google/gemini-3.1-flash-image(即 Nano Banana 2)发送源图和文本指令完成图像编辑,编辑结果以 base64 形式在响应中返回。教程给出 Python 和 TypeScript 示例、提示词写法、多轮小步编辑方法,以及更换模型只需改一个字段,并介绍了 Nano Banana 系列四个成员的价格与质量差异。
推荐理由:原文给出完整可运行的图像编辑请求代码和提示词写法,读者可以照搬并把模型换成其他供应商做对比。
作者发布一个基于 Transformers.js 的 LLM 注意力可视化工具,可悬停查看生成 token 依赖的历史 token,代码开在 GitHub。可视化将所有层、所有注意力头的注意力权重乘以 value 向量模长后聚合为单一数值控制透明度,并预生成提示词避免下载数百 MB 模型;作者还通过修改 onnx 文件暴露内部值,上传到自己的 Hugging Face 仓库供浏览器生成使用。
GitHub 上的 i-have-adhd 项目提供一个 skill,用于防止编码智能体把最终答案深埋在输出里。该项目经由 Hacker News 热门讨论传播,HN 获得 101 分。
LangChain 发布博客,介绍 deepagents 中的 context modes 如何帮助子智能体分叉 supervisor 的上下文或以隔离方式启动,从而让多智能体工作更快、更省、更聚焦。
Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。
推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。
Anthropic 团队文章指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 三个手段可在不牺牲性能的情况下降低成本。
推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
IBM Research 联合 Red Hat、Google 的开源项目 llm-d 展示在 544 块 NVIDIA H100 GPU 上部署 753B 参数的开放权重 MoE 模型 GLM-5.2(约 39B 激活),在数百到 3000 个并发编码智能体负载下峰值输出超 6.6M tokens 每分钟,零抢占。
Katie McLaughlin 在 Google AI 的 AI 评测系列最终篇中,介绍如何将 Inspect AI 评测的 CSV 数据接入 Data Studio,通过克隆 Master Dashboard Template 并绑定 Google Sheets 数据源,约 30 秒完成无代码交互式仪表盘搭建。
作者数字生命卡兹克发布GPT-6 Astra操控Blender的小白教程,介绍前期安装、官方MCP与Computer Use插件配置,并实测三种玩法。Computer Use花约4小时搭出天坛祈年殿,但耗掉200美刀Pro会员近半额度;MCP更快,可完成摩托车建模与组装动画,但复杂任务会单次运行超时,可拆分步骤或用CLI执行Python脚本解决。
推荐理由:作者实测了Computer Use、官方MCP和CLI三种方式并给出各自的速度、成本与适用边界,方法可直接照做。
vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。
推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。
ByteByteGo 发表长文,系统讲解 LLM 应用如何处理错误与故障。文章指出 LLM 应用除网络超时、429 限流、401/403 认证失败、上下文窗口超限等技术故障外,还面临幻觉、输出非法 JSON、工具误调用等语义故障,需将错误分为瞬时、永久、语义三类再对症处理。
作者分享只用手机远程操控Agent跑任务的新工作流,核心工具是UU远程,出门不再随身背1.62kg的MacBook。文中介绍终端完整支持TUI,可正常操作Claude Code、Codex等Coding Agent,多终端会话可并行;支持手机与电脑双向跨端接管,任务进度和运行状态可保留。
Olly(iMessage AI 助手)作者基于经 OpenRouter 路由的开源模型处理约 1800 万条消息(约三分之一经 OpenRouter 开源模型)的实战经验,总结使用 OpenRouter 的十大坑。
作者实测 GPT-6 Astra 的电脑自动化、3D 和剪辑能力。外置键盘快捷键配置 41 秒一次成功,Blender 海盗船不到 10 分钟完成且给出逐部位生成逻辑,还用关键帧做出 3D 镜头移动视频和星球状的马里奥 3D 游戏关卡。真人口播剪辑经三次修改达到可发布标准,附完整剪辑提示词;PPT 二次美化评定为 6 到 7 分;UI 设计对比仍不及 Claude Fable 5.1。
Simon Willison 分享在 Mac 上用 ChatGPT Codex 搭配 Blender 的玩法:从 blender.org 安装完整 Mac 应用后,用提示词让 agent 调用 /Applications/Blender 渲染一只骑自行车的鹈鹕场景。他随后用两条追加提示词添加背景和装饰,最终图片由 Blender 的 Python API 生成。
OpenAI 在模型文档中说明 GPT-6 Astra 相比 GPT-5.6 Sol 更常提出澄清问题、对上下文更敏感,并给出让模型更主动、审计 AGENTS.md 等技能文件、控制写作风格、约束子智能体委派和测试规模的提示词建议。
推荐理由:原文汇总了 OpenAI 官方文档中针对 GPT-6 Astra 的提示词建议和 slop 词屏蔽清单,开发者可直接迁移到自己的提示词写法。
作者在 Claude Code 中用 Spotify Portal 的 AiKA Modes 搭建模型路由,把批量读文件和样板代码生成委派给 Gemini 2.5 Flash,bulk-read 场景平均节省约 90% token。
DogeDesigner 提醒用户可以为每个 Grok Bot 设置自定义头像:点击你的 Bot,点按头像,然后从相册中选择。作者展示了自己给营销、内容、设计、开发等不同 Bot 设置的狗狗头像。
BestBlogs 09-05 早报精讲三篇实践文章。freeCodeCamp 沿用 Anthropic 的 AI 原生 SDLC 框架,把研发拆为 Plan。
Databricks 发文介绍如何通过专用 GPU kernel 生成实现极高效率。文章指出传统生产推理系统依赖通用 kernel 处理多样化负载,并探讨专用 kernel 的优化路径。
Databricks 官方博客介绍营销团队使用 Genie One 的五种方式,指出营销团队手头已有campaign 表现指标和客户数据等数据资产,可用 Genie One 加以利用。
作者分享了让自家 AI 助手 Olly 自行处理客服的实现方法,整套流程用不到 500 行 TypeScript 完成。智能体通过 sendSupportRequest 工具把用户问题连同近期对话写入反馈集合、用 iMessage 通知团队,并经管理端点回复,回复作为合成轮次由智能体翻译成用户语言转达,引用文本被视为内容而非指令以防提示词注入。