跳到正文

#教程/实践

今日 3 条
9月10日周四
  1. 公众号:龙猫LongCat(美团)60

    美团龙猫LongCat发布《Agent评测白皮书》系列首篇:Agent评测全览

    美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。

  2. Hugging Face:Blog(RSS)61

    Hugging Face 用 LoRA 与 Storage Bucket 在 HF Jobs 上跑异步 GRPO,免 NCCL 并提速 3.9 倍

    Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。

    推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。

  3. Mistral AI:News(网页)63

    Mistral 复盘用 AI Agent 将 40,000 行 Fortran 77 迁移到 C++ 的方法与教训

    Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。

    推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。

9月9日周三
  1. 公众号:数字生命卡兹克70

    GPT-6 Astra推理等级怎么选才最省Token

    卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。

    推荐理由:作者基于烧完两个200刀会员的第一手使用体感,给出推理等级的通俗解释和分档位省Token的具体用法。

  2. Together AI 研究与产品博客(RSS)68

    Together AI 深度解析开源模型 AI 编码栈 MIGHT

    Together AI 发布深度解析文章,介绍开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由 Model、Inference、Gateways、Harness、Tools 组成的 MIGHT 框架。

    推荐理由:原文给出开放权重模型编码栈的分层框架,读者可据此按任务选模型、按价格选供应商并保持工作流稳定。

  3. OpenRouter:Announcements(RSS)64

    OpenRouter 教程:用代码调用 Nano Banana 2 编辑图像

    OpenRouter 发布教程,演示通过 API 向 google/gemini-3.1-flash-image(即 Nano Banana 2)发送源图和文本指令完成图像编辑,编辑结果以 base64 形式在响应中返回。教程给出 Python 和 TypeScript 示例、提示词写法、多轮小步编辑方法,以及更换模型只需改一个字段,并介绍了 Nano Banana 系列四个成员的价格与质量差异。

    推荐理由:原文给出完整可运行的图像编辑请求代码和提示词写法,读者可以照搬并把模型换成其他供应商做对比。

  4. Hacker News:AI 热帖53

    作者发布浏览器端 LLM 注意力权重可视化工具

    作者发布一个基于 Transformers.js 的 LLM 注意力可视化工具,可悬停查看生成 token 依赖的历史 token,代码开在 GitHub。可视化将所有层、所有注意力头的注意力权重乘以 value 向量模长后聚合为单一数值控制透明度,并预生成提示词避免下载数百 MB 模型;作者还通过修改 onnx 文件暴露内部值,上传到自己的 Hugging Face 仓库供浏览器生成使用。

  5. Claude:Blog(网页)67

    Anthropic 发布 Claude Platform 降本指南并更新 claude-api 技能

    Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。

    推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。

9月8日周二
  1. 公众号:数字生命卡兹克76

    GPT-6 Astra操控Blender保姆级教程:三种玩法与踩坑实录

    作者数字生命卡兹克发布GPT-6 Astra操控Blender的小白教程,介绍前期安装、官方MCP与Computer Use插件配置,并实测三种玩法。Computer Use花约4小时搭出天坛祈年殿,但耗掉200美刀Pro会员近半额度;MCP更快,可完成摩托车建模与组装动画,但复杂任务会单次运行超时,可拆分步骤或用CLI执行Python脚本解决。

    推荐理由:作者实测了Computer Use、官方MCP和CLI三种方式并给出各自的速度、成本与适用边界,方法可直接照做。

  2. vLLM 官方博客(RSS)63

    vLLM x AgentX:面向真实世界智能体推理服务的全栈优化

    vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。

    推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。

9月7日周一
9月6日周日
  1. 公众号:卡尔的AI沃茨75

    GPT-6 Astra 实测:改硬件、Blender 3D、自动剪辑与PPT一篇跑完

    作者实测 GPT-6 Astra 的电脑自动化、3D 和剪辑能力。外置键盘快捷键配置 41 秒一次成功,Blender 海盗船不到 10 分钟完成且给出逐部位生成逻辑,还用关键帧做出 3D 镜头移动视频和星球状的马里奥 3D 游戏关卡。真人口播剪辑经三次修改达到可发布标准,附完整剪辑提示词;PPT 二次美化评定为 6 到 7 分;UI 设计对比仍不及 Claude Fable 5.1。

9月5日周六
  1. The Decoder:AI News(RSS)78

    OpenAI 发布 GPT-6 Astra 提示词指南,含 slop 词屏蔽清单

    OpenAI 在模型文档中说明 GPT-6 Astra 相比 GPT-5.6 Sol 更常提出澄清问题、对上下文更敏感,并给出让模型更主动、审计 AGENTS.md 等技能文件、控制写作风格、约束子智能体委派和测试规模的提示词建议。

    推荐理由:原文汇总了 OpenAI 官方文档中针对 GPT-6 Astra 的提示词建议和 slop 词屏蔽清单,开发者可直接迁移到自己的提示词写法。

  2. Greg Brockman54

    Greg Brockman 转发 Greg Isenberg 整理的 9 个 GPT 6 Astra 提示词,定位为个人和工作生活助手。提示词涵盖谈判账单、把服务商业务转化为 AI 软件产品、监控二手市场低价商品、生成一人公司周度经营仪表盘、审计公司智能体机会、浏览器操作并输出 SOP、夜间自动化 QA 截图、订阅竞品并出月报、以及构建带获客入口的浏览器小游戏等场景。

  3. Mohamed Moustafa 技术博客(网页)63

    如何让 Olly 智能体自己处理客服工单

    作者分享了让自家 AI 助手 Olly 自行处理客服的实现方法,整套流程用不到 500 行 TypeScript 完成。智能体通过 sendSupportRequest 工具把用户问题连同近期对话写入反馈集合、用 iMessage 通知团队,并经管理端点回复,回复作为合成轮次由智能体翻译成用户语言转达,引用文本被视为内容而非指令以防提示词注入。