OpenAI 解析 Basis、Clay、Exa 如何把工作流变成 AI 原生运营能力
OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。
OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。
作者转述 LatchBio 对主流 AI 模型的生物安全基准测试结果,称 Grok 4.6 整体表现最强,在全部参测前沿模型中排名第一,是唯一在安全性和有用性两项均超过 50% 的模型。
Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills 设计评测的方法,主张像写单元测试一样建立结构化、自动化的评测流程,而非在终端做 vibe testing。
xAI 发布 LatchBio 对 Grok 4.6 生物能力的独立分析,涵盖 BioSecBench-Refusal 与 BioSecBench-Surveillance 两套基准。
Eric Zakariasson 转发并摘要 lingxi 的文章,介绍其用一组 grok bot 组成工程团队来开发 grok bot 的做法。
Replit 官方发布直播预告,主题为在 Replit 中构建一个个性化邮件助手,直播深度解析链接为 https://x.com/i/broadcasts/1oKMvNLkEjpGQ。
OpenRouter 官方分享一条使用技巧:可在其基准浏览器(benchmark explorer)中浏览图像模型,并在 Agent 或 Chatroom 中快速编辑提示词。
Tessl 设计师复盘在 agent 软件工厂 Kikimora 中把品牌与设计规则编入 AI 工作流的方法,指出设计系统只提供组件、教不会构图。
推荐理由:作者给出从 Figma diff 反推设计规则、再以技能和全量扫描落地的可复用路径,可迁移到任何用 agent 生产界面的团队。
ByteByteGo 发布长文,讲解如何在大语言模型不明显变笨的前提下缩小模型体积。文章以 70B 参数模型约 140 GB、消费级显卡仅 24-48 GB 显存的矛盾为切入点。
Databricks 发布博客,讲解如何在数据栈中落地 Genie Ontology,为 AI 智能体构建超越语义模型的共享业务上下文。
可灵(Kling AI)发布官方教程,讲解如何使用 Kling MCP 中的 Elements 功能在不同镜头之间保持角色身份一致,从而创作更具连贯性的 AI 生成故事。
Discovery Bank 通过行为 AI、治理化数据和实时决策,在满足规模、速度与安全要求的同时让每个客户交互都具备个性化体验。文章介绍了该银行实现大规模超个性化银行服务的具体方法。
AlgorithmWatch 借助欧盟 DSA 第 40(12) 条的研究数据访问权限,对德国东部三场选举相关搜索运行 4480 次查询并分析 Google 的 AI Overviews。
Futurism 测试发现,Google AI Overviews 对用户称与非洲、印度或巴基斯坦裔独处的提问会建议报警或前往安全地点,对英国人则建议喝茶聊天气。Reddit 用户首先发现差异,Google 承认结果不符合其标准并称触发词是 alone,修复后国籍类提问恢复正常,但询问与来自 Facebook 的人独处时仍会建议离开并拨打 110。
Hacker News 热帖分享一篇博客文章,作者称以 67 美分的成本在 ARC-AGI-1 上取得 44% 的得分。该帖获得 122 个 HN Points,完整方法细节需查看原文链接 https://mvakde.github.io/blog/44-on-arc-1。
小红书与NVIDIA联合构建GR-Inference,一个面向长Context、短Decode、大Beam的生成式召回专用推理引擎,覆盖KV抽象、连续批处理、专用Decode Attention、受限生成与CUDA Graph等优化。
Google AI 的 AI Evals 系列第三篇介绍用 tocsv.py 脚本通过 pandas 把 Inspect AI 评测日志转换为适合 Google Sheets 的 CSV。
Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。
推荐理由:Epoch AI 汇总多方审计数据并给出 Flawed 判定,读者可据此决定是否还把 SWE-Bench Pro 当作可信的编码评测依据。
vLLM-Omni 团队发布 MiniMax H3 生产级服务实践,先做系统级优化,再集成 FastVideo 的四步 FastH3 蒸馏学生模型,将去噪循环从 49 次 DiT 前向降到 4 次。
OpenClaw 官方发推提示用户可以将 Google DeepMind 的 Flash 3.7 接入 OpenClaw 使用,并引用了 @_philschmid 的一篇文章作为说明来源。
作者在做 post training 内容的过程中一路回溯,决定从 tokenizer 开始讲起。他认为要做好内容,需要把复杂的概念用最简单的语言和最直观的视图表达出来,并附有讲解视频。
作者分享如何用 3 个现有监控摄像头的麦克风运行 BirdNet-Go,实现 24/7 本地鸟类声音识别,无需云服务和订阅费用。系统支持 RTSP 流、Google Perch v2 模型可识别 14,795 个物种、按物种设置 Discord 通知、新物种追踪、BirdWeather 数据共享,并可通过 MQTT 接入 Home Assistant,还能识别蝙蝠和青蛙。
一份 ChatGPT 工作工具与技能参考文档上线,汇总了相关工具与技能的使用说明。该参考面向开发者与进阶用户,便于快速查阅 ChatGPT 工作场景中的功能配置。文档以站点形式发布,供社区参考使用。
Every 发布文章,作者分享了参加 15 小时 Anthropic 认证培训后的学习收获。正文未提供更多细节。
Artificial Analysis 评测 Claude Fable 5.1,其以 66 分登顶 Artificial Analysis Intelligence Index,超过 Claude Opus 5(63)、Fable 5(62)、GPT-5.6 Sol(61)和 Grok 4.6(61)。
推荐理由:Artificial Analysis 实测了 Claude Fable 5.1 的智能指数、各基准得分与每任务成本,读者可据此权衡其相对 Opus 5 和 GPT-5.6 的性价比。
NVIDIA 技术博客发布一套 AI 推理 GPU 规模规划框架,围绕用例、token 模式、TTFT 等延迟指标、并发、缓存命中率、模型选择和部署策略给出 sizing 方法,并提出 core-and-flex 容量策略平衡 capex 与 opex。