Anthropic 官方宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1 两款新模型。官方称它们是编码和知识工作领域最先进的模型。
#编码
#编码
今日 0 条
Claude@claudeaiAI 评分5151Claude Platform:开发者版本说明(RSS)精选AI 评分7272 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。
推荐理由:官方版本说明给出定价、缓存和 API 兼容性变化,开发者可据此评估迁移成本与新特性用法。
Claude Code:GitHub Releases(RSS)AI 评分3939 Claude Code v2.1.257 发布,默认模型改为 Claude Fable 5.1
Claude Code 发布 v2.1.257,新增 Claude Fable 5.1(claude-fable-5-1)并将其设为默认 Fable 模型,提供 1M 上下文,价格为 $10/$50 per Mtok,缓存读取 $0.25/Mtok。
Replit ⠕@ReplitAI 评分3232OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分4646 OpenAI 解析 Basis、Clay、Exa 如何把工作流变成 AI 原生运营能力
OpenAI 发布文章,介绍 Basis、Clay 和 Exa Labs 用 Agent 承接员工入职、账户管理和开发者集成的工作流。Basis 把入职从 2 小时缩短到 30 分钟,Clay 的子智能体每天夜间更新各账户上下文,为销售省下约 1 小时邮件分拣,Exa 用 Codex 监控集成机会并创建 PR、跑测试。文章还给出企业从试点到规模化的六步方法。
Google AI:DEV 作者专属(RSS)AI 评分5757 Google 员工分享如何设计可信的 AI 评测的五条规则
Google Developer Relations 团队的 Jan-Felix Schmakeit 介绍为 Google 产品的 Agent Skills 设计评测的方法,主张像写单元测试一样建立结构化、自动化的评测流程,而非在终端做 vibe testing。
Google DeepMind精选AI 评分8080 Gemini 3.8 Flash 发布,网络安全版本限定防御团队使用
谷歌推出 Gemini 3.8 Flash,升级编码、推理和长程智能体任务,并接入开发平台及部分付费消费入口。另一个 Flash Cyber 版本只向获准的防御团队开放;普通版本的优惠价格有截止日期,更高推理强度也可能增加用量。
推荐理由:通用版本与安全专用版本采用不同开放范围,团队可以同时比较日常任务能力、推理成本和受控访问条件。
Z.ai@Zai_orgAI 评分2929公众号:百度智能云(文心)AI 评分3434 百度千帆Token Plan企业版更新:DeepSeek-V4-Pro-0813与GLM-5.3等三款模型上线并接入百度搜索工具
百度千帆Token Plan企业版更新,DeepSeek-V4-Pro-0813正式版与GLM-5.3、GLM-5.3-Flash三款模型上线,原有模型ID可直接调用。百度搜索工具正式接入,专属API-KEY即可调用,限时优惠每次2.5积分。Token福利包扩展覆盖语音、OCR、智能文档分析等AI开放能力,席位扩展为四档并有限时赠送积分、夜享Token低至2折等活动。
Epoch AI:研究、数据与评测精选AI 评分6767 Epoch AI 评审 SWE-Bench Pro:超 20% 任务存在评分缺陷,判定为 Flawed
Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。
推荐理由:Epoch AI 汇总多方审计数据并给出 Flawed 判定,读者可据此决定是否还把 SWE-Bench Pro 当作可信的编码评测依据。
Tomer Tunguz 博客(VC 分析)AI 评分5858 Tomer Tunguz:AI 提效不是减少人力,而是抬高同等投入的产出上限
Tomer Tunguz 根据自己十篇已发布文章的数据提出,AI 自动化了机械性写作工作,但并未减少人力投入,而是抬高了同等工作的产出上限。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3737 Polimill 基于 OpenAI 技术打造日本公共 AI 基础设施 QommonsAI
Polimill 基于 OpenAI 技术构建公共部门生成式 AI 平台 QommonsAI,2024 年 10 月发布,目前日本约 1,050 个自治体和约 55 万名公务员在使用。
Replit ⠕@ReplitAI 评分2727
OpenAI Developers@OpenAIDevsAI 评分3434OpenAI Developers 发布 8 月开发者月度盘点,涵盖 Codex 在平台、浏览器和协作工作流上的扩展,以及 Computer History 在 EEA、英国和瑞士的推出。
Claude Code:GitHub Releases(RSS)AI 评分2626 Claude Code v2.1.252 发布,修复 Bash 报错、always allow 未保存等多项问题
Claude Code 发布 v2.1.252,修复多项问题:部分 Mac 上 Bash 命令报 task output swap refused 错误、无 .claude/settings.local. 的项目中 always allow 不保存。
Google DeepMind精选AI 评分7878 Google 发布 Gemini 3.7 Flash,面向编码与智能体并降价一半
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本变化。
Microsoft Research精选AI 评分7171 微软研究院开源 Orchard:可扩展智能体 AI 框架
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理三类智能体任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的可行路径。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:Google 把轻量 Flash 微调成专用安全模型,并给出 CyberGym 与 Chrome 流水线的实测对比,可看专用小模型在漏洞挖掘上的取舍。
Google DeepMind精选AI 评分8888 Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位面向智能体与编码的前沿性能,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:Gemini 3.5 Flash 的基准成绩、速度与开放渠道一并给出,可据此判断智能体与编码任务的成本变化。
Google DeepMind精选AI 评分7878 Google DeepMind 汇总 AlphaEvolve 一年成果:从 TPU 设计到企业优化
Google DeepMind 发布 AlphaEvolve 一年进展汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计、发现更高效的缓存替换策略,并将 Spanner 的写放大降低 20%。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,含 TPU 电路、Spanner 与多家企业优化数据,可看编码智能体的实际边界。