推荐理由:作者分享了用 Claude 测量、调试并提升 claude.ai 性能的具体方法,并附上提示词,读者可参考复用。
#编码
#编码
今日 0 条
ClaudeDevs@ClaudeDevs精选AI 评分5151
ClaudeDevs@ClaudeDevs精选AI 评分6868推荐理由:云会话正式结束预览期,Pro 和 Max 订阅者可领取一次性额度,在本地受限或合盖后仍能继续任务。
ClaudeDevs@ClaudeDevsAI 评分5353Cursor Blog精选AI 评分6161 Cursor 发布 Rollouts 和 Security Reviewer 开发机器人
Cursor 发布两款软件开发机器人 Rollouts 和 Security Reviewer,帮助团队更快把安全可靠的代码送入生产环境。
推荐理由:原文说明了两款机器人的工作机制和可配置动作,读者可以据此评估是否接入自己的部署与安全流程。
Cursor Blog精选AI 评分6161 Cursor 提升 agent 长时运行 token 效率,用户成本降低 7%
Cursor 通过改进 agent harness,在不降低 agent 质量的情况下将用户 token 成本降低 7%。
推荐理由:官方拆解了 agent harness 省钱的具体层级做法,含可复用的工具加载与缓存断点经验。
Fireworks AI(网页)精选AI 评分6666 Fireworks 发布 Ember-1,以约四成更少 token 达到 Kimi K3 质量
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
Arena.ai@arena精选AI 评分7575推荐理由:原文给出真实投票榜单的排名、价格和多分类变化,可以据此比较 GPT-6 Sol 在性能与成本上的位置。
Claude:Blog(网页)精选AI 评分6464 Anthropic 前线工程师分享 AI 驱动代码现代化项目的六步准备方法
Anthropic 在 Notes from the Field 系列中分享管理大型代码现代化项目的经验,称原本需数年的现代化可在数月或数周内完成,瓶颈从写代码转向组织动员。
推荐理由:来自 Anthropic 前线工程师的实战总结,把智能体驱动的代码现代化拆成可落地的六步组织流程。
Arena.ai@arenaAI 评分6161
ClaudeDevs@ClaudeDevsAI 评分6262Artificial Analysis 完整文章(网页)精选AI 评分7878 Artificial Analysis 评测 GPT-6 Sol 和 Luna:价格减半但各项表现有升有降
Artificial Analysis 评测 OpenAI 的 GPT-6 Sol 和 Luna,两模型价格较 GPT-5.6 约减半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token。
推荐理由:Artificial Analysis 用自家指数实测两代模型的成本与表现,读者可据此判断 GPT-6 降价后哪些能力持平或退步。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8282 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。
Arena.ai@arenaAI 评分7474
ChatGPT@ChatGPTAI 评分7777
Artificial Analysis@ArtificialAnlysAI 评分8585Artificial Analysis 完整文章(网页)精选AI 评分8282 Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index
Artificial Analysis 实测 Claude Opus 5.5 在 Intelligence Index 得分 58,为其测得的最高分,并在 Terminal-Bench 4.0 上与 GPT-6 Astra 打平(59.6%)。
推荐理由:原文给出 Claude Opus 5.5 在 Intelligence Index 及各分项评测的完整数据和定价变化,读者可据此比较智能与任务成本。
OpenRouter@OpenRouterAI 评分7272
ClaudeDevs@ClaudeDevsAI 评分7777Claude Code:GitHub Releases(RSS)精选AI 评分6868 Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型
Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)为默认 Opus 模型,支持 1M 上下文,价格为 $4/$20 per Mtok、缓存读取 $0.20/Mtok;同时将 Pro 和 Team Standard 计划的默认模型从 Sonnet 改为 Opus。
推荐理由:官方更新日志详列了新增 Opus 5.5 默认模型、价格与大量修复,开发者可据此判断是否升级及对现有工作流的影响。
Claude:Blog(网页)精选AI 评分7171 Anthropic 详解 Opus 5.5 上一次 Claude Code 任务的成本构成
Anthropic 官方博客拆解 Claude Code 任务在 Opus 5.5 上的成本构成,轮次、缓存读取、输出 token 和模型选择决定账单,Opus 5.5 API 输入输出每百万 token 降价 20%、缓存读取降 60% 至 $0.20。
推荐理由:原文把一次任务的 token 成本拆成轮次、缓存、输出和模型选择四项,并给出 effort 设置与缓存维护的可迁移省钱方法。
Anthropic:Newsroom(网页)精选AI 评分9191 Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%
Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。
推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。
StepFun@StepFun_aiAI 评分5757
Xiaomi MiMo@XiaomiMiMoAI 评分5858
Arena.ai@arenaAI 评分6666Artificial Analysis 完整文章(网页)精选AI 评分6868 Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4
Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。
推荐理由:评测方给出 Grok 4.7 在多项基准的具体分数、token 消耗与对比对象,读者可据此判断其真实水平与成本。
Linear:Now(RSS)精选AI 评分6262 Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟
Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。
推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。
Artificial Analysis@ArtificialAnlysAI 评分6666
OpenRouter@OpenRouterAI 评分6363
xAI:News(网页)精选AI 评分7474 xAI 发布 Grok 4.7,主打编码与知识工作
xAI 发布 Grok 4.7,定位为其最强编码与知识工作模型,定价 $2/百万输入 token、$6/百万输出 token,与 Grok 4.6 同价同速,另有速度和价格加倍的快速变体。
推荐理由:官方给出了完整定价、速度和多项基准对比,读者可以据此把 Grok 4.7 放进现有模型选型里横向比较。
Arena.ai@arenaAI 评分5656公众号:月之暗面(Kimi)精选AI 评分7171 Kimi 发布 Kimi Code Desktop 1.0,macOS 与 Windows 版同步上线
Kimi(月之暗面)发布 Kimi Code Desktop 1.0,作为 Kimi Code 官方桌面客户端,macOS(Apple 与 Intel 芯片)和 Windows 版同步上线,下载地址为 kimi.com/code。
推荐理由:官方发布 Kimi Code Desktop 1.0,覆盖安装方式、Agent 模式与开发工作流细节,读者可了解它相对 CLI 的界面与协作变化。
Fireworks AI(网页)精选AI 评分6161 Fireworks AI 分析:前沿不是单个模型,而是路由器,FireRouter 发布
Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。
推荐理由:原文用 DeepSWE 上 18 个模型的任务级实测数据说明模型池组合的潜力,同时坦承从 oracle 到可落地路由的差距。
公众号:腾讯混元AI 评分5151 腾讯混元联合清华北大发布 WebCraftBench,用软件测试方法评测 AI 网页生成
腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。
StepFun@StepFun_aiAI 评分6060公众号:阶跃星辰(Step)精选AI 评分6666 阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
推荐理由:官方完整公布架构参数、基准成绩和权重开放时间,读者可据此评估其在开源主力模型中的成本能力位置。
Tessl:产品与工程博客精选AI 评分6363 Tessl 博客:AI 智能体评估应从证据开始,用 35 万行 Rust 复刻 S3 的实践复盘
Tessl 博客复盘前 Docker CTO Justin Cormack 在 AI Native DevCon London 的演讲,分享用 AI 构建约 35 万行 Rust 的 S3 兼容对象存储的经验。
推荐理由:作者用 35 万行 Rust 复刻 S3 的实测经历,总结出测试先知、覆盖率陷阱、flaky 测试纪律和追踪等一套可迁移的 AI 智能体评估方法。
MiniMax (official)@MiniMax_AIAI 评分5656MiniMax 官方宣布 MiniMax Code CLI 现已开放,仓库地址为 https://github.com/MiniMax-AI/minimax-code。
公众号:MiniMax(稀宇科技)AI 评分5858 MiniMax Code CLI v0.4.12 以 MIT 协议正式开源
MiniMax 宣布 MiniMax Code CLI v0.4.12 面向全球开发者开放,并以 MIT 协议开源源码,称其为 MiniMax Code 客户端的核心组件。
Trail of Bits:AI安全研究精选AI 评分6868 Trail of Bits 用 Agent 为 Miden zkVM 审计自建 LSP、反编译器和 Lean 形式化证明
Trail of Bits 在审计 Miden zkVM 前,让 Agent 用六个月从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean VM 执行器模型。这些工具发现了可让恶意 prover 伪造 Falcon 签名盗取资金的高危漏洞,静态分析定位了 400 多处类型验证缺陷,Lean 工作产出 95 个机器验证的正确性证明,还发现两个单元测试未捕获的细微 bug。
推荐理由:原文给出用 Agent 在审计前自建工具链与形式化证明的完整路径,含真实高危发现,方法可迁移到其他安全审计场景。
Anthropic@AnthropicAIAI 评分5252