跳到正文

#编码

今日 0 条
10月6日周二
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    Z.ai(智谱 AI)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务。Bedrock 提供全托管 API、跨区域推理、提示词缓存和服务层级,支持 OpenAI 兼容的 Responses 与 Chat Completions API 以及 Invoke 和 Converse API。

    推荐理由:GLM 5.3 在 Bedrock 上线,读者可了解其 753B MoE 规格、编码与安全能力及托管接入方式。

  2. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 PR。

    推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此理解 AI 代码审查评测如何贴近真实 PR 分布。

10月3日周六
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作,GitHub 提出三项需要强化的技能

    GitHub 提出 AI 时代开发者需要强化的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文章以添加认证流程为例,说明开发者角色正从逐行实现转向定义问题、审查 AI 输出并做技术决策;并提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型对计划、代码和测试进行评审。

10月2日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:Gemini 4 Argon 的发布信息给出了输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的进展。

9月30日周三
  1. AWS Machine Learning Blog62

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。据 OpenAI,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点,且推理投入更低。

    推荐理由:AWS 官方给出 GPT-6.1 Sol 在 Bedrock 上的能力定位与成本对比,可据此判断智能体工作流的落地方式。

9月29日周二
  1. 公众号:火山引擎30

    零跑汽车与火山引擎合作:TRAE 嵌入全域自研体系,落地本地研发环境

    零跑汽车与火山引擎合作,将 TRAE 嵌入其全域自研体系,在本地安全网络、车规级工程约束和多团队协同环境中落地 AI Coding。TRAE 采用企业专属域名与网络配置接入受限网络,明确代码仅用于当次推理、不用于模型训练,并通过 Spec/Plan、Rules、Skills 约束 Agent 行为。TRAE 企业版还提供可视化数据看板与灵活模型资源管理,支持按团队设置模型权限和用量配额。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)14

    OpenAI 征集 Codex Originals 用户故事

    OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。

  3. Databricks:Blog(RSS)65

    Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

    Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

    推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。

  4. Claude:YouTube(RSS)67

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快超 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。

9月28日周一
  1. Berkeley RDI:Blog(AI 安全与评测)75

    UC Berkeley 团队用 AI Agent 审计 13 个基准,发现 45 个无需解题的满分作弊方案

    UC Berkeley 团队构建全自动 AI Agent 审计 13 个广泛使用的基准,发现 45 个作弊方案,全部基准被评为 critical 风险,共归纳 16 种攻击类型。

    推荐理由:原文给出了13个常用基准的45个作弊方案细节和防范设计原则,读者可以据此检查自己依赖的评测是否可信。

9月26日周六
  1. ClaudeDevs67

    Opus 5.5 每输入和输出 token 比 Opus 5 便宜 20%,缓存读取便宜 60%。作者据此计算了在 Claude Code 中完成一个任务的实际成本变化,并发布了计算器,读者可从 /usage 运行自己的测算,详见 https://claude.dev/blog/what-a-task-costs-on-opus-5-5/。

    推荐理由:原文把 Opus 5.5 的降价幅度换算成 Claude Code 中单个任务的实际成本,并提供计算器供读者自行测算。

9月25日周五
  1. Cognition 模型 / Devin 博客(网页)72

    Cognition 宣布年化收入运行率突破 10 亿美元

    Cognition 宣布年化收入运行率突破 10 亿美元。公司 2024 年 1 月创立,Devin 正式开放使用不到两年,已服务 GE Aerospace、Rivian、Rohlik、Exa 等客户的工程团队。

    推荐理由:官方披露年收入运行率破 10 亿美元,并列出 GE Aerospace、Rivian 等客户,可作了解 Devin 商业化进展的参考。

  2. GitHub Blog64

    GitHub Security Lab 发布 LLM 驱动的 Fuzzing Taskflow,自动完成 C/C++ 项目模糊测试全流程

    GitHub Security Lab 的 Antonio Morales 开源了基于 Taskflow Agent 的 Fuzzing Taskflow,指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖报告并分诊崩溃。

    推荐理由:作者开源了完整的自主模糊测试流水线,并讲清覆盖反馈、结构感知和崩溃分诊的设计取舍,C/C++ 维护者可直接复用。

9月24日周四