#编码
#编码
今日 1 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分3535
Frank Wang 玉伯@lifesingerAI 评分2222
DogeDesigner@cb_dogeAI 评分2828IT之家(RSS)AI 评分6161 月之暗面宣布 Kimi API 原生支持 Codex 和 Claude Code
月之暗面宣布 Kimi API 已支持 OpenAI 的 Responses API 格式(base_url 为 https://api.moonshot.cn/v1)和 Anthropic 的 Messages API 格式(base_url 为 https://api.moonshot.cn/anthropic)。
凡人小北@frxiaobeiAI 评分7272Cognition(Devin 开发商)准备以 470 亿美元估值融资约 10 亿美元,据 Bloomberg 其年化收入已超 9 亿美元,本轮融资收到接近 100 亿美元的投资意向。
公众号:卡尔的AI沃茨AI 评分7474 实测 Claude Fable 5.1:长时 Agent 任务与浏览器自动化表现突出
作者实测 Anthropic 新发布的 Claude Fable 5.1,认为其在长时间 Agent 任务和浏览器自动化上超过 GPT 5.6。
IT之家(RSS)AI 评分5757 Arena 第 35 周 AI 大模型周榜:GLM-5.3-Flash 首秀进代码榜前十,Qwen3.8-Max-0902 登顶前端榜
Arena 平台发布 2026 年第 35 周(8 月 24 日至 8 月 30 日)AI 大模型盲测排行榜。智谱 GLM-5.3-Flash 首次入榜即列代码榜第 7 名(ELO 1535),阿里 Qwen3.8-max-0902 首次入榜以 1691 分登顶前端开发榜,将 Claude-Opus-5-Max 挤到第二。
Rohan Paul@rohanpaul_aiAI 评分5252Simon Willison 博客AI 评分6060 Paint.NET 作者 Rick Brewster 谈用 Claude 重写 Direct2D 使软件可运行于 WINE
Simon Willison 引述 Paint.NET 作者 Rick Brewster 的话:Direct2D 一直是 Paint.NET 在 WINE 上运行的最大障碍。
OpenCode@opencodeAI 评分3131公众号:千问APP(阿里)AI 评分2323 千问AI眼镜正式接入Qoder,支持从想法到代码实现
千问APP官方宣布Qoder正式接入千问AI眼镜,覆盖从一句想法到需求梳理、代码实现与项目推进的场景,主打灵感出现时随时开始创造。原文仅提供宣传性口号,未给出具体功能细节。
IT之家(RSS)AI 评分4949 智谱入驻天猫开设官方旗舰店,GLM Coding Plan 月付 118 元起可直接网购
智谱正式入驻天猫开设“智谱旗舰店”,上架基于 GLM-5.3 的 GLM Coding Plan 订阅套餐,适配 ZCode、Claude Code、Codex 等 20 余款主流 Agent。
Meituan LongCat@Meituan_LongCat精选AI 评分6868推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
Yuchen Jin@Yuchenj_UWAI 评分4646PromptArmor:Threat Intelligence精选AI 评分6969 PromptArmor 分析 30 天 Claude Code 遥测数据:4% 的会话占 65% 的开销
PromptArmor 基于一个十人团队 30 天的 310,009 条 OTel 遥测事件分析 Claude Code 和 Cowork 的安全与成本。
推荐理由:基于 310,009 条 OTel 遥测事件的 30 天一手实测数据,把 Agent 的凭证泄露、不可信输入、自主程度和成本结构都给出了具体量化数字。
Rohan Paul@rohanpaul_aiAI 评分4444论文提出 AgentFold,将折叠模型开发建模为对可执行代码变体的闭环智能体树搜索。智能体从紧凑的 ESMFold 衍生模型出发,提出架构修改、实现调试、运行训练,并记录成败经验决定分支算力分配。
公众号:数字生命卡兹克精选AI 评分6565 UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验
UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。
推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。
Anthropic:Newsroom(网页)精选AI 评分8787 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。
推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。
IT之家(RSS)AI 评分6969 阿里千问发布 Qwen3.8-Max-0902 版本,登顶 CodeArena 前端编程总榜
阿里千问宣布 Qwen3.8-Max 升级到 0902 版本,围绕编程和专业办公进行后训练,CodeArena 前端编程总榜提升 22 分至 1691 分夺得冠军。
HuggingFace Daily Papers(社区热门论文)AI 评分5959 Harness-of-Harness 论文提出多天自主软件开发框架,平均相对提升 52.25%
论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在无人工干预的自主开发中持续改进软件。HoH 运行在现有 coding-agent harness 之上,将执行组织为规划-编码-测试的迭代循环,平衡修复与能力增长,并把开发拆成小而可验证的增量。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 SMELT:算力匹配下 MoE 循环 Transformer 的缩放律研究
论文提出 SMELT(Sparse MoE Transformer,中段层循环两次)配方,在逐 token FLOPs、非嵌入参数量和 KV cache 三项预算均匹配的条件下研究循环 Transformer。
Ethan Mollick@emollickAI 评分3232
Qwen@Alibaba_Qwen精选AI 评分6969推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。
Rohan Paul@rohanpaul_aiAI 评分6666
Qwen@Alibaba_QwenAI 评分6363IT之家(RSS)AI 评分4848 谷歌 Gemini 3.8 Flash(内部代号 Skimaki)最快周三上线,编程能力对标 OpenAI 与 Anthropic
据《华尔街日报》9 月 1 日报道,谷歌将发布编程能力大幅升级的 Gemini 3.8 Flash,内部代号 Skimaki,最早当地时间周三上线。内部工具 Jetski 对比测试中工程师对其偏好超过 Anthropic 的 Opus 模型,编程方面显著缩小了与 Anthropic 和 OpenAI 的差距。
Berkeley RDI:Blog(AI 安全与评测)AI 评分5454 UC Berkeley 等发布 Vero 基准:检验 AI 智能体能否构建形式化验证的完整软件仓库
UC Berkeley 联合多机构发布 Vero 基准,首个要求智能体在仓库级同时写实现与形式化证明,含 43 个 Lean 4 多模块实例、743 个 API 和 2,705 条形式化规范。
Qwen@Alibaba_QwenAI 评分6666
凡人小北@frxiaobeiAI 评分5656
ginobefun@hongming731AI 评分4949
ginobefun@hongming731AI 评分3535
Thariq is on vacation@trq212AI 评分7171Simon Willison 博客AI 评分7070 Simon Willison 用 pelican 基准实测 Claude Fable 5.1 的五个推理档位
Simon Willison 实测 Claude Fable 5.1 在 pelican 基准上的表现。Anthropic 称该模型在 Terminal-Bench-Science 0.1 上得 52.6%,高于 Fable 5 的 24.7%。
🚨 AI News | TestingCatalog@testingcatalogAI 评分4545
dex@dexhorthyAI 评分3737Claude Code:GitHub Releases(RSS)AI 评分2727 Claude Code v2.1.258 发布,修复 macOS 12 启动失败等问题
Claude Code 发布 v2.1.258,修复了 2.1.255 引入的 macOS 12(Monterey)无法启动的回归问题。同时修复远程和定时会话在重新发送权限批准无法应用后报 "user messages must have non-empty content" 错误的问题。
The Verge:AI(RSS)AI 评分7676 Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,称智能体任务最高便宜 45%
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,回应客户对价格、数据保留和过度安全限制的批评。Fable 5.1 性能强于 Fable 5,通常便宜约 25%,复杂智能体任务因缓存数据降价最高便宜 45%,现已在所有平台可用;Mythos 5.1 仅向 Project Glasswing 参与者开放。
IT之家(RSS)AI 评分8585 Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75%
Anthropic 于当地时间 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者基于同一基础模型,安全防护等级不同,Mythos 5.1 仅向经审核的网络安全和生命科学机构开放。
Rohan Paul@rohanpaul_aiAI 评分2727
Rohan Paul@rohanpaul_aiAI 评分4545AI/ML API 用同样的提示词对 Anthropic 的 Fable 5.1 和 OpenAI 的 GPT-5.6 Sol 做了一次成型的 Three.js 测试,5 个独立场景组成私岛豪宅项目。