#编码
#编码
今日 1 条
lauren@potetoAI 评分5555
OpenRouter@OpenRouterAI 评分6363
Michael Truell@mntruellAI 评分5656
xAI:News(网页)精选AI 评分7474 xAI 发布 Grok 4.7,主打编码与知识工作
xAI 发布 Grok 4.7,定位为其最强编码与知识工作模型,定价 $2/百万输入 token、$6/百万输出 token,与 Grok 4.6 同价同速,另有速度和价格加倍的快速变体。
推荐理由:官方给出了完整定价、速度和多项基准对比,读者可以据此把 Grok 4.7 放进现有模型选型里横向比较。
Arena.ai@arenaAI 评分5656
X.PIN@thexpinAI 评分5454
凡人小北@frxiaobeiAI 评分6060
凡人小北@frxiaobeiAI 评分6161开源项目 figures4papers 提供了一个专门画论文图表的 Skill,可在 Codex、Claude Code、Cursor 中根据数据直接生成柱状图、折线图、雷达图、趋势图等。
公众号:卡尔的AI沃茨AI 评分5252 实测阶跃星辰 Step 5 Preview:网页复刻精度高,还能接 Agent 干活
作者实测阶跃星辰新模型 Step 5 Preview,认为其 UI 能力已追上第一梯队,称较上一模型排名提升 13 名,与 K3 和 Grok 打平,价格约为三分之一。
IT之家(RSS)AI 评分6666 月之暗面发布 Kimi Code Desktop,macOS 和 Windows 版同步上线
月之暗面发布 Kimi Code Desktop 桌面客户端,macOS(Apple + Intel 芯片)和 Windows 版同步上线,下载地址为 kimi.com/code。桌面端提供图形界面管理项目、会话和配置,内置终端、浏览器和 Git 状态查看,支持 Plan、Goal、Swarm 及实验性的 Tower 多 Agent 协作模式,CLI 任务可直接同步到桌面端。
公众号:月之暗面(Kimi)精选AI 评分7171 Kimi 发布 Kimi Code Desktop 1.0,macOS 与 Windows 版同步上线
Kimi(月之暗面)发布 Kimi Code Desktop 1.0,作为 Kimi Code 官方桌面客户端,macOS(Apple 与 Intel 芯片)和 Windows 版同步上线,下载地址为 kimi.com/code。
推荐理由:官方发布 Kimi Code Desktop 1.0,覆盖安装方式、Agent 模式与开发工作流细节,读者可了解它相对 CLI 的界面与协作变化。
MarkTechPost(RSS)AI 评分7171 阶跃星辰发布 Step 5 Preview:600B 总参 27B 激活的 MoE 模型,支持 1M 上下文
StepFun 发布面向智能体工作的新旗舰模型 Step 5 Preview,为稀疏 MoE 架构,总参数约 600B、每 token 激活约 27B,支持 1M token 上下文和文本、图像、视频输入,API 定价为每 1M 输入 token $1.00、输出 $2.70。
IT之家(RSS)AI 评分6767 智谱 ZCode 被“偷传代码”质疑后官宣开源并完成整改道歉
智谱 ZCode 宣布就产品安全问题完成整改并向所有用户道歉,已将 ZCode 开源至 https://github.com/zai-org/ZCode,承诺相关代码数据无留存、未用于模型训练。
Hacker News:AI 热帖AI 评分5858 lethain.com 作者实践软件工厂模式:用 Linear 项目循环驱动 Agent 持续推进目标
Imprint 工程负责人记录了在公司内落地软件工厂模式的实践,核心是 /linear-project-loop 技能,它审计 Linear 项目的目标定义(Notion RFC、Datadog 或 Snowflake 指标),补齐缺失工具后自动增删 issue、处理非阻塞任务并定期重跑循环。
Rohan Paul@rohanpaul_aiAI 评分5555Sierra 与普林斯顿大学推出 τ^τ-bench 基准,把智能体构建模拟成真实客户交付任务,智能体需基于公司记录、客户需求、生产 API、现有代码和预算交付可部署的客服智能体。
Fireworks AI(网页)精选AI 评分6161 Fireworks AI 分析:前沿不是单个模型,而是路由器,FireRouter 发布
Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。
推荐理由:原文用 DeepSWE 上 18 个模型的任务级实测数据说明模型池组合的潜力,同时坦承从 oracle 到可落地路由的差距。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6969 阶跃星辰发布 Step 5 Preview:600B 参数 MoE 旗舰模型,10 月 15 日开放权重
阶跃星辰(StepFun)发布旗舰模型 Step 5 Preview,主打智能体工作,采用稀疏 MoE 架构,总参数 600B、每 token 激活 27B,支持 1M token 上下文窗口和视觉输入。
Hacker News:AI 热帖AI 评分6262 AI 编码拉低代码质量?作者提出七层质量防御方法
作者认为 AI 编码不会必然拉低代码质量,关键在分层管理质量,其团队在把产出提高 2-3x 的同时让 bug 保持稳定甚至减少。
公众号:腾讯混元AI 评分5151 腾讯混元联合清华北大发布 WebCraftBench,用软件测试方法评测 AI 网页生成
腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。
StepFun@StepFun_aiAI 评分6060IT之家(RSS)AI 评分5656 阶跃星辰发布旗舰模型 Step 5 Preview,AA 指数 44 分跻身全球开源模型前三,10 月 15 日开源
阶跃星辰发布旗舰模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识和金融场景,将于 10 月 15 日开源完整权重。
IT之家(RSS)AI 评分6262 中电信发布星辰大模型 Xing4.0-29B-A4B,基于昇腾超节点训练并开源
中电信人工智能科技于 9 月 17 日发布星辰大模型 Xing4.0-29B-A4B,总参数 29B、激活参数 4B,据称是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数大模型。
公众号:阶跃星辰(Step)精选AI 评分6666 阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
推荐理由:官方完整公布架构参数、基准成绩和权重开放时间,读者可据此评估其在开源主力模型中的成本能力位置。
elvis@omarsar0AI 评分5151
DAIR.AI@dair_aiAI 评分5151
The Decoder:AI News(RSS)AI 评分6565 Unity 为 Claude Code 和 OpenAI Codex 推出官方插件
Unity 发布面向 Claude Code 和 OpenAI Codex 的官方插件,由 Unity 团队编写和维护技能,其中 Codex 版本首发 31 个技能,覆盖 UI、2D 图形、URP 渲染管线、音频、导航、物理、内购、多人游戏和本地化。
凡人小北@frxiaobeiAI 评分5454公众号:卡尔的AI沃茨AI 评分7070 用 QBS 三步法把陌生领域书籍提炼成可用的 skill
作者卡尔的AI沃茨分享名为 QBS(Question→Book→Skill)的方法:让 GPT-6 找一本能解决当前问题的书,完整读相关章节后提炼成可直接使用的 skill,并用新任务试跑验证。
IT之家(RSS)AI 评分6767 Claude Code 2.1.277 版本添加支持 AGENTS.md
Anthropic Claude Code 团队工程师 Thariq Shihipar 宣布,2.1.277 版本起为 Claude Code 添加支持 AGENTS.md。
elvis@omarsar0AI 评分5656Simon Willison 博客AI 评分6565 Claude Code 2.1.277 开始支持 AGENTS.md
Thariq Shihipar 宣布 Claude Code 开始支持 AGENTS.md,从 2.1.277 版本起,当文件夹中没有 CLAUDE.md 时,Claude 会查找并使用 AGENTS.md。该支持基于即将推出的 Claude Code mods 自定义机制实现,属于内置 mod,用户也可以自行构建自定义版本的项目指令,mod 源码已公开。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5353
Yuchen Jin@Yuchenj_UWAI 评分6060Hacker News 热门(buzzing.cc 中文翻译)AI 评分5757 danluu:关掉大脑用 LLM 写代码的 meat proxy 模式走不通
作者观察到越来越多人在使用 LLM 时关闭大脑、只当 for 循环肉代理,认为这种方式即使在 2026 年 9 月也产不出能用的软件,且员工这样做最终只会让自己被替代。文中用 Dominion 棋类 AI 对比和多个失效案例说明 agent 在分布外任务上表现远逊于合理的人类判断,并引用 Luke Burton、Thomas Dullien 和 Gary Bernhardt 的观点佐证。
Thariq@trq212AI 评分5555The Verge:AI(RSS)AI 评分6868 三名安全研究员用 Claude Opus 在72小时内入侵 OpenAI 员工账号
三名独立安全研究员(Hacktron 团队)称,用 Anthropic 的 Claude Opus 4.8 和 5 不到72小时就攻入 OpenAI 员工账号,访问了名为 Monorepo 的 GitHub 仓库,但未查看内部代码,只用员工 Codex 账号发送 pull request 证明取得访问权。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7878 ZCode 被曝登录后会打包上传完整 Git 历史
作者称,智谱 AI 编程应用 ZCode 在登录后会将工作区打包加密并上传至阿里云 OSS,内容包括完整 Git 历史、LFS 缓存和全局配置。调查记录中的单个加密快照为 313MB;私钥只存于云端,用户及客户端无法解密本地密文。
a16z:News(RSS)AI 评分5555 a16z 图表周报:AI 让应用数量激增,但下载与收入几乎停滞
a16z 的 Charts of the Week 汇总多组数据指出,AI 代码生成工具推动 iOS、Android 和 Chrome 上每月新增应用翻倍至翻两番,但下载量(iOS 为评分数)基本停滞,达到 10+ 评分或 100+ 下载等 escape velocity 门槛的应用占比大幅下降,作者称之为 App-Slop。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6060 从 Bend 2 看氛围编码的陷阱:重造形式验证已有成果
作者评论 Bend 2 这种为 AI 编码时代设计的语言:其首页 demo 用 58 行"法则"和 442 行 LLM 证明代码来表达玩家无法获胜的性质。作者让 LLM 无额外指引地在形式验证语言 SPARK 中复刻同一 demo,运行 GNATprove 后全部 12 项检查通过,且无需从零构建长证明。
Tessl:产品与工程博客精选AI 评分6363 Tessl 博客:AI 智能体评估应从证据开始,用 35 万行 Rust 复刻 S3 的实践复盘
Tessl 博客复盘前 Docker CTO Justin Cormack 在 AI Native DevCon London 的演讲,分享用 AI 构建约 35 万行 Rust 的 S3 兼容对象存储的经验。
推荐理由:作者用 35 万行 Rust 复刻 S3 的实测经历,总结出测试先知、覆盖率陷阱、flaky 测试纪律和追踪等一套可迁移的 AI 智能体评估方法。