#编码
#编码
今日 1 条
karminski-牙医@karminski3AI 评分6161Hacker News 热门(buzzing.cc 中文翻译)AI 评分5858 作者用 AI 编程工具排查电子书阅读器 Xteink X3 的条纹渲染缺陷
作者在拆箱 Xteink X3 电子墨水阅读器后几小时内,借助 GPT-6 Astra(Codex)和 Fable 5.1(Claude Code)排查 CrossPoint 固件下灰度图片上的竖向条纹。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5353 将 35kb 预提示从 Opus 迁移到自托管 Ollama 的踩坑笔记
作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。
Hacker News:AI 热帖精选AI 评分7777 GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗
Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
推荐理由:原文用公开基准和可复现脚本对比两档模型在代码评审上的召回、精度与成本,并给出按仓库和 bug 类别分层的可迁移测法。
Claude:Blog(网页)精选AI 评分6666 Anthropic 工程师复盘:智能体编程压力下如何扩展测试影响分析服务
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
elvis@omarsar0AI 评分5858
Rohan Paul@rohanpaul_aiAI 评分6161Tessl:产品与工程博客精选AI 评分6363 Tessl 提出 Agent 上下文归属模型:所有权跟随组织单元
Tessl 发文提出智能体转型的真正难点是上下文等要素的归属问题,而非 Agent 本身。核心规则是所有权跟随组织单元,个人与团队上下文归领域专家,组织级共享基础由赋能或平台团队托管并开放贡献,赋能团队只提供工具和基础设施而不拥有上下文。
推荐理由:文章把智能体转型的难点从模型转向上下文归属,给出按组织单元分层确权和赋能团队只供工具不拥有上下文的可迁移框架。
SiliconFlow@SiliconFlowAI精选AI 评分6666推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
🚨 AI News | TestingCatalog@testingcatalogAI 评分6565
凡人小北@frxiaobeiAI 评分6060
凡人小北@frxiaobeiAI 评分5757
karminski-牙医@karminski3AI 评分5353karminski回应skill与认真写的markdown文档有何区别的提问,认为传统文档通常只是代码或数据之一,而skill能实现代码与数据同构。
karminski-牙医@karminski3AI 评分5353karminski 发布大模型从零实现向量数据库的后端 Agentic Coding 排行榜(SIFT1M 上 recall ≥ 95% 的 QPS 计分)。
OpenRouter:Announcements(RSS)精选AI 评分6161 OpenRouter 教程:用 LLM-as-a-judge 自动评估 AI 智能体输出
OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。
推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5757 CUDA for AMD on Windows:基于 ZLUDA + HIP/ROCm 在 Windows 上运行 CUDA 应用的开源方案
GitHub 项目 CUDA-for-AMD-Windows 发布了可复现的技术栈,通过 ZLUDA v6-preview.69 + AMD HIP SDK 6.4 让 CUDA 面向的 Windows 应用在 AMD GPU 上运行。
Hacker News:AI 热帖精选AI 评分8585 Anthropic 报告称胡塞组织用 Claude Code 开发导弹制导软件
Anthropic 9 月威胁报告披露,据评估极可能关联胡塞组织的也门小组使用 Claude Code 开发制导火箭、射程超 2,000 公里弹道导弹及名为 R2000 的高超声速滑翔载具概念的相关软件。
推荐理由:原文梳理了 Anthropic 威胁报告中也门组织用 Claude Code 并行推进导弹研发的完整链条,可帮助读者理解 AI 滥用如何绕过安全防护。
IT之家(RSS)AI 评分6666 工信部发布《人工智能 + 软件》专项行动方案,力争 2030 年关键软件全面智能化升级
工业和信息化部 9 月 11 日发布《“人工智能 + 软件”专项行动实施方案》,提出到 2030 年关键软件全面实现智能化升级。
Hacker News:AI 热帖AI 评分6161 AgentsDock 发布:面向智能体 AI 研究的跨平台 IDE,支持 Claude Code、Codex 和 Cursor
AgentsDock 发布,这是一款面向智能体 AI 研究的 IDE,在同一个桌面和移动工作区中支持 Claude Code、Codex 和 Cursor。
Rohan Paul@rohanpaul_aiAI 评分5555MarkTechPost(RSS)AI 评分6666 Cognition 发布 SWE-2:基于 Kimi K3 后训练的编码模型,以低 64% 的成本接近 Fable 5.1
Cognition 发布编码模型 SWE-2,从 2.8T 参数的 Kimi K3 经强化学习后训练而来,在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 相差不到 1 分且成本低 64%。
Hacker News:AI 热帖AI 评分5656 Real-SWE 发布:在企业私有真实代码库上评测前沿编程模型
Specific 团队发布 Real-SWE 基准,任务取自经授权的真实公司私有生产代码库,评测 8 个前沿模型与 harness 组合的解决率。
OpenAI Developers@OpenAIDevsAI 评分8080OpenAI 开发者账号宣布发布 GPT-6 Astra,并汇总社区开发者基于它做出的构建案例,包括 2234 个建模解剖部件的 3D 展示、Unreal Engine 曼哈顿复刻。
IT之家(RSS)AI 评分5858 谷歌完成对 AI 编程创企 Mechanize 的人才收购
据《商业内幕》报道,谷歌完成对旧金山 AI 编程初创企业 Mechanize 的人才收购,联合创始人塔迈·贝西罗格鲁自 8 月起加入谷歌 DeepMind,另有十多名工程师一同转投。
The Decoder:AI News(RSS)AI 评分6464 OpenAI 建议开发者用更精简的提示词和更少限制来适配 GPT-6 Astra
OpenAI 的 Eric Provencher 撰文建议,切换到 GPT-6 Astra 时应精简技能描述、AGENTS.md 规则和任务提示词,因为过长的指令会占用上下文或导致模型过早停止。
IT之家(RSS)AI 评分5656 Claude Code 之父切尔尼谈 AI 编程:开发者核心职责是守住代码质量
据《商业内幕》报道,Anthropic Claude Code 创作者鲍里斯·切尔尼 9 月 10 日回复开发者来信称,两种 AI 编程方式各有适用场景,而非二选一。
凡人小北@frxiaobeiAI 评分7272OpenAI 公开了 ChatGPT 背后的存储系统 Habitat,它每秒处理超过 7000 万次请求、保存 500PB 以上数据、服务每周超过 10 亿用户,最早只是一个 Python 小库。
Yuchen Jin@Yuchenj_UWAI 评分535325 位菲尔兹奖得主担心 AI 过快解决数学问题会损害数学学科,Yuchen Jin 表示自己在编程领域看到的是相反情况。他类比称,若科学家为亲自体验发现而推迟癌症疗法 100 年,将是人类的灾难。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 litelm 开源:从 LiteLLM 抽取精简版路由与消息翻译核心,仅约 2900 行代码、2 个依赖
开发者 kennethwolters 发布开源项目 litelm,将 litellm 的模型路由、消息翻译、流式输出、tool use、嵌入等核心调用路径抽取为约 2900 行、仅依赖 openai 和 httpx 的精简库。
Thariq@trq212AI 评分5454Baseten 工程博客(网页)精选AI 评分7676 DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
MarkTechPost(RSS)AI 评分6666 Anthropic 为 Claude Code 推出插件评测流程:6 种 grader、无插件基线与 CI 门禁
Anthropic 为 Claude Code 发布 plugin evals 工作流,claude plugin eval 命令用真实提示词运行插件、评分并与未加载插件的运行对比。
Artificial Analysis@ArtificialAnlysAI 评分6464
ClaudeDevs@ClaudeDevsAI 评分5353GitHub Blog精选AI 评分6565 GitHub 日韩营销负责人如何用 GitHub Copilot 把活动运营自动化
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
推荐理由:作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
OpenAI Developers@OpenAIDevsAI 评分5656
Grok@grokAI 评分4343
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5454 如何衡量 LLM 生成代码的粗糙程度:verbosity 与 erosion 指标
Earendil 工程师发文讨论如何量化 LLM 生成代码的粗糙程度,指出 AI as a judge 很难有效评估代码质量,而 LOC 变化、verbosity 和 erosion 是更可行的指标。
Google Developers Blog(RSS)AI 评分5454 Google 开源 autofinetune:用 AI Agent 在 TPU 上自动完成 LLM 后训练
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
dex@dexhorthyAI 评分5151