#编码
#编码
今日 1 条
Z.ai@Zai_orgAI 评分2929Hacker News 热门(buzzing.cc 中文翻译)AI 评分4444 Jordan Andersen 撰文质疑 AI 编程提效:写代码不是软件开发的主要瓶颈
Jordan Andersen 撰文质疑 AI 十倍提效的说法,认为若按此逻辑开源 LLM 出现四年后应已催生多家 AirBnb、Stripe、Dropbox 级别的公司,但事实并非如此。
凡人小北@frxiaobeiAI 评分3333HuggingFace Daily Papers(社区热门论文)AI 评分4545 WebWorld:把浏览器当作世界模型实现自改进的网页代码生成
arXiv 论文提出 WebWorld,让 VLM 与浏览器这一确定性可执行模拟器交互,将 VLM 的批评编译为类型化交互契约,浏览器重新执行候选代码,只有目标进展与既有能力保持同时满足时才签发验收证书,证书化的转移累积为质量棘轮并作为 SFT 导出的唯一数据。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5959 生产力工具市场观察:80%坚实基座加20%定制代码是AI时代的理想解
作者结合22年生产力工具市场经验,提出AI时代可塑软件的理想形态是80%坚实基座(数据库、权限、历史、协作、通知)加20%定制代码。
IT之家(RSS)AI 评分6666 Meta AI 编程工具 Muse Code 结束 Beta 测试,新增多项功能并开启订阅
Meta 宣布 AI 编程工具 Muse Code 正式结束 Beta 测试,推出会话间消息传递、Workflow 工作流和 Rewind 回退功能,并发布 SDK 开发者预览版。
Dongxi 东锡 NLP@dongxi_nlpAI 评分1212HuggingFace Daily Papers(社区热门论文)AI 评分4040 AutoSciRub 提出评估优先框架,用自动归纳评分标准提升科研 Agent 表现
论文提出 AutoSciRub,一个评估优先框架,在科研任务执行前自动归纳任务专属的可执行评分标准(rubric),用于指导执行、逐条验证和迭代修订。该框架将模糊指令分解为原子科学目标,结合文献和任务数据合成具体可验证的标准。
HuggingFace Daily Papers(社区热门论文)AI 评分5353 CogEvol 论文提出高效可靠的学习环境生成模型并开源 CogEvol-4B
论文提出 CogEvol 系列模型,将课程简报一次性生成结构化 JSON 幻灯片或自包含交互式 HTML 页面,22 万生产请求中幻灯片中位耗时 17 秒、交互页 59 秒。
公众号:百度智能云(文心)AI 评分3434 百度千帆Token Plan企业版更新:DeepSeek-V4-Pro-0813与GLM-5.3等三款模型上线并接入百度搜索工具
百度千帆Token Plan企业版更新,DeepSeek-V4-Pro-0813正式版与GLM-5.3、GLM-5.3-Flash三款模型上线,原有模型ID可直接调用。百度搜索工具正式接入,专属API-KEY即可调用,限时优惠每次2.5积分。Token福利包扩展覆盖语音、OCR、智能文档分析等AI开放能力,席位扩展为四档并有限时赠送积分、夜享Token低至2折等活动。
Rohan Paul@rohanpaul_aiAI 评分6565一篇 arXiv 论文(arxiv.org/abs/2605.23950)提出,长程智能体评测中 harness 的影响可能大于模型本身,比较基准分数时应披露或控制 harness。
Charlie Holtz@charlieholtzAI 评分2323
dex@dexhorthyAI 评分1111
Tibo@thsottiauxAI 评分1616
ginobefun@hongming731AI 评分4242BestBlogs 早报 09-01 精讲三篇内容:OpenClaw 2.0 由 933 位贡献者合并约 16,000 个 PR,主打低门槛上手、共享云会话与多人无损交接。
Simon Willison 博客AI 评分5151 Graham Dumpleton 发布 Python 库 Wrapture,支持函数追踪与测试替换
Graham Dumpleton(mod_wsgi 与 New Relic Python agent 作者)发布 Wrapture,可包装任意函数或方法以实现追踪或覆盖返回值,既可替代 unittest.mock,也可为现有项目加追踪,内置 OpenTelemetry 支持和纯配置式追踪机制。
Epoch AI:研究、数据与评测精选AI 评分6767 Epoch AI 评审 SWE-Bench Pro:超 20% 任务存在评分缺陷,判定为 Flawed
Epoch AI 对 SWE-Bench Pro 的基准评审判定其为 Flawed,认为很可能超过 20% 的任务存在评分缺陷。
推荐理由:Epoch AI 汇总多方审计数据并给出 Flawed 判定,读者可据此决定是否还把 SWE-Bench Pro 当作可信的编码评测依据。
HuggingFace Daily Papers(社区热门论文)AI 评分3737 MaP-SQL:用可复用记忆替代微调的 Text-to-SQL listwise 选择方法
论文提出 MaP-SQL,一种免微调的 Text-to-SQL listwise 选择器,用从训练数据蒸馏出的结构化记忆作为评估候选 SQL 的显式标准,并通过聚合多输入排列的排序来缓解位置偏差。
HuggingFace Daily Papers(社区热门论文)AI 评分4646 HarnessDev:评测 LLM 能否自主创建并迭代自己的 Agent Harness 基准
论文提出 HarnessDev 基准,将评测单位从任务输出转向可运行的执行基础设施,涵盖 Creation(从最小种子构建完整执行系统)和 Evolution(基于下游执行反馈迭代改进)两个阶段,覆盖 6 个创建模型、4 个领域和 5 个下游基准共 2,207 个独立实例。
Tomer Tunguz 博客(VC 分析)AI 评分5858 Tomer Tunguz:AI 提效不是减少人力,而是抬高同等投入的产出上限
Tomer Tunguz 根据自己十篇已发布文章的数据提出,AI 自动化了机械性写作工作,但并未减少人力投入,而是抬高了同等工作的产出上限。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 ExecRetrieval 基准揭示代码嵌入检索在功能正确性上的差距
论文提出 ExecRetrieval 基准,包含 939 个 Python 任务,每个配一个执行验证的规范实现和最多四个单点变异生成的执行验证错误干扰项。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3737 Polimill 基于 OpenAI 技术打造日本公共 AI 基础设施 QommonsAI
Polimill 基于 OpenAI 技术构建公共部门生成式 AI 平台 QommonsAI,2024 年 10 月发布,目前日本约 1,050 个自治体和约 55 万名公务员在使用。
elvis@omarsar0AI 评分5555
DogeDesigner@cb_dogeAI 评分2828
Replit ⠕@ReplitAI 评分2727
Rohan Paul@rohanpaul_aiAI 评分3434
dex@dexhorthyAI 评分3838
OpenAI Developers@OpenAIDevsAI 评分3434OpenAI Developers 发布 8 月开发者月度盘点,涵盖 Codex 在平台、浏览器和协作工作流上的扩展,以及 Computer History 在 EEA、英国和瑞士的推出。
Rohan Paul@rohanpaul_aiAI 评分6666Meta 的 Muse Code 结束 beta,面向更大、更复杂的工程任务,开发者可用一条命令安装:curl -fsSL https://dev.meta.ai/install.sh | bash。
Claude Code:GitHub Releases(RSS)AI 评分2626 Claude Code v2.1.252 发布,修复 Bash 报错、always allow 未保存等多项问题
Claude Code 发布 v2.1.252,修复多项问题:部分 Mac 上 Bash 命令报 task output swap refused 错误、无 .claude/settings.local. 的项目中 always allow 不保存。
Mark Zuckerberg@finkdAI 评分5656
DAIR.AI@dair_aiAI 评分4646
elvis@omarsar0AI 评分2323Elvis Saravia 发文称,harness engineering 正迅速成为当今 AI 工程师最重要的技能之一,其重要性仅次于 evals。
Ethan Mollick@emollickAI 评分4242
DogeDesigner@cb_dogeAI 评分3838Hacker News 热门(buzzing.cc 中文翻译)AI 评分4242 ChatGPT 工作工具与技能参考
一份 ChatGPT 工作工具与技能参考文档上线,汇总了相关工具与技能的使用说明。该参考面向开发者与进阶用户,便于快速查阅 ChatGPT 工作场景中的功能配置。文档以站点形式发布,供社区参考使用。
The Verge:AI(RSS)AI 评分5656 Debian 投票允许开发者使用 AI 工具,但不会禁止 AI 代码
Debian 投票通过新 AI 政策,允许开发者使用 AI 工具参与 Linux 发行版的开发、维护和文档工作,既不支持也不禁止生成式 AI 工具。政策强调“负责任”使用 AI 可提升生产力,但贡献者仍需对提交内容的质量、正确性和法律合规性负责,且不强制披露 AI 使用情况。部分贡献者对此不满,有人宣布退出 Debian。
Google DeepMind精选AI 评分7878 Google 发布 Gemini 3.7 Flash,面向编码与智能体并降价一半
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本变化。
Microsoft Research精选AI 评分7171 微软研究院开源 Orchard:可扩展智能体 AI 框架
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理三类智能体任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的可行路径。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:Google 把轻量 Flash 微调成专用安全模型,并给出 CyberGym 与 Chrome 流水线的实测对比,可看专用小模型在漏洞挖掘上的取舍。