跳到正文

全部动态

今日 2 条
9月4日周五
  1. 公众号:数字生命卡兹克14

    GPT-6 Astra 全面解析

    作者数字生命卡兹克发布对 GPT-6 Astra 的全面解析,标题以“欢迎来到AGI时代”点题。当前材料仅提供摘要级信息,正文以“一段渐变的旅程”描述,未给出可验证的具体细节。

  2. Google AI:DEV 作者专属(RSS)71

    Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent

    Shir Meir Lador 在 Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。

    推荐理由:原文给出在 Cloud Run instances 上以每月 $5.70 常驻运行 Agent 的完整部署步骤和适用边界,方法可直接迁移到其他后台 Agent 场景。

  3. GitHub Blog56

    GitHub Copilot app 教程:用 Git worktree 并行运行多个智能体会话

    GitHub Copilot app 支持并行运行多个智能体会话,每个会话独立运行并保留各自上下文,可随时切换而不需重新说明任务。每个会话可运行在自己的 Git worktree 上实现隔离,作者以 tailspin-toys 仓库为例演示同时进行添加 funded sort 功能、无障碍审查和运行测试三个任务,用户在 sessions 视图中跟踪进度并审阅结果。

9月3日周四
  1. Hugging Face:Blog(RSS)63

    用 TRL 和 OpenEnv 训练编码模型画水彩:Hugging Face 全流程开源复现

    Hugging Face 博客作者基于 Surya Narreddi 的原始想法,用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 复现了让语言模型通过 p5.brush 写 JavaScript 画水彩的 RL 训练流程,所有数据集、环境、脚本和模型均开源在 Hub。

    推荐理由:作者用 TRL 和 OpenEnv 完整开源复现了让编码模型画水彩的 RL 配方,含数据池、环境和三组奖励对比,可整体迁移复用。

  2. 公众号:卡尔的AI沃茨67

    实测豆包当国产 Codex 用的 7 种玩法

    作者总结一周高强度使用豆包的经验,介绍如何把豆包当成国产 Codex 使用。核心差异在于豆包把本地电脑和云电脑(Windows 虚拟机)打通,切换即可,而 Codex 本地和云端是两套分开的环境;授权一次飞书后可直接用 PRD、表格、会议预约等内置工具。

  3. Artificial Analysis70

    Artificial Analysis 评测显示,阿里巴巴 Wan 3.0 在视频编辑带音频榜单首次登顶第一,文生视频带音频位列第二,图生视频带音频排名第五。该模型为一体化视频生成与编辑模型,支持最长 30 秒 1080p 原生音频输出,可接受文本、图片、视频、音频、文档和网页作为创作参考,并支持指令式编辑画面、剧情、对话和声音。

  4. Epoch AI:研究、数据与评测69

    Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题

    Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。

    推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。

  5. OpenAI:官网动态(RSS · 排除企业/客户案例)38

    ATV Big Air Tour 用 ChatGPT Work 把 3 天工作量压缩到 3 小时

    ATV Big Air Tour 两名联合创始人用 ChatGPT Work 运营全美 26 场巡演,把商品盘点和补货从 2-3 天缩短到 2-3 小时。每日自动简报将活动信息核查从每周约 8 小时降到 1 小时,自动查找错误并起草更正邮件。AEO 自动化审计网站结构后,OpenAI 搜索和用户爬虫访问量在连续 30 天周期内从 183 增至 2,421,环比增长 1,223%。

  6. Meta Engineering Blog(RSS)53

    Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识

    Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。