Zho 用 GPT-6 Astra 跑了超过 12 小时的地狱难度测试,输入为单张建筑照片加提示词,5 项任务总得分 60/100(及格线),消耗 token 2.1 亿。
全部AI 动态
全部动态
今日 2 条
-Zho-@ZHO_ZHO_ZHOAI 评分5353Simon Willison 博客AI 评分5959 Simon Willison 演示如何在 macOS 上用 coding agent 驱动 Blender 渲染
Simon Willison 分享在 Mac 上用 ChatGPT Codex 搭配 Blender 的玩法:从 blender.org 安装完整 Mac 应用后,用提示词让 agent 调用 /Applications/Blender 渲染一只骑自行车的鹈鹕场景。他随后用两条追加提示词添加背景和装饰,最终图片由 Blender 的 Python API 生成。
The Decoder:AI News(RSS)精选AI 评分7878 OpenAI 发布 GPT-6 Astra 提示词指南,含 slop 词屏蔽清单
OpenAI 在模型文档中说明 GPT-6 Astra 相比 GPT-5.6 Sol 更常提出澄清问题、对上下文更敏感,并给出让模型更主动、审计 AGENTS.md 等技能文件、控制写作风格、约束子智能体委派和测试规模的提示词建议。
推荐理由:原文汇总了 OpenAI 官方文档中针对 GPT-6 Astra 的提示词建议和 slop 词屏蔽清单,开发者可直接迁移到自己的提示词写法。
公众号:数字生命卡兹克精选AI 评分7777 实测GPT-6 Astra:速度、前端与代码能力对比GPT-5.6 Sol的全面升级
GPT-6 Astra正式向所有订阅用户推送,作者实测后认为其综合能力追平Claude Fable 5,且额度100%可用。相比GPT-5.6 Sol,速度明显提升,大型系统审查从数小时缩短到约10分钟,代码扫描找出大量此前未发现的性能问题并2小时完成修复;前端3D生成和审美大幅强化,写作在白描和用词上更好但仍缺中文留白感。
推荐理由:作者实测了GPT-6 Astra在速度、前端生成、代码深度和写作上的具体变化,并给出可迁移的AGENT.md简化思路。
Greg Brockman@gdbAI 评分5454Hacker News 热门(buzzing.cc 中文翻译)AI 评分5858 作者用 Spotify Portal 的 AiKA Modes 将 Claude Code token 用量降低约 90%
作者在 Claude Code 中用 Spotify Portal 的 AiKA Modes 搭建模型路由,把批量读文件和样板代码生成委派给 Gemini 2.5 Flash,bulk-read 场景平均节省约 90% token。
DogeDesigner@cb_dogeAI 评分2626DogeDesigner 提醒用户可以为每个 Grok Bot 设置自定义头像:点击你的 Bot,点按头像,然后从相册中选择。作者展示了自己给营销、内容、设计、开发等不同 Bot 设置的狗狗头像。
Tibo@thsottiauxAI 评分2626Tibo 称 Astra 在未公开可用时是其最大的竞争优势,使用后生产力大幅提升,使部分计划提前 6 个月,原定明年年中发布的内容将改在 DevDay 发布。
Ethan Mollick@emollickAI 评分2929
dex@dexhorthyAI 评分1111
ginobefun@hongming731AI 评分4444BestBlogs 09-05 早报精讲三篇实践文章。freeCodeCamp 沿用 Anthropic 的 AI 原生 SDLC 框架,把研发拆为 Plan。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分1919 人工智能现在能设计电路板了吗?
eebench.org 发布文章探讨 AI 目前能否设计电路板,原文链接为 https://eebench.org/blog/can-ai-design-circuit-boards-yet。该内容在 Hacker News 获得 134 分热度,feed 未提供完整正文。
Simon Willison 博客AI 评分6868 Simon Willison 用鹈鹕骑车 SVG 对比 GPT-6 Astra 与 GPT-5.6 各推理档位
Simon Willison 获得访问权限后,用 GPT-6 Astra 在 low 到 max 五个推理档位生成鹈鹕骑车 SVG,并与 GPT-5.6 Sol、Terra、Luna 渲染成对比网格。
Aravind Srinivas@AravSrinivasAI 评分3535
Rohan Paul@rohanpaul_aiAI 评分5454AI/ML API 用四个场景简报测试 OpenAI 的 GPT‑6 Astra 与 Anthropic 的 Claude Fable 5.1,要求各自一次性生成独立 HTML 场景文件、不做修改。
Databricks:Blog(RSS)AI 评分2222 Databricks 讲解如何通过专用 GPU kernel 生成实现极致推理效率
Databricks 发文介绍如何通过专用 GPU kernel 生成实现极高效率。文章指出传统生产推理系统依赖通用 kernel 处理多样化负载,并探讨专用 kernel 的优化路径。
The Decoder:AI News(RSS)精选AI 评分8484 GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击
The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率降至约 67%。
推荐理由:文章汇总 OpenAI 系统卡与 Gray Swan 独立测试数据,读者可据此比较 GPT-6 Astra 与竞品在幻觉和注入攻击上的实际防线。
Databricks:Blog(RSS)AI 评分2222 Databricks 详解营销团队使用 Genie One 的五种方式
Databricks 官方博客介绍营销团队使用 Genie One 的五种方式,指出营销团队手头已有campaign 表现指标和客户数据等数据资产,可用 Genie One 加以利用。
Artificial Analysis@ArtificialAnlysAI 评分6161Mohamed Moustafa 技术博客(网页)AI 评分6363 如何让 Olly 智能体自己处理客服工单
作者分享了让自家 AI 助手 Olly 自行处理客服的实现方法,整套流程用不到 500 行 TypeScript 完成。智能体通过 sendSupportRequest 工具把用户问题连同近期对话写入反馈集合、用 iMessage 通知团队,并经管理端点回复,回复作为合成轮次由智能体翻译成用户语言转达,引用文本被视为内容而非指令以防提示词注入。
Andrew Ng@AndrewYNgAI 评分3636
Frank Wang 玉伯@lifesingerAI 评分2424The Verge:AI(RSS)AI 评分6464 Instagram AI 内容标签再陷混乱,The Verge 实测发现只有 Meta 自家信号能触发标注
The Verge 记者实测发现,Instagram 的 AI Content 标签持续误标普通照片,而带 C2PA 和 SynthID 信号的 Gemini 完全生成图片反而未被标注。
Unsloth AI@UnslothAI精选AI 评分7171Unsloth 宣布通过优化解码和新增 MTP 支持,让 GLM-5.3-Flash 的本地 GGUF 推理提速 1.6 至 3.4 倍,长上下文下最高达 3.3 倍。
推荐理由:原文给出本地运行 GLM-5.3-Flash 的具体加速倍数、显存需求表和现成 GGUF 资源,方法可直接复用。
The Decoder:AI News(RSS)精选AI 评分7878 GPT-6 Astra 基准表现分歧,ARC-AGI-3 效率超人类令 Chollet 提前 AGI 预测
GPT-6 Astra 的基准结论相互矛盾:Epoch AI 以 169 分将其排在 267 个模型之首,Artificial Analysis 给出 61 分,仅与前代 Sol 持平、落后 Claude Fable 5.1 的 66 分。
推荐理由:原文汇总多家基准分歧数据并梳理 ARC-AGI-3 效率细节,读者可以借此理解 GPT-6 Astra 各项成绩的真实含义。
The Verge:AI(RSS)AI 评分4949 为什么 AI 生成的食物图片看起来那么诡异
The Verge 撰文解释餐厅和品牌用 AI 生成的食物宣传图为何频繁出现虫状面条、孔洞和裂纹等问题。牛津大学的 Chris Russell 指出扩散模型先恢复粗结构、后补细节,结构错了细节只会更怪;那不勒斯费德里科二世大学的 Giovanbattista Califano 称扩散模型难以生成细长连续结构,导致意面状伪影和密集孔洞。
karminski-牙医@karminski3AI 评分3030
Sherwin Wu@sherwinwuAI 评分3838
Frank Wang 玉伯@lifesingerAI 评分2727
Frank Wang 玉伯@lifesingerAI 评分3838作者分享在 YouMind 中用 Fable 5.1 模型制作小游戏的做法:打开 YouMind,选择 Fable 5.1 模型,说你要做什么游戏即可生成。
Frank Wang 玉伯@lifesingerAI 评分4444
jason@jxnlcoAI 评分2121
Frank Wang 玉伯@lifesingerAI 评分3030
Ethan Mollick@emollickAI 评分3838
Rohan Paul@rohanpaul_aiAI 评分5151
-Zho-@ZHO_ZHO_ZHOAI 评分1111ZHO 发布创意系列新作《AGI》,标注由 GPT 4o Creation 生成。画面为一位佩戴黑色墨镜与 OpenAI 标志耳饰的女性含着写有 AGI 字样的红色棒棒糖,右下角带 O4Z 签名标识。
Ethan Mollick@emollickAI 评分5454Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7777 开发者用 Claude Fable 5 在 Claude Code 中将 1993 年 Amiga 游戏 Babylonian Twins 移植到 Godot
作者让 Claude Fable 5 在 Claude Code 中分三步移植其 1993 年 Amiga 游戏:34,000 行 C++ 一个晚上迁入 Godot 4,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,并把 1993 原作作为第二启动项嵌入新游戏。
推荐理由:作者亲历者复盘用 LLM 移植 68000 汇编的完整过程,给出可验证的字节级校验方法和多处 AI 出错的实例。
Epoch AI:研究、数据与评测AI 评分5858 Epoch AI 评测 Terminal-Bench 4.0.0:45.5% 任务存在公开计分缺陷,定为 Flawed
Epoch AI 发布对 Terminal-Bench 4.0.0 的基准评测,因 66 个任务中 30 个(45.5%)存在公开记录的计分缺陷而将其定为 Flawed。
DogeDesigner@cb_dogeAI 评分3434