推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。
#推理
#推理
今日 2 条
Greg Brockman@gdb精选AI 评分7272
Sherwin Wu@sherwinwuAI 评分4646
Aravind Srinivas@AravSrinivas精选AI 评分7070推荐理由:Perplexity CEO 确认 GPT-6 Astra 在其评测中领先,并宣布将向 Pro 和 Max 用户开放。
MarkTechPost(RSS)AI 评分8282 OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问
OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口、128,000 最大输出 token,2026 年 4 月 30 日知识截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 为 65.7%),平均任务时间从约 75 分钟降至 40 分钟。
DAIR.AI@dair_aiAI 评分4747
Rohan Paul@rohanpaul_ai精选AI 评分7878推荐理由:作者梳理了 GPT-6 Astra 系统卡中关于链式思维可控性与监控性下降的关键安全发现,读者可借此了解对齐评估的核心结论。
🚨 AI News | TestingCatalog@testingcatalogAI 评分6767
DAIR.AI@dair_aiAI 评分4646KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
Sherwin Wu@sherwinwu精选AI 评分6666推荐理由:结合 Arc Prize 负责人的预估与半年即饱和的结果,读者可以借此对照自己对前沿模型进展速度的预期。
elvis@omarsar0AI 评分4545KAIST AI 与 Google DeepMind 等发布论文《Language Models Can Control Their Own Attention》。
Simon Willison 博客AI 评分8282 OpenAI 发布 GPT-6 Astra,ARC-AGI 3 得分 99.9%
OpenAI 的 GPT-6 Astra 今日起向部分组织推出,随后面向 ChatGPT Plus、Pro、Business、Enterprise 用户开放,API 定价为每百万输入 $10、每百万输出 $50,与 Claude Fable 5/5.1 持平。
Rohan Paul@rohanpaul_aiAI 评分2727
elvis@omarsar0AI 评分6969
Sam Altman@samaAI 评分7474
François Chollet@fchollet精选AI 评分8181推荐理由:ARC Prize 作者基于自家标准 harness 的实测数据评估 GPT-6 Astra,读者可对比 66% 与近 100% 两种设置看模型与 harness 能力的边界变化。
Epoch AI@EpochAIResearchAI 评分6464
🚨 AI News | TestingCatalog@testingcatalogAI 评分5959OpenAI 宣布开始发布 GPT-6 Astra,将在未来几天内完成推送,并面向所有 Plus 用户开放,而不限于 Pro、Business 和 Enterprise。
The Decoder:AI News(RSS)AI 评分8787 OpenAI 发布 GPT-6 Astra,并首次将其列为 Preparedness Framework 下关键级网络安全模型
OpenAI 发布其最强模型 GPT-6 Astra,总裁 Greg Brockman 称其可能已接近 AGI,并以 Welcome to the AGI era 结束发布。
Aravind Srinivas@AravSrinivasAI 评分3737
Rohan Paul@rohanpaul_aiAI 评分8080OpenAI 发布 GPT-6 Astra,首先向经过审核的 Daybreak 网络安全客户开放,Plus、Pro、Business、Enterprise、API 和 AWS 将在未来数日内跟进。
Noam Brown@polynoamialAI 评分6666
🚨 AI News | TestingCatalog@testingcatalogAI 评分6161
elvis@omarsar0AI 评分6161
🚨 AI News | TestingCatalog@testingcatalogAI 评分8282OpenAI 发布 GPT-6 Astra,初期仅向 Daybreak Access 计划中的组织开放,未来几天将陆续推送给所有 Plus、Pro、Business 和 Enterprise 用户。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7878 IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期
IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。
推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。
TechCrunch:AI(RSS)精选AI 评分8181 OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议
OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。
推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。
Rohan Paul@rohanpaul_aiAI 评分4646
Rohan Paul@rohanpaul_aiAI 评分2727Apodex_AI 发布 Apodex 1.1,围绕“完成且可检查的工作”而非漂亮回答来训练模型,可从原始文件、数据集、代码等出发,选择方法、运行代码、保持任务状态、从故障恢复并产出可验证的结果。
NVIDIA Technical Blog:Agentic AI / Generative AI精选AI 评分6969 NVIDIA 讲解如何在 Jetson 上部署和优化推理模型
NVIDIA 发布教程,讲解在 Jetson 上部署新一代开放推理模型的方法,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。
推荐理由:官方教程给出模型选型、NVFP4 量化与投机解码配置和实测吞吐数据,可迁移到自己的 Jetson 部署流程。
The Decoder:AI News(RSS)AI 评分5353 Claude Fable 5.1 解开 1653 年 Cyphral Distich 数谜
Claude Fable 5.1 在 44 分钟内无人工干预地解开了 1653 年 Sir Thomas Urquhart 发表的 Cyphral Distich 数谜。
Artificial Analysis@ArtificialAnlysAI 评分6161The Decoder:AI News(RSS)AI 评分7070 Meta 发布 Muse Spark 1.3,智能体任务提升明显且以低价切入
Meta 发布 Muse Spark 1.3,xhigh 档已可用,更强的 max 档目前为有限合作伙伴预览。
🚨 AI News | TestingCatalog@testingcatalogAI 评分4141TestingCatalog 发布9月3日AI日报,汇总多家公司动态。Gemini 3.8 Flash 上线,1M 上下文,12月31日前入门价 $0.75 / $3.75。
HuggingFace Daily Papers(社区热门论文)AI 评分4646 LLAMIA 论文提出语言与非语言智能体协作的潜在状态内化方法并发布 LLAMIA-Bench
论文研究 LLM 与非语言智能体(如棋类引擎)的协作,发布包含六个国际象棋协作任务的 LLAMIA-Bench,并提出将子智能体连续表征直接投影到 LLM token 流的潜在状态内化方法。
Thomas Wolf@Thom_WolfAI 评分4242
Dongxi 东锡 NLP@dongxi_nlpAI 评分2727MarkTechPost(RSS)AI 评分5050 Perplexity 开源 Rust + Metal 推理引擎 Lily,专为 Apple 硅上的 Qwen3.6-35B-A3B 打造
Perplexity 开源了支撑其 Hybrid Compute 的本地推理引擎 Lily,用 Rust 驱动生成循环、手写 Metal kernel 执行模型,不依赖 PyTorch 或 MLX,仅针对 Qwen3.6-35B-A3B 这一个模型。
IT之家(RSS)AI 评分6161 OpenAI 首席科学家 Jakub Pachocki 回应 Astra 推理不透明争议:计算图深度与 GPT-4 相差不到两倍
OpenAI 首席科学家 Jakub Pachocki 9 月 2 日在 X 平台回应 Astra 推理不透明争议,称包括 Astra 在内的前沿模型计算图深度与 GPT-4 相差不到两倍,架构未出现跳跃式复杂度增长。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 Declarative Attention 论文提出语言模型可自主控制自身注意力
论文提出 Declarative Attention(DA)协议,让模型在链式思考中声明需要关注哪些上下文区域,推理引擎据此解析声明并跳过大部分 KV cache 读取,避免每步 O(N) 的外部打分开销。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 EarlyEval:通过提前结果预测降低 LLM Agent 评测成本
论文提出 EarlyEval,一个通过提前结果预测降低 LLM Agent 评测成本的轻量框架。它训练一对 LightGBM 成功与失败分类器,基于行为、文本和参考解特征,在达到校准置信阈值时提前终止 Agent 运行。