#OpenAI
#OpenAI
今日 3 条
OpenAI@OpenAIAI 评分7676
OpenAI@OpenAI精选AI 评分7474推荐理由:原文补充了数据隔离说明,并指出其 Euler 情形证明结果与 Alpöge 和 Buckmaster 的工作不同,读者可据此比较两条独立证明路径。
Epoch AI:研究、数据与评测精选AI 评分6969 Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7272 OpenAI 长文阐述对齐与监测困境,称 CoT 监控能力正在减弱
OpenAI 发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目中确认推理模型可扩展训练的起点,并系统阐述目标对齐与价值对齐的区分。文章指出链式思维监控的效果正随着模型能力提升而逐步减弱,GPT‑6 Astra 在对齐上显著优于 GPT‑5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
推荐理由:作者以内部视角回溯推理模型的起源,并给出对齐监测、CoT 监控弱化和 RSI 风险的一手判断。
OpenAI@OpenAI精选AI 评分6565推荐理由:OpenAI 首次系统说明对齐事故的披露思路,并预告将发布披露框架,读者可借此了解行业在事件报告上的走向。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8888 OpenAI 发布 GPT-6 Astra:多项基准刷新纪录, cybersecurity 能力达 Critical 阈值
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
推荐理由:官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
Perplexity@perplexity_aiAI 评分5858
OpenRouter@OpenRouterAI 评分2424
Artificial Analysis@ArtificialAnlysAI 评分5353
OpenAI Developers@OpenAIDevsAI 评分6868
OpenAI Developers@OpenAIDevsAI 评分5151OpenAI Developers 宣布 GPT-6 已发布,并将为开发者、技术创始人和产品建设者举办 GPT-6 黑客松:旧金山场为 9 月 8 日,纽约场为 9 月 10 日。
OpenAI Developers@OpenAIDevsAI 评分7171
OpenRouter@OpenRouterAI 评分6868
OpenAI Developers@OpenAIDevsAI 评分8181
OpenAI@OpenAI精选AI 评分8282推荐理由:官方宣布 GPT-6 Astra 上线范围与渠道,Plus 和 Business 用户还需等待几天,读者可据此确认自己能否用上。
OpenAI Developers@OpenAIDevsAI 评分44
Gary Marcus:The Road to AI We Can Trust(RSS)AI 评分5656 Gary Marcus 呼吁立即暂停 OpenAI
Gary Marcus 撰文呼吁暂停 OpenAI,理由是其不值得信任:新发布的 Astra 降低了思维链(CoT)可监控性,尤其在 destructive actions 上自家数据显示监控受损,OpenAI 仍照常发布;另有一起新事故被公司隐瞒数周。
Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分7474 Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑
Gary Marcus 发文点评 GPT-6 Astra,称多项报告显示其为真正的进步,OpenAI 产品显式创建并操纵符号世界模型,令其近十年的主张获得印证。
推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8181 OpenAI 发布 GPT-6 Astra 并公布安全概览,称其网络安全能力达到 Preparedness Framework 的 Critical 级
OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。
推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6565 OpenAI 推出 Daybreak for Frontline Defenders,投入10亿美元支持一线网络防御
OpenAI 发布 Daybreak for Frontline Defenders 全球计划,承诺提供10亿美元的 Daybreak 补贴访问、培训、技术支持与合作,计划在未来六个月内消耗,优先支持水处理、电网、州和地方政府、社区银行、非营利组织和开源维护者等资源有限的一线防御者。
推荐理由:原文给出10亿美元补贴的具体构成、MS-ISAC 试点和35个以上合作产品,读者可据此了解 Daybreak 防御能力如何触达一线防守者。
OpenAI Developers@OpenAIDevsAI 评分6363OpenAI Developers 宣布 GPT-6 Astra 是其在电脑使用、软件工程和视觉理解方面迄今最好的模型,并附上正在使用该模型的开发者的视频分享。
OpenAI@OpenAIAI 评分3939OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分2929 Legora 用 GPT-6 Astra 数分钟审阅 41 份文件并找出全部 4 处植入错误
Legora 使用 GPT-6 Astra 在数分钟内审阅 41 份文件,找出全部 4 处植入错误,该财务审查工作流性能提升近 40%。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3232 Playco 用 GPT-6 Astra 做游戏原型,手动修复减少 50%
Playco 使用 GPT-6 Astra,从一个 grey box 基础搭建出三个主题游戏原型,并报告手动修复比使用前一模型减少 50%。
xAI:News(网页)精选AI 评分7070 xAI 设计 Grok Bot:为持久化智能体重构交互界面
xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具;头像动效呈现空闲、工作、等待、阻塞、思考、完成等状态;工作区提供状态、预览、接管三级访问。
推荐理由:xAI 官方复盘 Grok Bot 的界面设计决策,读者可以了解持久化智能体产品在组织方式和交互上的取舍思路。
OpenAI Developers@OpenAIDevsAI 评分2323OpenAI 官方宣布 WebMCP Challenge 截止时间延长 12 小时,至凌晨 1:00 PT。官方称系统已完全恢复在线,延期为受当日故障影响的参赛者留出更多提交时间。
NVIDIA Blog(RSS)AI 评分3939 NVIDIA 在 IFA 2026 宣布加速本地 AI,十月推出 RTX Spark Windows PC
NVIDIA 在 IFA 2026 宣布与 Microsoft 及合作伙伴合作,提供更快的推理速度和新工具,让智能体更易在 NVIDIA 硬件上本地搭建和运行。同时宣布新款紧凑型 NVIDIA RTX Spark Windows PC 将于十月上市,面向 AI 爱好者、开发者和创作者。
Replit ⠕@ReplitAI 评分2929Epoch AI:研究、数据与评测精选AI 评分6969 Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题
Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。
推荐理由:Epoch 汇总了 OpenAI 与 RDI 的公开审计结论,说明 SWE-bench Verified 的测试缺陷和污染问题,读者可据此调整对该基准的解读。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3838 ATV Big Air Tour 用 ChatGPT Work 把 3 天工作量压缩到 3 小时
ATV Big Air Tour 两名联合创始人用 ChatGPT Work 运营全美 26 场巡演,把商品盘点和补货从 2-3 天缩短到 2-3 小时。每日自动简报将活动信息核查从每周约 8 小时降到 1 小时,自动查找错误并起草更正邮件。AEO 自动化审计网站结构后,OpenAI 搜索和用户爬虫访问量在连续 30 天周期内从 183 增至 2,421,环比增长 1,223%。
Gary Marcus:The Road to AI We Can Trust(RSS)AI 评分4747 Gary Marcus 批评 Elon Musk 反复推迟兑现的 AI 预测且媒体不加质疑
Gary Marcus 撰文指出,Elon Musk 在 2024 年 4 月预测 2025 年底将出现比任何单个人类更聪明的 AI,如今只是把日期悄悄推迟到 2027 年,而 Marcus 曾两次提出百万美元赌注均未获回应。
OpenAI Developers@OpenAIDevsAI 评分2121
OpenAI Developers@OpenAIDevsAI 评分2323
OpenRouter@OpenRouterAI 评分5757ARC Prize:官方博客精选AI 评分7979 ARC Prize 发布 OpenAI GPT-6 Astra 在 ARC-AGI-3 上的评测结果
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
Gary Marcus:The Road to AI We Can Trust(RSS)AI 评分5151 Gary Marcus 警告 OpenAI 即将越过一条 AI 安全红线
Gary Marcus 发文警告 OpenAI 正准备越过一条 AI 安全红线,认为其正在探索的新技术可能令思维链监控变得困难甚至不可能。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3838 Gilbert + Tobin 如何用 OpenAI 治理并规模化应用 AI
澳大利亚律所 Gilbert + Tobin 通过 ChatGPT Enterprise 和 Codex 将 AI 融入运营,截至 2026 年 6 月 87% 的启用席位处于活跃使用状态,是其其他工具采用率的两倍以上。
Hugging Face:Blog(RSS)AI 评分4747 Hugging Face 与 Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟测了什么
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
OpenAI@OpenAIAI 评分5757
Cohere@cohereAI 评分3333