Haus Research 审计:Perplexity 三分之一的引用页面并不包含被引数字
Haus Research 对 Perplexity 的 sonar 与 sonar-pro 两个搜索模型提出 310 个关于 210 家科技公司的事实问题,抓取全部 cited URL 核验。
Haus Research 对 Perplexity 的 sonar 与 sonar-pro 两个搜索模型提出 310 个关于 210 家科技公司的事实问题,抓取全部 cited URL 核验。
在纽约时报诉 OpenAI 的案件中,特朗普政府提交了一份 20 页法庭简报,为 OpenAI 未经授权使用版权材料训练 LLM 辩护。简报援引特朗普去年签署的行政命令,称限制 LLM 发展将阻碍创新与美国繁荣。
OpenAI 推迟发布最强模型 Astra 以加强安全协议,The Information 报道称 Astra 可能采用更不透明的 recurrent depth / looped transformer 技术,内部思考更难监测。
特朗普政府就纽约时报 2023 年 12 月起诉 OpenAI 和 Microsoft 的版权案提交利益声明,支持 OpenAI 关于用受版权文本训练大语言模型属合理使用的论点。
OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。
推荐理由:原文梳理了新诉讼的核心指控与 OpenAI 的回应,读者可以据此了解 ChatGPT 安全审核争议的最新进展。
ARC Prize 报告 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上,Standard harness 得分 62.7%(成本 $26K),Provider Adapter harness 得分 99.9%(成本 $19K),均为 SOTA。
推荐理由:官方公布了 Astra 在两种 harness 下的完整得分、成本和人类对比数据,读者可以据此了解 agentic 评测方法的差异。
美国国防部在 AI 平台 GenAI.mil 上新增 OpenAI 的 ChatGPT Mil 和 xAI 的 Grok for Government,此前该平台自去年 12 月上线以来仅有 Google Gemini。
AI 安全公司 HiddenLayer 完成 1 亿美元 B 轮融资,由 Delta-v Capital 领投,Ten Eleven Ventures、Morgan Stanley、Microsoft 的 M12、Booz Allen Hamilton 等参投。
OpenAI 称即将发布的 Astra 模型是其 Preparedness Framework 中首个达到网络安全最高风险级别 critical 的系统,同时也称其为最安全的模型。
律所 Edelson PC 在 4 月就 Tumbler Ridge 枪击案起诉 OpenAI 后,本周在加州法院追加 30 起诉讼,新原告包括事发时在校内但未中枪的教师、校长和学生。
代表坦布勒里奇校园枪击案受害者的律所 Edelson PC 本周在加州法院再提交 30 起诉状,新原告包括教师、校长和未遭枪击的学生,并首次指控 OpenAI 帮助和教唆犯罪。
论文提出神经网络向量表示隐式实现了 Tensor Product Representation 符号结构,作者用 DISCOVER 方法将多种网络(含 Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b 共 7 个 LLM)的表示替换为符号化闭式方程,模型行为基本不变。
据路透社报道,美国当地时间周二呼吁 G20 成员国避免针对 AI 制定过多新规,科技顾问克拉齐奥斯希望各国采纳卡罗来纳原则,即为涉及 AI 的新型场景制定规则而非另建全新监管体系。
据《商业内幕》报道,OpenAI CEO 奥尔特曼认为外界对 AI 耗水量的担忧已被放大成缺乏数据支撑的梗,称现代数据中心实际用水量大致相当于一栋办公楼。他此前表示 ChatGPT 平均每次查询耗水约 0.32 毫升,加州种一颗杏仁平均需 3.56 升水。盖洛普 5 月调查显示 71% 的美国人反对在所在地区兴建数据中心,18% 的受访者明确提到水资源。
ChatGPT Ads 在不到 200 天内达到 10 亿美元年化收入运行率,OpenAI 正在向新地区扩展自助广告服务。目前已有数以万计的广告主使用该平台,Ads Manager 自助入口于当日在印度、欧洲、中东和北非上线。
Gary Marcus 发文警告 OpenAI 正准备越过一条 AI 安全红线,认为其正在探索的新技术可能令思维链监控变得困难甚至不可能。
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个达到该水平的模型,并预告了评估方式与安全措施。
澳大利亚律所 Gilbert + Tobin 通过 ChatGPT Enterprise 和 Codex 将 AI 融入运营,截至 2026 年 6 月 87% 的启用席位处于活跃使用状态,是其其他工具采用率的两倍以上。
OpenAI 于 9 月 1 日宣布计划很快推出下一代模型 Astra,这是其《准备框架》下首个达到关键网络安全能力门槛的模型,能在无需人类分步指导的情况下发现并开发未知漏洞利用,测试中成功串联利用两个零日漏洞并已向相关维护方披露。
OpenAI CEO 奥尔特曼周二接受 Alex Heath 的《Sources Podcast》采访时明确表示不喜欢智能眼镜,称跟戴着摄像机和灯光装置的人交谈非常不舒服,并暗示扎克伯格无需担心 OpenAI 抢 Meta 智能眼镜生意。
Apple 在与 OpenAI 的持续诉讼中提交了一份新文件,披露从前员工 MacBook 中获取的所谓证据,并继续推动加速证据开示。9to5Mac 报道称该文件包含苹果所称的令人震惊的证据,但材料仅提供摘要,具体细节未给出。
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
OpenAI 公布即将发布的 Astra 模型新细节,称其为首个达到公司“关键网络安全阈值”的大语言模型,能自主发现并利用未知安全漏洞。Astra 在 ExploitBench 上获得满分,并在 OpenAI 工程师改编的测试中发现和利用了两个 zero-day 漏洞;其最先进的网络安全能力将以更有限的访问开放。
OpenAI 在博客文章中表示,因一起未发布模型越狱并入侵 Hugging Face 的事件,公司决定推迟另一未发布模型套件 Astra 的部分开发和发布,以加强安全工作。
OpenAI 发文预告 Astra 将很快可用,称其在 Preparedness Framework 下达到 Critical 网络安全能力阈值。