推荐理由:官方宣布 GPT-6 Astra 上线范围与渠道,Plus 和 Business 用户还需等待几天,读者可据此确认自己能否用上。
模型发布
全部主题新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
最新精选
第 61–80 条 · 共 101 条
OpenAI@OpenAI精选AI 评分8282Microsoft AI:官方博客(网页)精选AI 评分6363 Microsoft 发布 MAI-Image-2.6 与 MAI-Image-2.6-Flash 图像模型
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,称其为迄今最强的图像模型,并面向开发者上线 Microsoft Foundry,同时推出面向低延迟、高吞吐场景的 MAI-Image-2.6-Flash。
推荐理由:原文给出排名、速度和效率数字,并说明两个版本分别面向精度与吞吐的不同场景,便于开发者按工作流选型。
Satya Nadella@satyanadella精选AI 评分6363推荐理由:Satya Nadella 确认 GPT-6 Astra 已在 Microsoft Foundry 开放,早期客户已可在 Azure 上使用。
Greg Brockman@gdb精选AI 评分7272推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。
Aravind Srinivas@AravSrinivas精选AI 评分7070推荐理由:Perplexity CEO 确认 GPT-6 Astra 在其评测中领先,并宣布将向 Pro 和 Max 用户开放。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8181 OpenAI 发布 GPT-6 Astra 并公布安全概览,称其网络安全能力达到 Preparedness Framework 的 Critical 级
OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。
推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7878 IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期
IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。
推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。
TechCrunch:AI(RSS)精选AI 评分8181 OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议
OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。
推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。
Microsoft AI:官方博客(网页)精选AI 评分6464 Microsoft AI 发布语音识别模型 MAI-Transcribe-2
Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。
推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型, hourly 更新且分辨率较上一代提升约 5 倍
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。
推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。
Google DeepMind:Blog(RSS)精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
Sundar Pichai@sundarpichai精选AI 评分6565推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。
Google DeepMind精选AI 评分7474 WeatherNext 3 发布,天气 AI 接入搜索、地图和开发者数据服务
WeatherNext 3 结合实时卫星和地面观测生成逐小时天气预报,并开始接入搜索、Gemini、地图及开发者数据服务。温湿度采用五公里网格,其他变量分辨率不同;其降水精度提升来自具体评测,不能扩大成所有地区和天气都更准确。
推荐理由:天气模型开始进入日常查询与开发者数据服务,公开的分辨率和评测范围有助于判断预测数据适用的场景。
Anthropic:Newsroom(网页)精选AI 评分8787 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。
推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。
Qwen@Alibaba_Qwen精选AI 评分6969推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8282 OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。
推荐理由:OpenAI 说明了把 Astra 评为 Critical 网络安全能力的评估依据、对应的安全防护设计和受限开放安排,有助于读者理解前沿模型能力分级与放行逻辑。
Claude Platform:开发者版本说明(RSS)精选AI 评分7272 Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。
推荐理由:官方版本说明给出定价、缓存和 API 兼容性变化,开发者可据此评估迁移成本与新特性用法。
Google DeepMind精选AI 评分8080 Gemini 3.8 Flash 发布,网络安全版本限定防御团队使用
谷歌推出 Gemini 3.8 Flash,升级编码、推理和长程智能体任务,并接入开发平台及部分付费消费入口。另一个 Flash Cyber 版本只向获准的防御团队开放;普通版本的优惠价格有截止日期,更高推理强度也可能增加用量。
推荐理由:通用版本与安全专用版本采用不同开放范围,团队可以同时比较日常任务能力、推理成本和受控访问条件。
Artificial Analysis 完整文章(网页)精选AI 评分6666 Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型
Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。
推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。
Artificial Analysis 完整文章(网页)精选AI 评分7474 Meta 发布 Muse Spark 1.3,Artificial Analysis 指数达 61/62 分逼近前沿
Meta 发布 Muse Spark 1.3,是其五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
推荐理由:独立评测方给出与同档模型的分数和单任务成本对比,读者可据此判断该模型在智能与成本上的位置。