蚂蚁开源 Ling-3.0-flash-Fin(124B A5.1B)金融模型与 FinFIRST 评测基准
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
蚂蚁集团正式开源面向真实金融工作流的 Ling-3.0-flash-Fin(124B A5.1B),为 MoE 架构、支持最长约 256K 上下文,并同步开放面向金融搜索 Agent 的评测基准 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),中金公司投行团队在构建过程中提供专业支持。
Meta Superintelligence Labs 首个图像模型 Muse Image 在 Artificial Analysis Image Arena 首次上榜。
OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。
推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。
OpenAI Developers 宣布 GPT-6 Astra 是其在电脑使用、软件工程和视觉理解方面迄今最好的模型,并附上正在使用该模型的开发者的视频分享。
蚂蚁百灵宣布开源金融增强模型 Ling-3.0-flash-Fin,面向真实金融工作流,并同时开源由专家构建的金融搜索智能体基准 FinFIRST。两项发布共同目标是让金融 AI 更易获取、更可验证。
蚂蚁集团发布 Ling 3.0 flash Fin,作为 Ant Ling 系列首个金融增强模型,基于 Ling 3.0 flash 用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。
推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。
推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
Qwen 团队发布 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并延伸到运动规划的自动驾驶视觉语言基础模型,基于原生多模态 Qwen3.5-4B 且不改动预训练架构。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两版模型的定价、基准成绩和实际安全应用数据,读者可据此评估在新旧 Flash 模型间的迁移与选型。
WeatherNext 3 结合实时卫星和地面观测生成逐小时天气预报,并开始接入搜索、Gemini、地图及开发者数据服务。温湿度采用五公里网格,其他变量分辨率不同;其降水精度提升来自具体评测,不能扩大成所有地区和天气都更准确。
推荐理由:天气模型开始进入日常查询与开发者数据服务,公开的分辨率和评测范围有助于判断预测数据适用的场景。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。
推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。
推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。
Google 发布八月 AI 更新汇总:推出面向编码和 Agent 的工作模型 Gemini 3.7 Flash,价格为 Gemini 3.6 Flash 推出价的一半每百万 token。
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。
推荐理由:OpenAI 说明了把 Astra 评为 Critical 网络安全能力的评估依据、对应的安全防护设计和受限开放安排,有助于读者理解前沿模型能力分级与放行逻辑。
Claude 官方频道发布标题为 "Claude Fable 5.1 runs the forecast overnight" 的视频,正文无文本。视频展示了 Claude Fable 5.1 在夜间运行预测任务的内容,链接为 https://www.youtube.com/watch?v=S9IJ1GgAAxE。