全部AI 动态
全部动态
今日 6 条
Artificial Analysis@ArtificialAnlysAI 评分6161
🚨 AI News | TestingCatalog@testingcatalogAI 评分7171
🚨 AI News | TestingCatalog@testingcatalogAI 评分6565Anthropic 宣布 Claude Fable 5.1 与 Claude Mythos 5.1 发布,Fable 5.1 已在 Claude 和 Claude Code 上线。
Rohan Paul@rohanpaul_aiAI 评分2727
Mark Zuckerberg@finkdAI 评分4848
🚨 AI News | TestingCatalog@testingcatalogAI 评分5757
🚨 AI News | TestingCatalog@testingcatalogAI 评分3333
Rohan Paul@rohanpaul_aiAI 评分6060
AI at Meta@AIatMetaAI 评分6262
Fei-Fei Li@drfeifeiAI 评分5757
World Labs@theworldlabsAI 评分4848推出 Atlas: 全球首个多模态世界模型,可生成图像和视频帧,具备像素级精准的相机控制,并在 3D 中重建它们。 建模世界,移动相机,模拟空间与时间。
Rohan Paul@rohanpaul_aiAI 评分5757Visko 发布首个 Live Model「Orbis 1.0」,一个实时、可引导的视频生成模型,可实时流式生成持续进行的世界,具备持久记忆、交互性和基于物理的无限长度生成。
Google DeepMind精选AI 评分8080 Gemini 3.8 Flash 发布,网络安全版本限定防御团队使用
谷歌推出 Gemini 3.8 Flash,升级编码、推理和长程智能体任务,并接入开发平台及部分付费消费入口。另一个 Flash Cyber 版本只向获准的防御团队开放;普通版本的优惠价格有截止日期,更高推理强度也可能增加用量。
推荐理由:通用版本与安全专用版本采用不同开放范围,团队可以同时比较日常任务能力、推理成本和受控访问条件。
Artificial Analysis 完整文章(网页)精选AI 评分6666 Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型
Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。
推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。
Artificial Analysis 完整文章(网页)精选AI 评分7474 Meta 发布 Muse Spark 1.3,Artificial Analysis 指数达 61/62 分逼近前沿
Meta 发布 Muse Spark 1.3,是其五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
推荐理由:独立评测方给出与同档模型的分数和单任务成本对比,读者可据此判断该模型在智能与成本上的位置。
OpenRouter@OpenRouterAI 评分5757蚂蚁 inclusionAI:HuggingFace 新模型AI 评分5252 蚂蚁 inclusionAI 发布 Ling-3.0-flash 原生混合推理模型
蚂蚁 inclusionAI 发布下一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,约为前代 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,在关键基准上持平或超越前代。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分4545 蚂蚁 inclusionAI 发布 Ling-3.0-flash-singprobe 流式安全探针
蚂蚁 inclusionAI 在 Hugging Face 发布 Ling-3.0-flash-singprobe,一个基于 Ling-3.0-flash 的流式安全护栏探针,复用基座模型隐藏状态在每个 token 上输出意图、不安全性和幻觉风险共 10 类评分,探针参数仅 5.18M,解码开销低于 0.5%。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分4545 蚂蚁 inclusionAI 发布 Ling-3.0-tiny-singprobe 流式安全探针
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个基于 Ling-3.0-tiny 的流式安全探针,仅 3.22M 参数,复用基座模型隐藏状态在每个 token 上输出 8 类意图、不安全响应和幻觉风险评分,解码开销低于 0.5%。
Tencent Hy@TencentHunyuanAI 评分6767IT之家(RSS)AI 评分5757 腾讯混元 Hy4 preview 轻量版发布开源:1.5TB 压至 214GB,支持异构设备联合推理
腾讯混元团队 9 月 1 日发布并开源 Hy4 preview 轻量版,将模型权重从接近 1.5TB 压缩至约 214GB。
IT之家(RSS)AI 评分4242 大连化物所联合科大讯飞、阿里云发布智能化工大模型 3.0 Pro
中国科学院大连化物所联合科大讯飞、阿里云等研发的智能化工大模型 3.0 Pro 于 8 月 31 日发布,从知识问答模型升级为化工任务智能执行系统。模型构建大模型、智能体、专业技能与工具、应用场景四层体系,集成超过 400 个化工智能体和工具,文本问答与多模态问答准确率分别为 81.96% 和 80.75%,综合得分较 3.0 版本相对提升 20.2% 和 31.4%。
上海人工智能实验室 InternLM:原创项目精选AI 评分6363 上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型
上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。
推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。
IT之家(RSS)AI 评分6161 科大讯飞开源词元星火 X2.5-4B 和 1.7B 端侧模型,原生支持 100 万 Token 上下文
科大讯飞旗下词元星火发布并开源星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,原生支持最长 100 万 Token 上下文窗口。
MarkTechPost(RSS)AI 评分4848 Google Research 发布 TimesFM-3:330M 参数多变量时间序列零样本基础模型
Google Research 发布 TimesFM-3,一个 330M 参数、原生支持多变量预测的时间序列基础模型,在超过 1 万亿时间点上预训练,无需任务特定微调即可零样本接受多目标、过去协变量和过去-未来协变量。
Google Research:Blog(网页)AI 评分5555 Google Research 发布 TimesFM-3:330M 参数零样本多变量时序预测基础模型
Google Research 发布 TimesFM-3,一款原生支持多变量时序预测的零样本基础模型,参数量 330M,在超过 1 万亿时间点的真实与合成语料上预训练。
Runway:News(网页)精选AI 评分6767 Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面
Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。
推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。
Microsoft Research@MSFTResearchAI 评分2929Meta 官方精选AI 评分7070 Muse Voice Transcribe 发布,实时转写支持多说话人与语言切换
Muse Voice Transcribe 提供流式语音识别、说话人区分和端点检测,已用于 Meta AI、Muse Code 并通过模型 API 提供。模型训练覆盖七十多种语言,其中二十五种经过深入验证;支持语言切换不代表所有语言质量完全相同。
推荐理由:实时转写同时输出说话人和语言变化,为会议及编程助手保留对话结构,便于后续检索和任务处理。
Microsoft Research 博客(RSS)AI 评分7272 微软研究院发布高效病理基础模型 GigaPath-Flash 与 GigaTIME-Flash
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,旨在通过蒸馏技术大幅降低计算成本以支持大规模病理研究。GigaPath-Flash 将十亿参数模型压缩至 22M 参数,在保持竞争力的同时实现约 50 倍的算力节省;GigaTIME-Flash 则提升了空间蛋白质组学预测效率并改善了泛化能力。两款模型均以 Apache 2.0 协议开源,专为科研设计而非临床诊断,使研究人员能在单 GPU 上处理百万级切片数据。
IT之家(RSS)精选AI 评分7777 DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8
DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。
推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini Omni 1.1 Flash
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延长、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的变化。
Google DeepMind精选AI 评分7171 Google 发布 Gemini 3.5 Transcribe 语音转文字模型
Google 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均词错误率 4.0%,非流式 2.6%;相比上一代 Chirp 3,最终转写时间改善 70%,FLEURS 基准上流式 WER 为 5.50%、非流式为 5.04%。
推荐理由:Gemini 3.5 Transcribe 的 WER、延迟与多语言数据,可用来判断实时语音转写当前的能力水位。
Google DeepMind精选AI 评分7878 Google 发布 Gemini 3.7 Flash,面向编码与智能体并降价一半
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本变化。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 SL2T 手语转文本模型,落地 Gboard 与 Live Transcribe
Google DeepMind 发布多语言手语转文本模型 SL2T,在 Gboard 和 Live Transcribe 中为 Pixel 11 提供手语听写功能,首发支持美国手语(ASL)转英文。
推荐理由:Google DeepMind 发布多语言手语转文本模型 SL2T,并首次落地 Gboard 与 Live Transcribe,可了解其数据规模与隐私设计。
Microsoft ResearchAI 评分4040 Microsoft Research 推出 CARE-X:面向临床放射学的胸部 X 光 VLM
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 WeatherNext 气旋预报模型并开源
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取一天预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋预报多出一天预警时间的实测结果与开源入口,读者可据此判断气象 AI 的可用边界。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时支持调用 Google Search 等工具。
推荐理由:官方给出 ER 2 相对 ER 1.6 的能力升级与开放入口,读者可据此判断机器人在视频理解与多机协作上的进展。
Google DeepMindAI 评分5858 Google DeepMind 在 Flow Music 发布音乐生成模型 Lyria 3.5
Google DeepMind 发布音乐生成模型 Lyria 3.5,并当天在 Google Flow Music 上线。新版本在旋律结构、歌词质量与提示词遵循、人声表现力与发音上均有提升,同时让用户更易控制输出的节奏与时长。
Google DeepMind精选AI 评分7474 Google DeepMind 发布 Gemini Robotics 2,实现机器人全身控制
Google DeepMind 发布 Gemini Robotics 2,由 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三款模型组成,首次实现对人形机器人从脚到指尖的全身控制,并支持双手与夹爪的精细操作和多机器人协作。
推荐理由:官方给出三款模型的定位与开放入口,可据此判断机器人全身控制与端侧适配的进展。