inclusionAI 在 ModelScope 发布开源视觉模型 Ling-3.0-flash-VL,采用 MIT 协议,提供 BF16 和 FP8 两种权重。
#多模态
#多模态
今日 0 条
Ant Ling@AntLingAGIAI 评分5555
Ant Ling@AntLingAGIAI 评分5454公众号:蚂蚁百灵(Ling)AI 评分6565 蚂蚁百灵开源首个原生多模态大模型 Ling-3.0-flash-VL
蚂蚁百灵发布并开源首个原生多模态大模型 Ling-3.0-flash-VL,基于 Ling-3.0-flash 的 MoE 架构,总参数 124B,单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口 256K Token。
OpenRouter:Announcements(RSS)精选AI 评分7171 OpenRouter 评测 Seedance 2.5:长镜头与已有素材编辑的场景及成本解析
OpenRouter 发布对 ByteDance Seedance 2.5 视频模型的评测,该模型自 2026 年 8 月 7 日上线其视频 API,生成 4 到 30 秒、480p 或 720p 的片段,支持图像、视频、音频引用和首尾帧控制,音频同趟生成不加价。
推荐理由:原文基于自家端点数据给出 Seedance 2.5 的计费公式、能力边界和与 Seedance 2.0、Wan 3.0、Veo 3.1 的逐项对比,便于按需求选型。
OpenRouter:Announcements(RSS)精选AI 评分6464 OpenRouter 教程:用代码调用 Nano Banana 2 编辑图像
OpenRouter 发布教程,演示通过 API 向 google/gemini-3.1-flash-image(即 Nano Banana 2)发送源图和文本指令完成图像编辑,编辑结果以 base64 形式在响应中返回。教程给出 Python 和 TypeScript 示例、提示词写法、多轮小步编辑方法,以及更换模型只需改一个字段,并介绍了 Nano Banana 系列四个成员的价格与质量差异。
推荐理由:原文给出完整可运行的图像编辑请求代码和提示词写法,读者可以照搬并把模型换成其他供应商做对比。
Ant Ling@AntLingAGIAI 评分5252
Google AI@GoogleAIAI 评分5656Google DeepMind:Blog(RSS)AI 评分5555 Google DeepMind 发布 AlphaGenome Atlas,绘制人类基因组单碱基变异预测图谱
Google DeepMind 发布 AlphaGenome Atlas,绘制了覆盖人类基因组中 90 亿个单碱基 DNA 变异分子效应的预测图谱。该图谱为研究基因变异的影响提供了系统性的预测资源。
公众号:小米 MiMoAI 评分5757 Xiaomi MiMo Desktop 桌面客户端开放邀测,携 MiMo-X 系列 Preview 模型
Xiaomi MiMo Desktop 桌面客户端携两款新一代模型 Preview 版(MiMo-X-Pro-Preview、MiMo-X-Flash-Preview)正式开放邀测,用户可提交申请限时免费体验。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分5757 蚂蚁 inclusionAI 发布块扩散视觉语言 GUI 智能体 LLaDA-UI
蚂蚁 inclusionAI 在 Hugging Face 发布 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI 智能体,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
ViggleAI@ViggleAIAI 评分3333公众号:百度智能云(文心)AI 评分3232 加南科技F2 AR智能眼镜携手百度智能云探索心跳感知
百度智能云介绍与杭州加南科技的合作:F2 AR智能眼镜不配置摄像头,通过PPG心率、IMU、语音、位置与交互信号为AI提供用户上下文,心率偏离基线时可结合情境生成可确认或忽略的状态提示,并形成Heart Moment心情可视化功能。架构上终端负责感知与AR呈现,云端由百度智能云提供大模型、实时语音、翻译、百度地图与百舸、千帆等能力,形成端云协同的一体化方案。
OpenAI Developers@OpenAIDevsAI 评分8181
Google AI@GoogleAIAI 评分4646Google AI 发布本周产品盘点。Gemini 3.8 Flash 在编码、Agent 工作流和多步推理上升级;Gemini 3.8 Flash Cyber 主打漏洞检测与自动补丁。
Google Gemini@GeminiAppAI 评分4848Google 在 Gemini 中推出最先进音乐生成模型 Lyria 3.5,带来更丰富的编曲、更具表现力的人声和更高保真度。用户可选择音乐类型和人声或纯器乐,探索新模板,并生成较短或更长的曲目。
SiliconFlow@SiliconFlowAIAI 评分6464
Artificial Analysis@ArtificialAnlysAI 评分6767Meta Superintelligence Labs 首个图像模型 Muse Image 在 Artificial Analysis Image Arena 首次上榜。
OpenAI Developers@OpenAIDevsAI 评分6363OpenAI Developers 宣布 GPT-6 Astra 是其在电脑使用、软件工程和视觉理解方面迄今最好的模型,并附上正在使用该模型的开发者的视频分享。
Google Research:Blog(网页)精选AI 评分6666 Google 与 HHMI Janelia 发布完整雄性果蝇大脑连接组图谱
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队亲述十年合作的成果与 AI 重建方法,读者可以了解连接组学如何从果蝇推进到脊椎动物。
Runway@runwaymlAI 评分6363
Google AI@GoogleAIAI 评分5555
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型, hourly 更新且分辨率较上一代提升约 5 倍
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。
推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。
Hugging Face:Blog(RSS)AI 评分5454 NeoMME 发布 260M 与 800M 多语言多模态编码器,权重以 Apache 2.0 开源
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
MiniMax (official)@MiniMax_AIAI 评分3838
Baidu Inc.@Baidu_IncAI 评分2929公众号:小红书技术(dots.llm)AI 评分5555 小红书与 vivo 联合打通 3D 图片全链路技术实践
小红书与 vivo 联合打通从 vivo 相册生成 3D 图到小红书发布、分发与消费的完整 3D 内容链路,并共同设计面向移动社交场景的新型 3D 格式。
公众号:面壁智能(MiniCPM)AI 评分6060 开发者基于 MiniCPM-o 4.5 打造本地全模态桌面 Agent AI Jarvis 并开源
林亦团队在 NVIDIA 与抖音平台联合创作合作中,基于 MiniCPM-o 4.5 的低延迟全双工能力打造了本地全模态桌面 Agent AI Jarvis,并开源在 https://github.com/LYiHub/pub-local-jarvis。
公众号:龙猫LongCat(美团)AI 评分4040 美团智播解析数字人直播技术:形象生成、动作驱动与万路并发方案
美团智播官方发布技术长文,介绍AI数字人直播的完整技术闭环,涵盖高保真形象生成与编辑(SDIP、SREdit)、文本驱动动作生成(MoTiGA)、语音手势协调生成(StreamingTalk)和视觉token压缩推理加速(Glance2Gaze)。
Artificial Analysis@ArtificialAnlysAI 评分7070Qwen:Blog Retrieval(API)AI 评分4545 Qwen 发布 Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型
Qwen 团队发布 Qwen-Drive-1.0,称其为首个在预训练阶段统一 3D 感知与视觉问答、并延伸到运动规划的自动驾驶视觉语言基础模型,基于原生多模态 Qwen3.5-4B 且不改动预训练架构。
Artificial Analysis@ArtificialAnlysAI 评分5353
OpenRouter@OpenRouterAI 评分5757Google DeepMind精选AI 评分7474 WeatherNext 3 发布,天气 AI 接入搜索、地图和开发者数据服务
WeatherNext 3 结合实时卫星和地面观测生成逐小时天气预报,并开始接入搜索、Gemini、地图及开发者数据服务。温湿度采用五公里网格,其他变量分辨率不同;其降水精度提升来自具体评测,不能扩大成所有地区和天气都更准确。
推荐理由:天气模型开始进入日常查询与开发者数据服务,公开的分辨率和评测范围有助于判断预测数据适用的场景。
LlamaIndex:产品、工程与评测AI 评分5656 LlamaIndex 发布 Turbo 抽取档位,中位速度每页 3.7 秒
LlamaIndex 在 LlamaParse 平台以 beta 形式推出抽取档位 Turbo,主打低延迟实时工作流。在自建开放基准 ExtractBench 上,其速度约为 Cost Effective 模式的 4 倍,中位处理时间每页 3.7 秒,F1 为 0.84;中等及以上长度文档因页面并行处理降至每页约半秒。定价为每页 35 credits,目前支持的输入类型和配置选项少于其他抽取档位。
公众号:昆仑万维(天工)AI 评分5454 昆仑万维 SkyProduction 天工工作台新版本上线,打通剧本到成片流程
昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。
Google Blog:AI(RSS)AI 评分5252 Google 发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 和 Pixel 11 系列等八月 AI 更新
Google 发布八月 AI 更新汇总:推出面向编码和 Agent 的工作模型 Gemini 3.7 Flash,价格为 Gemini 3.6 Flash 推出价的一半每百万 token。
Claude:YouTube(RSS)AI 评分1414 Claude 将飞行数据转化为可视化演示
Claude 官方频道发布视频,标题为 Claude turns flight data into "look behind you",展示将飞行数据转化为对应内容的过程,正文无更多细节。
Runway:News(网页)AI 评分3939 Miro 如何用 Runway 制作 Canvas26 四城活动的开场视频
Miro 品牌团队分享如何完全用 Runway 制作 Canvas26 年度活动的开场视频,并本地化为四个城市的版本。此前年份依赖素材库加 3D 动效,今年每个镜头包括城市景观、人群和入场镜头都以 Runway 生成,再叠加基于 Miro Flows 节点连线设计的 3D 动效。
Google DeepMind@GoogleDeepMindAI 评分5454Google DeepMind 宣布为最新 Gemini 模型引入智能体视频理解能力。模型现在能以更高准确率分析视频,同时最多减少 88% 的 token 消耗。
Google AI Developers@googleaidevsAI 评分5151