Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,采用 Apache 2.0 许可,参数量 7.4 亿。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地检索与 RAG 的可行性。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量。该模型 7.4 亿参数,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分,Google 称其表现超过规模两倍的竞品。
巴西 AI 实验室 Supersonic Labs 发布 144.3M 参数的开源决策模型 Julia 1,权重以 Apache 2.0 协议托管在 Hugging Face,可在普通 CPU 上运行,不生成文本,只对 2 到 20 个候选答案输出选择和概率。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
在 2026 骁龙峰会上,高通与 PrismML 发布 1-bit 量化 Bonsai 视觉语言模型,基于 Bonsai 1.7B 构建,可在骁龙 AR1 Gen 1 智能眼镜平台本地运行 20 亿参数模型。官方称相同内存下可容纳约 4 倍参数,内存占用约为传统 4-bit 模型的 1/4,文本 Token 生成速度翻倍,识图、翻译、环境问答等交互可离线完成,同时降低功耗、改善续航与发热。
2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版端侧适配阶跃 StepEdge-Omni 30B-MoE 模型,并现场演示智能体助手。
中国电信于 9 月 17 日发布并开源新一代星辰大模型 Xing4.0-29B-A4B,总参数量 29B、激活参数 4B,原生支持 256K 上下文、可扩展至 512K,官方称是国内首个基于国产算力与国产框架完成训练的百亿参数大模型。
PrismML 发布 Ternary Bonsai 2 27B,将 Qwen3.8 27B 转为三值权重,模型仅 5.93 GB(FP16 为 53.80 GB),Apache 2.0 开源,官方称在 20 个基准上保留母模型 98.2% 的平均分,支持文本与图像输入和 262K token 上下文。
PrismML 宣布推出三值量化版本的 Bonsai 2 27B,基础模型升级至 Qwen3.8 27B,以不到 1/9 的内存占用在综合基准测试中达到基础模型 98.2% 的分数,整体表现好于 Qwen3.6 27B。
PrismML 发布 Ternary Bonsai 2 27B,基于 Qwen3.8 27B,采用三值权重加 FP16 分组缩放,有效每权重 1.76 bit,模型体积 5.9GB,比全精度模型小 9 倍以上,基准综合得分 83.9,保留全精度模型 98.2% 的性能。
AI 实验室 PrismML 发布 Bonsai 2 27B,将阿里开源模型 Qwen3.8 27B 压缩到 5.9 GB,内存较原版减少 9 到 10 倍,可放进 PC 甚至高端智能手机。
浙江大学等高校的外部研究者以 MiniCPM-o 4.5 为基座后训练,开源了端到端全模态交互智能体 Gander,论文、数据、代码和模型全部开放。
vivo 在 2026 开发者大会上发布四款蓝心大模型,包括端到端 MoE 架构的 BlueLM-RealTime、30 亿参数的 BlueLM-Nano 和搭载自研 Agentic 引擎的 BlueLM-Flash / Pro。同时推出系统级蓝心 Harness,深入原系统内核层,已增加 6000 多项原子技能,支持超万种任务,并预研蓝心 30B MoE 端侧大模型。
面壁智能转发用户实测,MiniCPM5-2B 已可在 Android 上通过 llama.cpp 加载 GGUF 完成推理,全程数据不离开手机。
面壁智能 MiniCPM5-2B 登顶 Hugging Face Trending,在 AA Intelligence Index V4.1.1 评测中位居全球 4B 以下开放权重模型首位,34 项基准平均得分 53.9。
欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。
面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,在 AA 榜单获 23 分,居全球 4B 以下开源基座模型第一,Agentic Index 达 20 分,同级模型如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 仅 2 分。
OpenBMB 发布 MiniCPM5 端侧模型,采用 Apache 2.0 协议,1B 与 2B 版本支持 128K 上下文、编码、推理和智能体工具调用。
9 月 8 日,面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,支持工具调用、深度搜索、代码生成。
OpenBMB 发布 MiniCPM5 系列第二个 checkpoint MiniCPM5-2B,2.52B 稠密模型,原生 131,072 token 上下文,Apache 2.0 权重,采用标准 LlamaForCausalLM 架构,可通过 vLLM、SGLang、llama.cpp、Ollama 等主流引擎直接运行。
科大讯飞旗下词元星火发布并开源星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,原生支持最长 100 万 Token 上下文窗口。
Google DeepMind 发布多语言手语转文本模型 SL2T,在 Gboard 和 Live Transcribe 中为 Pixel 11 提供手语听写功能,首发支持美国手语(ASL)转英文。
推荐理由:Google DeepMind 发布多语言手语转文本模型 SL2T,并首次落地 Gboard 与 Live Transcribe,可了解其数据规模与隐私设计。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。