Google 发布 EmbeddingGemma 2,称多模态嵌入基准超越两倍规模竞品
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量。该模型 7.4 亿参数,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分,Google 称其表现超过规模两倍的竞品。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量。该模型 7.4 亿参数,在 Massive Text Embedding Benchmark(Code)上得分 78.68,比前代 68.76 提升近 10 分,Google 称其表现超过规模两倍的竞品。
Aleph Alpha 发布 Kolibri,一个德语和英语双语模型,总参数 78B,通过 MoE 架构每 token 激活约 3B。公司称 Kolibri 在两种语言的质量与运行成本上处于帕累托前沿,德语基准得分 71%,解码速度快于 GPT OSS A5B、Qwen 3.6 A3B 和 Gemma 4 A4B 等同类模型。
Cloudflare 发布面向 AI 智能体的决策模型 Clef 和 Clef-flash,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对带标签表格做单次前向推理即可完成分类和回归,无需训练、调参或特征工程。
推荐理由:官方技术博客披露了架构、纯人工数据预训练配方和四项基准成绩,读者可据此评估其替换梯度提升树的可行性。
H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。
推荐理由:原文给出跨 GUI、代码、MCP 和 API 的统一智能体模型设计、基准分数和成本对比,并开源权重与轨迹数据,读者可评估其实际可用性。
Knowledgator Engineering 发布 schema 条件化编码器框架 GLiFormer,单个模型可在推理时按标签和 schema 完成 NER、分类、关系抽取、嵌套 JSON 结构化和文本嵌入。
Google Research 发布 TimesFM-3 时序预测模型,可同时处理多个相关变量,并利用折扣计划、天气预报等已知未来事件改进预测,每步输出九个值以刻画不确定性。
H Company 发布 NeoMME 系列多模态编码器,包含 260M 和 800M 两个双向 Transformer 模型,用单一塔处理多语言文本和 32×32 图像块,去掉了独立视觉塔和因果解码器,以离散掩码扩散方式预训练。
HojoAI 的 Hojo-ASR-Multi-V1 正式上线 Open ASR Leaderboard,全球排名第 7、开源多语言 ASR 第 1,五语言平均 WER 3.54%。
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Google DeepMind 开源文本扩散模型,给出 4x 推理加速与本地部署的硬件门槛,可据此判断速度优先场景的取舍。