跳到正文

全部动态

今日 6 条
9月12日周六
  1. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。

9月11日周五
  1. IT之家(RSS)55

    小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

    小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。

  2. AGIBOT 智元(网页)56

    智元发布AGILE2.0感控一体模型,灵犀X2完成踩球走等视觉驱动任务

    智元发布AGILE2.0感控一体模型,实现视觉感知、环境理解、全身运动控制与上下肢协同操作的端到端闭环耦合。通过短片《杂技BOT》展示灵犀X2钻火圈、跳长绳、踩球走、协作搬箱子等视觉驱动动态任务,其中踩球走为双足人形机器人自主实现。模型面向动态扰动、人机共存、多机协同等复杂场景,降低现实环境中的定制化开发代价,支持部署态规模化落地。

9月10日周四
  1. IT之家(RSS)56

    NASA 与 IBM 联合发布开源月球基础大模型,可识别月表冰区与撞击坑

    NASA 与 IBM 于当地时间周四联合发布开源的 NASA-IBM 月球基础大模型,可在 Hugging Face 平台下载。对照测试显示,其识别月表可能存在冰区域的误差比基准模型 SwinV2-B 降低 23%;识别分类陨石坑时仅用一半训练数据性能即高出 19%,并在 8 月 5 日 SpaceX 猎鹰 9 号火箭撞击月球后成功识别新形成的陨石坑。

  2. IT之家(RSS)59

    DeepSeek V4.1 Flash 模型上线国家超算互联网

    DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。

  3. IT之家(RSS)56

    高德发布 3D 原生城市世界模型 ABot-Earth 0.7,支持从星球到街景全尺寸生成

    高德发布 3D 原生城市世界模型 ABot-Earth 0.7,称其为全球首个全模态、可预测的 3D 原生城市世界模型,覆盖超过 196 个国家和地区。模型可从卫星图像或文字描述出发,10 分钟内在一块消费级 GPU 上生成公里级 3DGS 格式城市场景,效率较传统模式提升 1000 倍,已应用于飞行街景 2.0,体验官网同步上线。

  4. IT之家(RSS)55

    宇树科技完全开源通用人形机器人基座模型 UnifoLM-WLA-1.0,刷新开源多项评测 SOTA

    宇树科技宣布完全开源新一代通用人形机器人基座模型 UnifoLM-WLA-1.0,称刷新全球开源模型多项评测 SOTA。真机评测中单模型统筹 64 个任务,覆盖桌面操作与全身移动操作,具备跨任务、跨末端执行器的泛化能力,在多项具身推理评测中领先国内外开源模型。

  5. MarkTechPost(RSS)87

    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

    推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。

  6. DeepSeek:API 更新日志80

    DeepSeek 发布 V4.1-Flash,API 价格同步下调

    DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。

    推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。