Mistral 发布 Mistral Large 4 预览版 Le chonk
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,基于自有 3800 块 NVIDIA Grace Blackwell GPU 集群训练,目前通过其 API 提供。
据 Bloomberg 报道,DeepSeek 新一轮融资接近至少 120 亿美元,最初目标约 75 亿美元、估值约 750 亿美元,知情人士称总额可能接近 150 亿美元,宁德时代与腾讯出资份额最大。
推荐理由:DeepSeek 融资规模从 75 亿美元估值扩至最高 150 亿美元,并给出 2027 年 IPO 与自研推理芯片的后续安排。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
DeepMind 研究者提出「人工共生智能」(Artificial Symbiotic Intelligence),主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 的发布清单与第三方评测数据,可一次看清产品线变化和定价调整。
DeepSeek Harness v0.2 预览版发布,提供 macOS 和 Windows 桌面端安装包,已上线 DeepSeek 官网。新版本新增插件安装与管理页面(无需命令行,输入 npm 包名即可安装),内置可按计划执行重复性工作的自动化任务插件,并优化了文件展示、代码变更展示体验。官方称约 60% 的用户使用了第三方插件,团队计划建设官方插件市场。
中国互联网络信息中心在 2026 中国互联网基础资源大会上发布《生成式人工智能应用发展报告(2026)》,截至 2026 年上半年我国生成式人工智能用户规模超 7 亿人,普及率突破 50%。
英伟达 CEO 黄仁勋在 CNBC《财经早间》节目上表示,利用其他模型输出训练新模型的蒸馏属于市场竞争,与美财政部长贝森特 7 月称其为“盗窃”的定性相反。他以竞品拆解英伟达产品为例,称竞争会让一切更好。此前 CISA 指责中国 AI 企业开展“工业规模知识蒸馏”,Anthropic 称发现阿里巴巴和 DeepSeek 存在“非法蒸馏”行为,中方已驳斥相关指控。
SemiAnalysis 分析 GLM5.3 的 DeepSeek Sparse Attention 如何影响 HBM 内存使用,指出 top-k 选择仍需完整上下文驻留 HBM,稀疏注意力并不直接降低内存容量瓶颈。
KernelZero 提出协同进化框架,用 Proposer 从 API 集合生成 Torch 模块、Coder 将其翻译为 CUDA 或 Triton kernel,并引入 CA-GRPO 在正确性可靠后再优化性能。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
OpenCode 宣布“Operation Cheepseek”第二阶段启动,DeepSeek V4.1 Flash 在 OpenCode Go 中的 60 美元额度(约合 403.5 元人民币)由限时调整为永久有效,原 15 美元额度被划线标记。
针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究发现,MoE 模型合并后大部分专家重分配源于输入偏移而非同层参数变化,源路由差异难以预测恢复源路由带来的下一 token 似然增益。
DeepSeek Harness 悄然上线官方桌面版开发者预览,版本号 V0.1.7-rc.2,无需安装 Node.js、开终端或手动运行 npx,目前支持 Windows x64 和 macOS Apple Silicon(M 系列)。
据 The Information 报道,DeepSeek 年化营收突破 10 亿美元,已确定 75 亿美元(约合 504.2 亿元人民币)融资。公司计划 10 月底前完成本轮融资,目标募资 500 亿元人民币,估值目标 5,000 亿元人民币,并筹备在上交所上市。梁文锋称 70% 以上算力投入模型训练,调价未造成客户流失,轻量化模型可在游戏显卡上稳定运行。
DeepSeek 发布 DSec(DeepSeek Elastic Compute)论文并署名梁文锋,公开用于 Agent 训练的沙盒基础设施技术细节。
据路透社援引知情人士消息,DeepSeek 将于本周参加联合国安理会会议,讲解 AI 安全风险。安理会 15 个成员国计划周三开会讨论 AI 与国际安全问题,DeepSeek 和月之暗面等中国 AI 企业均受邀发言,OpenAI CEO 奥尔特曼计划演讲,Anthropic 代表也可能出席。DeepSeek 创始人梁文锋暂无出席计划,但安排仍可能调整。
小米发布 MiMo-V2.6 系列,旗舰 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得 46 分,居开源模型之首,价格为每百万输入 token $0.435、输出 $0.87。
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米以约 300 万美元训练成本推出原生全模态开源模型,并公开 RL 环境与训练配方,可对照中国开源模型的成本路线。
SemiAnalysis 分析 Engram 架构(在标准 token 嵌入上扩展学习式多 token 查找)如何通过协同设计将嵌入表卸载到主存 DRAM 或 SSD,在同等质量下降低模型所需的 HBM 容量。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。
作者解读《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告,指出该模型虽名为 V4.1 Flash,但架构变化足以视作 V5 级迭代。
DeepSeek v4.1 主 Attention 算子负责人刘胜与 9 月 14 日发文《我不得不把才华埋葬在昨天》,文章获微信公众号 10 万+ 阅读并登上知乎热榜第一。
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。