跳到正文

#DeepSeek

今日 0 条
10月7日周三
10月6日周二
  1. The Decoder78

    DeepSeek 融资规模膨胀,宁德时代与腾讯领投并计划 2027 年 IPO

    据 Bloomberg 报道,DeepSeek 新一轮融资接近至少 120 亿美元,最初目标约 75 亿美元、估值约 750 亿美元,知情人士称总额可能接近 150 亿美元,宁德时代与腾讯出资份额最大。

    推荐理由:DeepSeek 融资规模从 75 亿美元估值扩至最高 150 亿美元,并给出 2027 年 IPO 与自研推理芯片的后续安排。

10月4日周日
10月3日周六
10月2日周五
9月29日周二
  1. IT之家(RSS)58

    DeepSeek Harness 桌面端预览版 v0.2 发布,支持插件安装与自动化任务

    DeepSeek Harness v0.2 预览版发布,提供 macOS 和 Windows 桌面端安装包,已上线 DeepSeek 官网。新版本新增插件安装与管理页面(无需命令行,输入 npm 包名即可安装),内置可按计划执行重复性工作的自动化任务插件,并优化了文件展示、代码变更展示体验。官方称约 60% 的用户使用了第三方插件,团队计划建设官方插件市场。

  2. IT之家(RSS)57

    黄仁勋回应 AI 模型蒸馏争议:这是市场竞争行为

    英伟达 CEO 黄仁勋在 CNBC《财经早间》节目上表示,利用其他模型输出训练新模型的蒸馏属于市场竞争,与美财政部长贝森特 7 月称其为“盗窃”的定性相反。他以竞品拆解英伟达产品为例,称竞争会让一切更好。此前 CISA 指责中国 AI 企业开展“工业规模知识蒸馏”,Anthropic 称发现阿里巴巴和 DeepSeek 存在“非法蒸馏”行为,中方已驳斥相关指控。

9月28日周一
9月27日周日
9月26日周六
9月25日周五
9月24日周四
  1. IT之家(RSS)75

    曝 DeepSeek 确定 75 亿美元第二轮融资,年化营收突破 10 亿美元

    据 The Information 报道,DeepSeek 年化营收突破 10 亿美元,已确定 75 亿美元(约合 504.2 亿元人民币)融资。公司计划 10 月底前完成本轮融资,目标募资 500 亿元人民币,估值目标 5,000 亿元人民币,并筹备在上交所上市。梁文锋称 70% 以上算力投入模型训练,调价未造成客户流失,轻量化模型可在游戏显卡上稳定运行。

9月23日周三
  1. IT之家(RSS)56

    消息称 DeepSeek 本周将参加联合国安理会会议讲解 AI 安全风险

    据路透社援引知情人士消息,DeepSeek 将于本周参加联合国安理会会议,讲解 AI 安全风险。安理会 15 个成员国计划周三开会讨论 AI 与国际安全问题,DeepSeek 和月之暗面等中国 AI 企业均受邀发言,OpenAI CEO 奥尔特曼计划演讲,Anthropic 代表也可能出席。DeepSeek 创始人梁文锋暂无出席计划,但安排仍可能调整。

9月22日周二
9月21日周一
9月20日周日
9月18日周五
  1. HuggingFace Daily Papers(社区热门论文)85

    DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩

    DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。

    推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。

9月17日周四
9月16日周三
9月15日周二
  1. Arena.ai67

    DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型第 3 名,净提升 +4.87%,每任务中位成本 $0.07,重塑 Pareto 前沿。其成本比第 2 名 Hy4 preview 低 68%、成绩仅差 0.09 个百分点;总榜排名第 12,Confirmed Success 信号排名 第 4(+13.75%)。

    推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。

9月14日周一
  1. Dongxi 东锡 NLP58

    DeepSeek 发布 DeepSeek-V4.1-Flash,一款 552B 参数(每 token 激活 16B/预填充 8B)的多模态 MoE 模型,支持最长一百万 token 上下文。其 Causal Encoder-Decoder(CED)架构结合 CSA2 与 FP4 KV caching,将全局 KV cache 降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437,配合 SWA Bounded Replay 将持久 KV cache 降至约 1/8,性能仍优于基线。模型基于 45T token 多模态语料预训练,checkpoint 已在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 开放。

9月12日周六
  1. Baseten 工程博客(网页)76

    DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率

    DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。

    推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。