跳到正文

#DeepSeek

今日 0 条
9月12日周六
9月11日周五
  1. IT之家(RSS)68

    消息称月之暗面凭 Kimi K3 瞄准年底 20 亿美元年化收入,估值 500 亿美元融资

    据彭博社报道,凭借 Kimi K3 模型的成功,月之暗面计划今年年底前将年化收入提高数倍至 20 亿美元(约合 134.56 亿元人民币)。知情人士称公司 8 月年度经常性收入已突破 10 亿美元,较 6 月的 3 亿美元大幅增长,7 月发布的 Kimi K3 推动了这一增长。公司正以 500 亿美元估值融资,最快可能今年赴港上市,并与微软、亚马逊和谷歌洽谈 30% 的收入分成。

  2. 公众号:卡尔的AI沃茨76

    实测 DeepSeek V4.1 Flash:价格大降、原生带视觉,作者用游戏与城市生成任务验证表现

    作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。

    推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。

9月10日周四
  1. IT之家(RSS)59

    DeepSeek V4.1 Flash 模型上线国家超算互联网

    DeepSeek V4.1 Flash 模型 9 月 10 日上线国家超算互联网中心,用户可在官网「模型服务」页面调用其 API。该模型为 552B 参数 MoE 模型,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B;基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。

  2. MarkTechPost(RSS)87

    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

    推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。

  3. DeepSeek:API 更新日志80

    DeepSeek 发布 V4.1-Flash,API 价格同步下调

    DeepSeek 发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,评测包括 GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 90.6 等。

    推荐理由:官方发布附带完整评测数字和 API 切换细节,读者可据此判断新模型能力水平及旧模型下线对现有调用和计费的影响。

  4. Ars Technica:AI(RSS)79

    NSA、CISA 与 FBI 指控 DeepSeek 等六家中国 AI 公司大规模蒸馏美国前沿模型

    NSA、CISA 和 FBI 联合指控 DeepSeek、Moonshot AI、阿里巴巴、MiniMax、StepFun 和 Z.AI 至少自 2024 年底起对美国模型开展工业级蒸馏攻击,涉及 Claude、GPT、Gemini 和 Grok 的多个变体。机构称这些公司可能在“中国政府知情”下行动,借此缩短研发周期、减少训练前沿模型的成本。

  5. DeepSeek 官方82

    DeepSeek V4.1 Flash 发布,视觉理解进入默认 Flash API

    DeepSeek 发布 V4.1 Flash,在新架构下加入原生视觉理解,并通过 deepseek-flash 接口提供。旧版 V4 Flash 与视觉实验版已退役,原名称暂时指向新版;公告还宣布下调 API 价格。本次发布没有提供可核实的权重开放信息。

    推荐理由:原生视觉进入默认 Flash 接口,同时发生旧模型映射调整,使用方需要重新检查模型选择与多模态任务表现。

9月9日周三
  1. IT之家(RSS)78

    曝 DeepSeek 聘请中信证券筹备科创板 IPO,目标年内递交申请

    路透社报道称,DeepSeek 已聘请中信证券筹备科创板上市,目标今年递交 IPO 申请、明年挂牌,募资将用于算力基建、模型研发、芯片自研与人才激励。公司正推进新一轮融资,目标估值约 5000 亿元人民币,此前 6 月完成约 74 亿美元首轮外部融资,投后估值超 500 亿美元;2026 年前 7 个月营收约 4.75 亿元。

    推荐理由:综合路透与金融时报报道,梳理了 DeepSeek 的 IPO 筹备、融资结构与场外份额乱象,可帮助读者了解其资本化进程的全貌。

  2. Tianyi Cui52

    DeepSeek 针对约 150 个资深后端/服务端工程师社招岗位重新设计了笔试和面试。笔试删除 ACM 类代码题改为系统设计题,算法题只需写思路或伪代码,面试流程时间跨度大幅缩短;校招仍沿用原有题目。岗位涵盖大模型研究平台、Agent 框架组件、DeepSeek API 等方向,工作地点北京(优先)或杭州,简历可投 talent@deepseek.com 或扫码投递。

9月8日周二
9月7日周一
9月5日周六