跳到正文

#部署/工程

今日 12 条
9月16日周三
  1. HuggingFace Daily Papers(社区热门论文)45

    RayOrch:面向基础模型数据准备的谱系控制多粒度数据流执行引擎

    RayOrch提出了一种编程模型和分布式执行引擎,用于解决基础模型训练数据准备中异构文档和视频转换的扩展性问题。它通过保留父子关系、支持有序变量基数扩展及匹配收集,优化GPU批处理效率。在NVIDIA H20 GPU上,RayOrch将MinerU从4卡扩至64卡时加速15.14倍,视频流水线从8卡扩至64卡时加速7.82倍,端到端时间较Ray Data减少13.1%。代码已开源。

  2. Aravind Srinivas69

    Perplexity CEO Aravind Srinivas 宣布自研键值数据库 CobbleDB,替代 AWS DynamoDB 用于快速网页内容抓取,迁移后每年最多可节省一亿美元。该项目由两名工程师和数百个持续运行的 Computer 智能体在两个月内完成核心基础设施,官方研究称热存储批次读取延迟较 DynamoDB 全分布下降约 5 倍(P50 从 31.4ms 降至 5.60ms)。

    推荐理由:原文给出成本节省数字和构建方式,图片补充了批次读取延迟的具体对比数据。

  3. NVIDIA Technical Blog:Agentic AI / Generative AI53

    NVIDIA 技术博客解析 Dense 与 MoE 模型的参数激活、吞吐差异及选型方法

    NVIDIA 技术博客讲解 dense 与 MoE 架构在参数激活、吞吐和部署上的差异,以 Nemotron 3.5 Lightning 为例说明 MoE 每词元仅激活约 3B 参数、总参数 30B 仍需约 60 GB 显存。文章给出按显存预算、并发、微调和量化需求选型的建议,并对比 Gemma 4 31B、Qwen3.8-27B、Mistral Small 4 等模型的输出速度与价格数据。

  4. Claude:Blog(网页)65

    Claude for Small Business 新增 43 个 workflow 与 27 个集成

    Anthropic 为 Claude for Small Business 新增 43 个 workflow 和 27 个集成,覆盖 Shopify、Salesforce、TikTok、Zoom、Stripe、Zapier 等工具,该产品自 5 月上线以来安装量超过 90 万次。

    推荐理由:原文给出43个workflow、27个新集成和默认审批模式的控制方式,读者可以据此判断它怎样接入小店现有的工具链。

9月15日周二
  1. IT之家(RSS)61

    Meta 计划明年上半年部署新一代自研 AI 芯片,12 个月内目标部署超 1GW

    据彭博社报道,Meta 计划明年上半年在数据中心部署新一代自研 AI 芯片,以降低运行 AI 模型的成本和能耗。目前正测试第三代产品 MTIA 450(代号 Arke),下一代 MTIA 500(代号 Astrid)预计约一个月后完成设计,2027 年底进入数据中心;Meta 计划 12 个月内部署超 1GW 规模自研芯片。

  2. Hacker News 热门(buzzing.cc 中文翻译)54

    fugleramme 开源:用 Raspberry Pi 和 BirdNET-Go 打造能聆听鸟鸣的电子墨水画框

    作者开源 fugleramme,一个基于 Raspberry Pi 5 和 Inky Impression 13.3 英寸电子墨水屏的画框,通过 BirdNET-Go 在本地实时识别麦克风听到的鸟鸣,并匹配 19 世纪公共领域博物学插画渲染展示,已收录超过 800 张手工抠图、覆盖 400 多个物种。

  3. Hacker News 热门(buzzing.cc 中文翻译)53

    将 35kb 预提示从 Opus 迁移到自托管 Ollama 的踩坑笔记

    作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。

  4. Claude:Blog(网页)51

    Anthropic 联合 Accenture 发布 AI 从试点到生产的部署指南

    Anthropic 与 Accenture 联合发布帮助 CIO 和技术负责人把 AI 项目从试点推进到生产的实用蓝图。指南引用 Accenture 2026 年 7 月报告称仅 23% 的高管认为 AI 项目取得持续的企业级影响,并列出按时间顺序的七项考量、四部分任务定义、轻量总拥有成本模型、四层监督模型及决策过渡蓝图。

  5. Claude:Blog(网页)66

    Anthropic 工程师复盘:智能体编程压力下如何扩展测试影响分析服务

    Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。

    推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。

  6. SiliconFlow66

    硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。

    推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。

9月14日周一
9月13日周日
  1. MarkTechPost(RSS)79

    Agent 长任务上下文工程解析:用预算控制、压缩、todo-state 和记忆对抗上下文溢出与目标丢失

    文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。

    推荐理由:文章把解决长任务中上下文溢出与目标丢失的机制拆成四类,并对照多款主流 Agent 产品的具体实现和阈值,便于读者迁移到自己的系统。