#部署/工程
#部署/工程
今日 12 条
SpaceXAI@SpaceXAIAI 评分3434Hacker News 热门(buzzing.cc 中文翻译)AI 评分6060 Jeff 发布 0.8B 与 2B 决策模型,兼容 Jev 请求格式,单次决策约 22 毫秒
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
TechCrunch:AI(RSS)AI 评分6262 Modal Labs 接近以 157.5 亿美元估值完成 7.5 亿美元融资
据知情人士,AI 推理基础设施公司 Modal Labs 接近完成由 Accel 领投的 7.5 亿美元融资,投后估值 157.5 亿美元,较四个月前 46.5 亿美元估值增长逾两倍。
Databricks:Blog(RSS)AI 评分5858 Databricks 为 Lakebase Postgres 推出 Lakebase Search 向量与全文搜索
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks:Blog(RSS)精选AI 评分6565 Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
Tomer Tunguz 博客(VC 分析)精选AI 评分6363 Tomer Tunguz 解析 GPU 租金翻倍而 AI 价格下降的并行逻辑
GPU 租赁价格在九个月内从 $4.40 翻倍到 $8.08 每 GPU 小时,但 AI 使用价格仍在下降。
推荐理由:文章用 GPU 租金翻倍与 AI 推理降价并存的数据,解释两条曲线如何靠效率提升维持平衡,并指向每 GPU 小时毛利这一关键指标。
SemiAnalysis@SemiAnalysis_AI 评分3030
François Chollet@fcholletAI 评分3636SemiAnalysis 长文 RSS(RSS)AI 评分5151 SemiAnalysis 解析 GLM5.3 稀疏注意力对 HBM 内存与推理成本的影响
SemiAnalysis 分析 GLM5.3 的 DeepSeek Sparse Attention 如何影响 HBM 内存使用,指出 top-k 选择仍需完整上下文驻留 HBM,稀疏注意力并不直接降低内存容量瓶颈。
Mistral AI:News(网页)AI 评分5353 Mistral 在慕尼黑设立德国中心,发力工业 AI 与 Physics AI
Mistral 宣布在慕尼黑开设新中心,设立专注 Physics AI 和工业 AI 的研究团队,并直接服务企业客户。2026 年 5 月收购 Emmi AI 后,超过 30 名物理与工程 AI 研究人员加入;目前正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)利用其风洞设施研发汽车空气动力学数字孪生。
AWS Machine Learning Blog精选AI 评分6262 Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Rohan Paul@rohanpaul_aiAI 评分6363
elvis@omarsar0AI 评分5252AWS Machine Learning BlogAI 评分3333 用 vLLM-Omni 在 SageMaker AI 上构建实时语音应用(上):流式部署 Qwen3-TTS
AWS 发布教程,演示如何用 vLLM-Omni Deep Learning Container 在 Amazon SageMaker AI 上部署 Qwen3-TTS 文本转语音模型,实现边生成边播放的流式语音输出。
Unsloth AI@UnslothAIAI 评分5555
🚨 AI News | TestingCatalog@testingcatalogAI 评分5757
Thomas Wolf@Thom_WolfAI 评分7171公众号:千问APP(阿里)AI 评分3737 千问APP接入中国移动算力套餐,支持Token额度直接抵扣
2026年9月28日,千问APP与PC端宣布接入中国移动算力套餐。已订阅该套餐的用户可在千问“工作助理”中直接使用本人中国移动账户内的Token额度,相关消耗将从对应账户扣除。双方还推出联名版,办理指定套餐可获千问会员权益。该合作率先在广东、湖南、湖北、江苏等地试推,后续将推向全国。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5050Hacker News:AI 热帖精选AI 评分8686 Claude Opus 5.5 提示词指南:与 Opus 5 的行为差异及迁移模式
Anthropic 官方文档介绍针对 Claude Opus 5.5 的提示词模式,覆盖 effort 校准、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、视觉输入和前端设计等场景。
推荐理由:官方文档梳理了从 Claude Opus 5 迁移到 5.5 时的具体提示词与 harness 调整点,可直接对照排查现有集成的问题。
IT之家(RSS)AI 评分3535 映众推出基于英特尔 W790 平台的塔式 GPU 工作站
映众(INNO3D)发布全塔 GPU 工作站 AWS-511Z-R1。该设备基于英特尔 W790 平台,支持至强 W 系列处理器及 DDR5 RDIMM 内存。其配备双 3000W 钛金电源,可容纳 2 张 RTX PRO 6000 Blackwell 或 4 张 RTX PRO 4500 Blackwell 显卡,并集成 BMC 管理芯片及多种存储与网络接口。
Rohan Paul@rohanpaul_aiAI 评分4545MarkTechPost(RSS)AI 评分6060 TypeSafe AI 的 Jev 的 20 个智能体用例解读
MarkTechPost 整理了 TypeSafe AI 首个 System One 决策模型 Jev 的 20 个智能体用例,涵盖模型路由、工具调用风险把关、重排、引用核验与提示词注入筛查等。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6767 Privatemode 团队用 GLM-5.3-Flash 将 LLM 变成单次前向的类型化决策模型
Privatemode 团队展示了一种无需微调的方法,通过编号选项、预填 choice_index: 前缀并读取选项索引的 log 概率,让 GLM-5.3-Flash 在单次前向中输出带概率的类型化决策。
IT之家(RSS)AI 评分5656 开发者 Daniel 一天两更 DLSS-NR-on-AMD,让 AMD 显卡运行 DLSS 5 性能累计提升近 74%
开发者 Daniel 的 DLSS-NR-on-AMD 工具可让 AMD Radeon 显卡运行 DLSS 5 神经渲染,支持 RX 9000 系列,据报道也可用于 RX 7000 系列。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分7070 DeepSeek 发布 DSec 弹性计算沙箱平台技术报告,支撑大规模智能体 RL 训练
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6868 Floci 发布可在本地模拟 AWS、Azure、GCP 和 OCI 的开源云模拟器
Floci 推出本地云模拟工具,可分别模拟 AWS、Azure、GCP 和 OCI 服务,采用 MIT 许可证,无需账号、认证令牌或凭证。AWS 模拟器提供 119 个服务,24ms 启动,可作为 LocalStack 的零代码替换;Azure 覆盖 28 个服务,GCP 25 个,OCI 8 个。
elvis@omarsar0AI 评分5353
SemiAnalysis 长文 RSS(RSS)AI 评分5050 Intel Panther Lake 拆解:18A 工艺与 PowerVia 背供电首次商用落地
SemiAnalysis 拆解 Intel Panther Lake(Core Ultra 7 365),这是首个商用落地背面供电网络(BSPDN)的芯片,也是 Intel 首代 GAA 晶体管 RibbonFET 与 Foveros-S 封装的展示。
IT之家(RSS)AI 评分5252 OpenCode 宣布 DeepSeek V4.1 Flash 的 60 美元额度永久有效
OpenCode 宣布“Operation Cheepseek”第二阶段启动,DeepSeek V4.1 Flash 在 OpenCode Go 中的 60 美元额度(约合 403.5 元人民币)由限时调整为永久有效,原 15 美元额度被划线标记。
The Decoder:AI News(RSS)AI 评分6161 Nvidia SoL-Pi 系统优化 agent harness,编码任务 token 用量减少近一半
Nvidia 研究人员提出 SoL-Pi 系统,用研究 agent 自动优化编码 agent 的控制层(harness),在 EdgeBench 上相比 Codex 节省 50%、相比 Claude Code 节省 54.3% 的 token,性能与原 Pi harness 大致持平。
MarkTechPost(RSS)AI 评分5757 用 AugLy 构建图像、文本、音频多模态数据增强与对抗鲁棒性基准教程
本教程基于 AugLy 构建覆盖图像、文本、音频的端到端多模态数据增强与鲁棒性工作流。教程解决依赖兼容问题,生成确定性合成数据集,演示 AugLy 的函数式与类式 API。
HuggingFace Daily Papers(社区热门论文)AI 评分4141 WaveFront Decoding:面向循环语言模型的无训练自推测解码框架
WaveFront Decoding(WFD)是一种面向循环语言模型的无训练自推测解码框架,利用中间循环输出作为草稿预测、并借助权重共享批量处理不同位置与循环深度的 token 状态。
MarkTechPost(RSS)AI 评分5555 Liquid AI 发布 LFM2.5-VL-3B-DSpark 投机解码草稿模型,解码最高提速 3.13 倍
Liquid AI 发布 LFM2.5-VL-3B-DSpark,一个为其视觉语言模型 LFM2.5-VL-3B 设计的实验性投机解码草稿模型,新增约 279.5M 参数(+8.9%),在 Apple silicon 上解码最高提速 3.13 倍,NVIDIA H100 上最高 2.66 倍。
IT之家(RSS)AI 评分6565 Anthropic 与 Akamai 签署 7 年 116 亿美元 CPU 算力协议
Akamai 宣布与 Anthropic 签署为期 7 年、价值 116 亿美元的合同,将以其分布式人工智能基础设施和软件满足 Anthropic 日益增长的 CPU 工作负载需求。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5555 Ollaya 发布,本地运行开源决策模型并兼容 TypeSafe API
Ollaya 发布,一个开源的本地决策模型运行工具,对文本或 JSON 的类型化问题返回毫秒级校准答案。支持 laya、decider、nli、gliclass 等开放权重模型,兼容 TypeSafe 的 /v1/systemone 和 /v1/models 接口,官方 TypeSafe Python SDK 0.7.1 可直接使用。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分5858 Go 1.26/1.27 推出平台无关的实验性 SIMD 接口
Go 团队宣布 Go 1.26 和 1.27 引入实验性 SIMD API,Go 1.27 新增完全可移植、平台与向量长度无关的 simd 包,松散借鉴 C++ 的 Highway,目标是在支持 SIMD 的平台上写出一次编写、接近汇编性能的代码。
TechCrunch:AI(RSS)AI 评分6565 英国 AI 云厂商 Nscale 美国上市前完成 33.6 亿美元可转债融资
英国 neocloud 厂商 Nscale 宣布在年内 IPO 前获得 33.6 亿美元可转债融资,其中 23.6 亿美元即时到账,另 10 亿美元来自现有投资者 Nvidia,将于 11 月中旬到位,IPO 完成后转为股权。
The Verge:AI(RSS)AI 评分5656 Meta 确认 Muse 开放文件系统下载属于有意设计
Meta 的 AI 聊天机器人 Muse 现在会主动打包整个文件系统供用户下载,Meta Superintelligence Labs 的 David Singleton 称这是刻意设计,Muse Secure VM 是用户自己在云端可自由操作的 Linux 机器。
SemiAnalysis 长文 RSS(RSS)AI 评分6666 SemiAnalysis 发布中国数据中心模型,测算中国存量容量超过 24GW
SemiAnalysis 发布 China Datacenter Model,追踪中国 1,000 多座数据中心设施、覆盖 60 多家运营商,测算中国存量容量超过 24GW,另有约 20GW 在建和约 30GW 已公布项目。