Amazon Bedrock 将 Claude Opus 5、Sonnet 5、Haiku 4.5 的推理扩展至印度境内
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理让请求仅在 ap-south-1 与 ap-south-2 之间路由,数据留在印度境内。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理让请求仅在 ap-south-1 与 ap-south-2 之间路由,数据留在印度境内。
Amazon Bedrock 现支持在首尔和新加坡区域进行区域内推理的 Anthropic Claude 模型:首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,均通过 bedrock-runtime 端点调用。
AWS 发布基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台参考架构,用 AI 智能体从合同 PDF 中提取结构化字段并交叉验证,解决 RAG 无法跨数百份合同做聚合统计的问题。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容发现任务耗时从平均 250 分钟降至 2 分钟以内。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活运行和构建该模型的方式。
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
GPU 租赁价格在九个月内从 $4.40 翻倍到 $8.08 每 GPU 小时,但 AI 使用价格仍在下降。
推荐理由:文章用 GPU 租金翻倍与 AI 推理降价并存的数据,解释两条曲线如何靠效率提升维持平衡,并指向每 GPU 小时毛利这一关键指标。
Mistral 宣布在慕尼黑开设新中心,设立专注 Physics AI 和工业 AI 的研究团队,并直接服务企业客户。2026 年 5 月收购 Emmi AI 后,超过 30 名物理与工程 AI 研究人员加入;目前正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)利用其风洞设施研发汽车空气动力学数字孪生。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
AWS 发布教程,演示如何用 vLLM-Omni Deep Learning Container 在 Amazon SageMaker AI 上部署 Qwen3-TTS 文本转语音模型,实现边生成边播放的流式语音输出。
2026年9月28日,千问APP与PC端宣布接入中国移动算力套餐。已订阅该套餐的用户可在千问“工作助理”中直接使用本人中国移动账户内的Token额度,相关消耗将从对应账户扣除。双方还推出联名版,办理指定套餐可获千问会员权益。该合作率先在广东、湖南、湖北、江苏等地试推,后续将推向全国。
opencode 宣布其平台上 DeepSeek v4.1 Flash 的 60 美元用量额度转为永久提供,此前该额度为阶段性活动。
GitHub 工程师 Josh Black 复盘将 Primer 设计系统从 CSS-in-JS 迁移到 CSS Modules 的历程。截至 2024 年 12 月 Primer 全部组件迁移完成,服务端渲染时间减少 55%,组件初始化时间减少 25%。
推荐理由:原文给出大厂从 CSS-in-JS 迁移到 CSS Modules 的完整路径和量化收益,可迁移到类似的前端架构改造。
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
Wayfair 使用 OpenAI 模型改进电商客服与商品目录准确性,自动完成工单分类,并大规模优化数百万条商品属性。
vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。
推荐理由:原文给出水印算法原理、双键与去重方案及实测吞吐数据,读者可评估在生产环境启用水印的可行性与代价。
Factory 宣布 Factory Router 的生产环境推理成本节省从 6 月下旬的 42% 升至截至 9 月 13 日当周的 63%,同期路由会话量增长约四倍。
Google 团队用 MaxText 在 Google Cloud TPU 上从头复现 Ai2 的 Olmo 3 7B,完成 stage-1 预训练(约5.93T token。
Google Cloud 推出 AlloyDB 新的智能体数据库架构并开放 AlloyDB PostgreSQL for agents 预览,通过 MCP 接入独立 microVM 代理节点池,直接读取 Colossus 存储实现与生产集群物理隔离。
Google Cloud 宣布 AlloyDB 推出面向 Agent 的 PostgreSQL(预览版),通过在数秒内动态配置沙箱化数据库实例实现完整工作负载隔离,Agent 任务完成后自动缩容到零并按活跃推理循环计费。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark drafter 模型,参数约 280M,仅增加 8.9% 参数量。GPU 上解码吞吐最高提升 2.66 倍、边缘设备 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍;模型已上架 Hugging Face,支持 llama.cpp、SGLang 和 MLX-VLM。
Liquid AI 在 Hugging Face 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取推理加速。
Remedy Entertainment 的《CONTROL Resonant》本周在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
Remigiusz Samborski 用 Antigravity CLI 实测 Google 的 google-cloud-developer 插件,一条命令安装五个技能和 Developer Knowledge MCP 服务器,支撑 Claude Code、Codex CLI 等智能体。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。
推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。
推荐理由:作者分享了用 Claude 测量、调试并提升 claude.ai 性能的具体方法,并附上提示词,读者可参考复用。
推荐理由:云会话正式结束预览期,Pro 和 Max 订阅者可领取一次性额度,在本地受限或合盖后仍能继续任务。
Meta 宣布将 Private Processing 机密计算基础设施扩展到 Meta AI 眼镜,把信任边界延伸到云端 CVM,使包括 Meta 在内的任何人都无法访问用户数据。
Cursor 发布两款软件开发机器人 Rollouts 和 Security Reviewer,帮助团队更快把安全可靠的代码送入生产环境。
推荐理由:原文说明了两款机器人的工作机制和可配置动作,读者可以据此评估是否接入自己的部署与安全流程。
Cursor 通过改进 agent harness,在不降低 agent 质量的情况下将用户 token 成本降低 7%。
推荐理由:官方拆解了 agent harness 省钱的具体层级做法,含可复用的工具加载与缓存断点经验。
Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。
推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。
NVIDIA 发布开源 Kubernetes 控制器 NVIDIA Cluster Readiness Engine(NVCRE),通过运行真实的分布式负载(如 NCCL all-reduce 和 Nemotron 5 预训练测试)在集群进入生产前验证就绪度,并将故障归因到具体节点。
OpenRouter 发布 Jev 使用教程,Jev 是 TypeSafe 推出的决策模型(模型 ID typesafe/jev-1.13),通过 OpenRouter Decisions API 接收 state 和问题,返回带概率的类型化答案而非生成文本。
Hugging Face 发布 NVIDIA 物理仿真系列第二篇教程,讲解如何将 SO-101 机械臂的 MuJoCo 场景迁移到基于 NVIDIA Warp 的 MuJoCo Warp(MJWarp),扩展到最多 2048 个并行 GPU 环境并测量聚合吞吐量。
Modal 分享为编码 Agent 提供万亿参数模型 Kimi K2.6 推理服务的优化实践,优化后单副本每用户性能提升 2.8x、副本整体吞吐提升 5.6x,单个服务日处理数千亿 token。
推荐理由:原文以一线实践拆解编码 Agent 推理优化的完整路径,读者可以迁移其瓶颈定位与 KV 缓存路由方法。
Google DeepMind 宣布将为 Private AI Compute 平台引入私密的服务端持久记忆,使 AI 助手能跨设备长期保留上下文。数据密封在云端专用加密存储中,解密密钥仅保存在用户设备上,请求通过端到端加密通道在隔离的安全飞区中临时解密处理,即使 Google 也无法访问。