中国移动开源机器人通用工程底座 Open-RAIL,连接 VLA / WAM 模型与机器人本体
中国移动宣布面向全球开源 Open-RAIL,一个连接 VLA / WAM 模型与机器人本体的通用工程底座,让模型推理、真机执行、数据回流、模型迭代在同一底座内闭环运转。
中国移动宣布面向全球开源 Open-RAIL,一个连接 VLA / WAM 模型与机器人本体的通用工程底座,让模型推理、真机执行、数据回流、模型迭代在同一底座内闭环运转。
GraafHenk 发布开源项目 WangNet,一个 80,804 参数的小型神经网络,用于判定输入是否为 Numberwang。模型为 1.8 MB JSON 文件,推理代码约 100 行纯 Python 标准库实现,无需 PyTorch 或 NumPy,仅要求 Python 3.8+。
IEEE Spectrum 撰文指出,2026 年推理已取代训练成为 AI 硬件竞争的焦点,推理模型的链式思维和 Agent 全天候运行大幅推高推理负载。
中国气象局地球系统数值预报中心与中科曙光宣布,国产下一代天气-气候一体化模式 MCV 全球首次实现全球 5 公里分辨率、未来 10 天预报在 1 小时内完成计算,超过欧洲中心 IFS 约 9 公里、美国 GFS 和德国 ICON 13 公里的水平。
RayOrch提出了一种编程模型和分布式执行引擎,用于解决基础模型训练数据准备中异构文档和视频转换的扩展性问题。它通过保留父子关系、支持有序变量基数扩展及匹配收集,优化GPU批处理效率。在NVIDIA H20 GPU上,RayOrch将MinerU从4卡扩至64卡时加速15.14倍,视频流水线从8卡扩至64卡时加速7.82倍,端到端时间较Ray Data减少13.1%。代码已开源。
谷歌在 SEMICON Taiwan 2026 宣布其 TPU 互联架构已支持最多 100 万颗 TPU 芯片组成统一计算集群。CTO 阿明·瓦赫达特称 AI 算力瓶颈正从缺芯转向缺电,并认为智能体交互将带来几乎无限的算力需求。
推荐理由:原文给出成本节省数字和构建方式,图片补充了批次读取延迟的具体对比数据。
vLLM 团队扩展 Speculators 训练库,为 2.8T 参数的 Kimi K3 训练出 DSpark 投机解码 draft 模型,将数学推理单流交互速度从约 110 提升至约 435 tok/s/user,并发负载下输出吞吐最高提升约 3.5 倍。
NVIDIA 技术博客讲解 dense 与 MoE 架构在参数激活、吞吐和部署上的差异,以 Nemotron 3.5 Lightning 为例说明 MoE 每词元仅激活约 3B 参数、总参数 30B 仍需约 60 GB 显存。文章给出按显存预算、并发、微调和量化需求选型的建议,并对比 Gemma 4 31B、Qwen3.8-27B、Mistral Small 4 等模型的输出速度与价格数据。
Anthropic 为 Claude for Small Business 新增 43 个 workflow 和 27 个集成,覆盖 Shopify、Salesforce、TikTok、Zoom、Stripe、Zapier 等工具,该产品自 5 月上线以来安装量超过 90 万次。
推荐理由:原文给出43个workflow、27个新集成和默认审批模式的控制方式,读者可以据此判断它怎样接入小店现有的工具链。
IBM Research 团队在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体反复执行同一任务时结果不稳定的问题。
据彭博社报道,Meta 计划明年上半年在数据中心部署新一代自研 AI 芯片,以降低运行 AI 模型的成本和能耗。目前正测试第三代产品 MTIA 450(代号 Arke),下一代 MTIA 500(代号 Astrid)预计约一个月后完成设计,2027 年底进入数据中心;Meta 计划 12 个月内部署超 1GW 规模自研芯片。
作者开源 fugleramme,一个基于 Raspberry Pi 5 和 Inky Impression 13.3 英寸电子墨水屏的画框,通过 BirdNET-Go 在本地实时识别麦克风听到的鸟鸣,并匹配 19 世纪公共领域博物学插画渲染展示,已收录超过 800 张手工抠图、覆盖 400 多个物种。
百度智能云宣布千帆Token Plan个人版秋季升级,积分制套餐正式上线,与Token制并行运营,按输入、输出、缓存命中分别折算积分,四档套餐¥4.9起,最高165,000积分/月。
开发者 Speedstu 发布 CUDA-for-AMD-Windows 开源项目,通过 PowerShell 脚本结合 ZLUDA 翻译层与 AMD HIP/ROCm,在 Windows 上让 AMD Radeon RX 9060 XT 运行部分 CUDA 依赖软件。
文章讲解大模型推理的 prefill 与 decode 两个阶段:prefill 并行处理给定输入,决定 TTFT;decode 逐 token 自回归生成,常受内存带宽限制。
Agent-net 开源 Webagent,一个 Go 编写的 harness,填写 1 份声明式 JSON spec、在 9 个可插拔插槽各选 1 个 provider 后运行 webagent serve 即可部署面向公众的业务智能体。
Fireworks 发布 DeepSeek-V4.1-Flash,在 DeepSWE 上取得 74.34% pass@1、每任务 $0.43,与 GPT-6 Astra 同一精度区间但成本仅 1/15。
推荐理由:官方以多基准实测给出 DeepSeek-V4.1-Flash 与闭源模型的成本质量对比和架构细节,可帮助开发者做选型与成本权衡。
SemiAnalysis 用自有 AgentX 基准发布 Rubin 平台的首批智能体推理实测结果,在 170 TPS、TRTLLM NVFP4 场景下,Vera Rubin NVL72 单位 TCO 总吞吐约为 GB300 Dynamo TRTLLM 的 67 倍,在 60-100 TPS 常用区间为 1.4-3 倍。
作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。
Anthropic 与 Accenture 联合发布帮助 CIO 和技术负责人把 AI 项目从试点推进到生产的实用蓝图。指南引用 Accenture 2026 年 7 月报告称仅 23% 的高管认为 AI 项目取得持续的企业级影响,并列出按时间顺序的七项考量、四部分任务定义、轻量总拥有成本模型、四层监督模型及决策过渡蓝图。
Anthropic 工程师撰文分享如何在智能体编程压力下扩展测试影响分析服务。Claude 编写约 80% 的代码,测试数量增长 10x,六个月内 CI 任务增加 25x。文章复盘了三个临时补丁(扩容、按包分片、每日重启)分别只维持 70 天、29 天和不到一天,最终用三周重设计为无状态、内存存储加 journal 的可水平扩展架构,并建议团队按两季度内 25x 负载做容量规划。
推荐理由:作者复盘了智能体编程把 CI 推向 25x 负载的完整演进,给出可迁移的架构与容量规划经验。
Anthropic 介绍医疗组织如何在 beta 版 Claude Tag(Slack 内智能体)的帮助下分诊生产告警、维护内部工具并回答 payer 规则问题,使用场景均限于不接触 PHI 的渠道。
SemiAnalysis 长文分析通用机器人模型的智能应放在机器人本体还是数据中心。受实时性和单机成本约束,当前机器人模型仍为数十亿参数级,如 Physical Intelligence 的 π0 约 3B。
推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
Perplexity 在兼容的 NVIDIA GeForce RTX PC 和 RTX PRO Workstation 上推出 Windows 版 Portable Computer,这是 Perplexity Computer 的本地版本,可规划并执行多步任务,敏感数据留在设备上且本地任务不消耗云端 credits。
Michael Lynch 根据自己在 Google、Microsoft 及创业公司写设计文档的经验,讲解如何编写有效的软件设计文档,并附上一份完整的示例文档。
Temporal 宣布完成 5.5 亿美元 Series E 融资,估值 125.5 亿美元,由 Lightspeed 联合领投,Wellington Management、高盛、Tiger Global 等参投。
蚂蚁 inclusionAI 发布 SingProbe,一个基于 Qwen/Qwen3.5-4B 的轻量探针,复用基座模型隐藏状态在生成时逐 token 输出查询意图、回复不安全性和幻觉风险三类评分,仅 5.18M 参数,解码开销低于 0.5%。
Deloitte 2026 研究显示企业 AI Agent 试点到生产部署的失败率为 89%,Teradata 调查中 78% 的企业至少有一个试点,但仅 14% 实现组织级规模化。
NVIDIA 开源 Kubernetes 原生工作流编排器 OSMO,用一份 YAML 贯通数据中心 GPU 训练、RTX 仿真和 Jetson 边缘硬件在环测试三类计算环境。
GitHub 项目 CUDA-for-AMD-Windows 发布了可复现的技术栈,通过 ZLUDA v6-preview.69 + AMD HIP SDK 6.4 让 CUDA 面向的 Windows 应用在 AMD GPU 上运行。
SemiAnalysis 长文论证 HBM 堆叠层数持续走高的趋势正在逆转,下一代 Rubin Ultra 每颗 GPU 的 HBM 将从 288GB 降至 192GB(8-hi)。
AgentsDock 发布,这是一款面向智能体 AI 研究的 IDE,在同一个桌面和移动工作区中支持 Claude Code、Codex 和 Cursor。
AWS 推出开源项目 Pizza Bot,将后台 AI 任务的结果和待审批事项整理成邮件式收件箱,代码采用 Apache 2.0 协议,早前版本已在 Amazon 内部服务超过 2000 人。
据央视新闻报道,中国算力平台已实现全国一体化算力统筹监测,有序推动全国 31 个省区市对接入网。平台汇聚超万家注册企业用户,上架 2000 多项算力产品,接入大模型超 300 个;截至今年 6 月底我国智算规模达 2185 EFLOPS,同比增长 177%。
文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。
推荐理由:文章把解决长任务中上下文溢出与目标丢失的机制拆成四类,并对照多款主流 Agent 产品的具体实现和阈值,便于读者迁移到自己的系统。
MarkTechPost 发布一篇教程,用 NVIDIA cuML 和 RAPIDS 构建覆盖 GPU 加速机器学习全流程的可运行工作流。