NVIDIA 在 IFA 2026 宣布加速本地 AI,十月推出 RTX Spark Windows PC
NVIDIA 在 IFA 2026 宣布与 Microsoft 及合作伙伴合作,提供更快的推理速度和新工具,让智能体更易在 NVIDIA 硬件上本地搭建和运行。同时宣布新款紧凑型 NVIDIA RTX Spark Windows PC 将于十月上市,面向 AI 爱好者、开发者和创作者。
NVIDIA 在 IFA 2026 宣布与 Microsoft 及合作伙伴合作,提供更快的推理速度和新工具,让智能体更易在 NVIDIA 硬件上本地搭建和运行。同时宣布新款紧凑型 NVIDIA RTX Spark Windows PC 将于十月上市,面向 AI 爱好者、开发者和创作者。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,一条 funes add 命令即可让 Agent 自主召回原始出处(Agent、时间戳、会话、轮次)。
推荐理由:原文给出本地记忆层的检索机制、跨 Agent 复用方式,以及召回比压缩和交接更省成本的基准数字,方法可直接复用。
林亦团队在 NVIDIA 与抖音平台联合创作合作中,基于 MiniCPM-o 4.5 的低延迟全双工能力打造了本地全模态桌面 Agent AI Jarvis,并开源在 https://github.com/LYiHub/pub-local-jarvis。
Replit 宣布为用户已发布的应用提供深度洞察,帮助构建更好的产品。用户可以查看用户参与情况,并深入分析数据,以此指导下一个功能开发。
Claude Code 发布 v2.1.259。新增 managedMcpServers 托管设置供组织向所有用户提供 HTTP/SSE MCP 服务器,新增 --permission-prompts none 支持无人值守 headless 场景下自动拒绝权限请求,并支持 GitLab MR(glab)命令识别与 claude plugin validate -- 输出。
Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
推荐理由:官方宣布 Claude 可在后台操作电脑,说明其点击、输入、打开应用的具体使用方式,读者可判断是否纳入自己的工作流。
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
Databricks 宣布扩展 Genie Agents 能力,新增深度分析、文件推理等功能。此前公司在 Data and AI Summit 上宣布 Genie Spaces 演进为 Genie Agents。
Google DeepMind 发布 Gemini 3.8 Flash Cyber,面向防守方提供专家级漏洞检测和自主修补能力。官方表示该模型可帮助团队领先应对新出现的威胁,并附推文串介绍具体用法。
Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。
推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。
Google DeepMind 推出 Fairwind Program,一项面向政府和可信合作伙伴的有限准入计划,提供 Gemini 3.8 Flash Cyber 网络安全模型与 CodeMender,可自主发现、验证并修复漏洞,在组织安全云环境中数分钟内生成可部署补丁。
Google 发布 Fairwind Program,面向政府机构和可信合作伙伴开放限制访问的先进网络防御能力,首批提供专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用来自主查找、验证和修复漏洞,可在几分钟内生成可部署补丁而非耗时数周的人工修复。
LlamaIndex 在 LlamaParse 平台以 beta 形式推出抽取档位 Turbo,主打低延迟实时工作流。在自建开放基准 ExtractBench 上,其速度约为 Cost Effective 模式的 4 倍,中位处理时间每页 3.7 秒,F1 为 0.84;中等及以上长度文档因页面并行处理降至每页约半秒。定价为每页 35 credits,目前支持的输入类型和配置选项少于其他抽取档位。
Runway 发布 Runway Dev MCP,一个托管 MCP 服务器,将 Runway Dev 账户连接到编码工具,让 Agent 能研究可选模型及价格与能力、拉取请求 schema、配置 Model Router 和 Characters,并在生成失败时查询任务原因后重试。
Runway 发布 Runway Dev MCP,让开发者在自己的编码智能体内连接 Runway 开发者平台进行构建、调试和管理。支持设置 Model Routers、查询任务等操作,无需离开智能体。
IBM 与 Confluent 宣布四款 IBM Granite 时间序列基础模型(PatchTST-FM、FlowState、TTM、TSPulse)以 Early Access 形式上线 Confluent Cloud。
推荐理由:原文给出了 MTP 加速的具体倍数、显存门槛和各量化档位内存需求,读者可以据此判断自己的设备能否跑通。
昆仑万维 SkyProduction 天工工作台全新版本于8月31日上线,把剧本、资产、分镜、视频和后期整合为一条生产线。剧本环节提供剧本翻译、剧本评分和小说转剧本功能;Agent 流程可选 Seedance 2.0 智能创作或智能分镜模式,支持片段重拍和10分钟超长视频生成;Seedance 2.5 720P 无参考视频低至0.4元/秒,30秒视频生成成本最低12元。