vLLM 集成 PyNvVideoCodec 支持 NVIDIA GPU 硬件视频解码
vLLM 新增对 NVIDIA GPU 硬件视频解码(NVDEC)的支持,通过集成 PyNvVideoCodec 把视频解码负载从 CPU 转移到 GPU。在 8xH100 上,GPU 解码吞吐量比 CPU 解码方案提升一倍以上。该功能已包含在标准 CUDA 版 vLLM 中,自定义安装需依赖 PyNvVideoCodec==2.0.4。
vLLM 新增对 NVIDIA GPU 硬件视频解码(NVDEC)的支持,通过集成 PyNvVideoCodec 把视频解码负载从 CPU 转移到 GPU。在 8xH100 上,GPU 解码吞吐量比 CPU 解码方案提升一倍以上。该功能已包含在标准 CUDA 版 vLLM 中,自定义安装需依赖 PyNvVideoCodec==2.0.4。
东北大学硕士生 Soham Padia 基于 Olmo 3-32B 开发了众包评测游戏 Steering Arena,让玩家提交短文本前缀来引导模型产生更亲社会(prosocial)的回应。
OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。
Google 发布 UN System Data Commons,将联合国系统分散数据集统一整合,支持用自然语言直接提问并即时获得数据与交互式可视化。平台基于 MCP 等开放标准,让 AI 智能体自主抓取权威数据并生成图表、信息图或报告草稿,所有数据集均经联合国统计人员和技术专家验证。
Astra for Law:为你的法律实务打造的前沿智能。 一项由 GPT-6 Astra 驱动的新服务,配备工具、设置和上下文,以支持律师和法律科技公司的专业能力与判断力。
Krea AI 在 Krea Agent 中推出新视频编辑器,用户可在编辑器中处理生成的视频片段。功能包括拼接场景、延长片段、添加音频等,现已可在 krea.ai/agent 体验。
Tomer Tunguz 撰文分析 Berkeley 本周发表的 HarnessTax 研究:控制 AI Agent 的 harness 系统可在不损失准确率的情况下,将同一结果的成本降低 71%(GPT-5.6 Sol 从 Claude Code 换到 Pi,每解决一个任务成本从 $1.540 降至 $0.441)。
Anthropic 让 Claude 在不到四周内优化了超过 30 个开源生物分子模型,平均提速约 4 倍、精度损失极小,输出完全一致时也有近 2 倍加速。优化代码全部开源,还推出低内存 Big 模式,可在单张 NVIDIA GPU 节点上对超过 10,000 token 的生物分子系统做准确预测。
推荐理由:Anthropic 公布了完整提速数据、开源代码和比赛入口,读者可以据此评估 AI 优化科学计算代码的实际水平。
Epoch AI 分析海关数据发现,2024 年 4 月至 2025 年 6 月中国记录了 37.5 亿美元、均价约 10.6 万美元/台的马来西亚原产服务器进口,价格水平更符合 AI 服务器而非普通服务器。
推荐理由:原文用双侧海关镜像数据检验了多种替代解释,并给出算力规模的估算方法与假设边界,读者可自行复核推理链条。
Phylo 在 Fireworks 上以开源权重模型支撑 Biomni Lab,实现月环比用户增长 2 倍、成本降低 60%,多数流量已转向开源模型,首 token 时间约减半。Biomni Lab 是面向生物学家的智能体环境,单次任务可运行数小时至数天、执行数百次工具调用,新开源模型可在 24 小时内上线生产。
OpenRouter 现已成为 ZCode 支持的提供商。 在 @Zai_org 的 ZCode 中连接你的 OpenRouter key,即可在 GLM 之外挑选你喜欢的模型。
Google 与 Speakeasy 合作,将 Speakeasy 的 OpenAPI 客户端代码生成套件以 AGPLv3 许可开源,此前原 SDK 生成供应商被收购并突然宣布关停,凸显闭源生成器的平台风险。
推荐理由:原文交代了开源 SDK 生成器的许可、语言覆盖和迁移背景,开发者可据此评估能否替代自有闭源生成管线。
Runway 发布新模型 Enhance Frame Rate,可将任意视频(不限于 Runway 生成)转换为 25、30、48、60 或 120 fps,并支持 NTSC 的 59.94 标准。该模型速度最高达其他插帧模型的 7 倍、成本仅为其三分之一,输出质量更高,支持最高 4K、5 分钟视频并保持源分辨率,每 2 秒视频收费 1 个 credit。
AIOps 将 AI 与机器学习应用于 IT 运维,用于检测异常、关联事件、定位根因并加速事件响应,从而降低宕机风险、减少告警疲劳并缩短 MTTR。该概念由 Gartner 于 2017 年提出,其核心组件包括数据摄取、数据归一化与增强、异常检测、事件关联、根因分析以及自动化与编排。AIOps 是对可观测性和 DevOps 的补充而非替代,高风险操作仍保留人工监督。
日落时分的尘土小路,感觉是奇幻 RPG 伏击的绝佳场景。 于是我们加了两个强盗。对他俩来说,今天可不是好日子。 用 PixVerse 制作 完整提示词见下。
Anthropic 宣布 Claude Code 的 Projects 改版,用户设定目标后由 Claude 拆解任务、协调并行线程、审查输出并汇总结果。每个线程是一个独立的 Claude Code 云会话,各占一个分支跑测试、开 PR,项目还带随时间积累的共享记忆和文件库。
推荐理由:官方说明了项目改版的线程协调机制、共享记忆和推送节奏,读者可以据此判断是否要加入等待名单。
Anthropic 推出 Life Sciences Verification Program(LSVP)beta,向经过验证的生命科学专业团队开放 Mythos、Opus 和 Sonnet 模型上比通用版更宽松的生物相关访问。
推荐理由:原文给出了 LSVP 的授权分级、验证流程和离线监测机制,读者可以据此理解 Anthropic 如何在放宽生物安全限制的同时控制滥用风险。
Databricks 推出 Omnigent,让工程师一次定义 Agent 的模型、工具、策略与限制,即可跨 Claude Code、Codex 和原始 API 等任意 harness 运行,模型调用经 Databricks Foundation Model APIs 统一成本与治理。其搜索槽位接入 Nimble 后,基准准确率从 46% 升至 71%,搜索成本减半。
LlamaIndex 为 LlamaParse 上线数据连接器,首批支持 SharePoint 和 Google Drive,开发者可直接连接源文件夹而无需手动上传文档。同步文件可用于 Parse、Extract 和 Index,连接会每日自动同步新增与更新文件,也可用 Sync now 手动拉取;通过 Index 配置抽取时,后续索引更新只处理新增或变更文件。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
LangChain 发布开源智能体助手 Deep Life Sci,面向临床和实验室科学家。它接入 600K+ ClinicalTrials.gov 研究、2900 万 PubMed 摘要和 1200 万 PubMed Central 全文,并用沙盒子智能体进行真实数据分析。
Lucius AI 用 AlloyDB for PostgreSQL 承载超 21 万条招标数据,将语义搜索迁移到 ScaNN 索引后,代表性生产查询延迟从 1.14 秒降至 24 毫秒,提速 47 倍。该平台还通过 MCP 将 AI 智能体接入数据库,在仅授予 SELECT 和单表 UPDATE 的最小权限下自动完成查询分析、数据新鲜度检查与事故取证。
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。
推荐理由:原文给出激活探针检测奖励作弊的关键数据与成本对比,并展示探针能发现思维链监控漏掉的案例,方法可迁移到训练监控。
Dwarkesh Patel 采访 OpenAI 研究员 Noam Brown,谈多智能体系统、对齐与递归自我改进。
推荐理由:OpenAI 研究员 Noam Brown 亲述万级智能体协作机制与对齐判断,读者可以借此了解推理扩展、智能体协作和对齐风险的一手观点。
Included Health 基于 Deep Agents、LangGraph 和 LangSmith 构建了医疗导航智能体 Dot,支持人工接管与临床监督。该智能体采用联邦式架构,用于医疗场景下的导航服务。