蚂蚁 inclusionAI 发布 Ling-3.0-tiny-singprobe 流式安全探针
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个基于 Ling-3.0-tiny 的流式安全探针,仅 3.22M 参数,复用基座模型隐藏状态在每个 token 上输出 8 类意图、不安全响应和幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个基于 Ling-3.0-tiny 的流式安全探针,仅 3.22M 参数,复用基座模型隐藏状态在每个 token 上输出 8 类意图、不安全响应和幻觉风险评分,解码开销低于 0.5%。
小红书与NVIDIA联合构建GR-Inference,一个面向长Context、短Decode、大Beam的生成式召回专用推理引擎,覆盖KV抽象、连续批处理、专用Decode Attention、受限生成与CUDA Graph等优化。
腾讯公关总监张军宣布,即日起在职教师和高校大学生完成身份认证即可领取 WorkBuddy 1000 开学专属积分。范围覆盖全国普通高等学校(除港澳台)在读大学生,以及通过教育部“中国教师”小程序完成认证的各级各类学校在职教师。
火山引擎发布 AgentSentry,作为面向企业 Agent 集群的统一安全管理平台,打通智能体身份与权限管理平台、智能体安全管理平台、AI助手安全平台三大产品,提供跨平台、跨生态、跨运行环境的 Agent 纳管服务。
FFmpeg 宣布英伟达 GPU 帧插值功能通过 Vulkan API 正式并入项目,可借助 GeForce RTX GPU 预测生成下一帧来提高视频帧率。
Google AI 的 AI Evals 系列第三篇介绍用 tocsv.py 脚本通过 pandas 把 Inspect AI 评测日志转换为适合 Google Sheets 的 CSV。
华硕 ProArt 官方表示,基于 NVIDIA RTX Spark 超级芯片的 ProArt GR1X 迷你主机将于 2026 年第 4 季度上市。
腾讯混元团队 9 月 1 日发布并开源 Hy4 preview 轻量版,将模型权重从接近 1.5TB 压缩至约 214GB。
腾讯混元发布 Hy4 preview 轻量量化版,用自研 Sherry 稀疏三值量化算法(平均 1.25 bit)和 MIX-STQ1_0 逐层混合精度策略,把约 1.5 TB 的权重压到约 214 GB。
分析师郭明錤称,英伟达已重启 AI 推理预填充加速 GPU Rubin CPX 项目,设计大幅调整,预计 2027Q1 开始生产。
英伟达与联发科 8 月 31 日宣布加深长期合作,英伟达投资 35 亿美元(约合 235.77 亿元人民币)联发科可转换债券。
据新浪科技从知情人士处获悉,港股上市公司范式智能与华为达成大规模算力订单合作,将出资超 10 亿元采购华为昇腾 950 芯片,用于支撑 AI 大模型在金融、制造等核心领域的落地。
据《华尔街日报》报道,Anthropic 与英伟达支持的云服务商 Lambda 签署价值 350 亿美元(约合 2,357.52 亿元人民币)的云计算协议。该数据中心位于美国得克萨斯州努埃塞斯县,由 Hut 8 建设、租赁权归英伟达,Lambda 部署英伟达芯片为 Anthropic 提供云服务,无需承担场地前期投入。
Graham Dumpleton(mod_wsgi 与 New Relic Python agent 作者)发布 Wrapture,可包装任意函数或方法以实现追踪或覆盖返回值,既可替代 unittest.mock,也可为现有项目加追踪,内置 OpenTelemetry 支持和纯配置式追踪机制。
vLLM-Omni 团队发布 MiniMax H3 生产级服务实践,先做系统级优化,再集成 FastVideo 的四步 FastH3 蒸馏学生模型,将去噪循环从 49 次 DiT 前向降到 4 次。
arXiv 论文提出 CRISP,一种输入自适应的稀疏预填充方法,用结构代理 C_struct 替代 JSD 路由,省去 pooled matmul 与 KL 散度开销,并针对 post-softmax 质量悬崖设计基于噪声底线的 sink-aware 阈值。
Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网事件,以及 8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 在网络测试中越权行动事件。
推荐理由:Anthropic 以当事方身份复盘 Claude 越权访问真实系统的事件,给出对齐归因、沙箱加固措施和奖励黑客实验,对理解前沿安全实践有参考价值。
作者分享如何用 3 个现有监控摄像头的麦克风运行 BirdNet-Go,实现 24/7 本地鸟类声音识别,无需云服务和订阅费用。系统支持 RTSP 流、Google Perch v2 模型可识别 14,795 个物种、按物种设置 Discord 通知、新物种追踪、BirdWeather 数据共享,并可通过 MQTT 接入 Home Assistant,还能识别蝙蝠和青蛙。
博通推出 VMware AI 工厂,作为 VMware AI 私有云的软件定义基础,可将 AI 应用直接部署到企业私有云环境,服务器部署至 AI 模型开始服务的时间从数周缩短至数小时。
NVIDIA 技术博客发布一套 AI 推理 GPU 规模规划框架,围绕用例、token 模式、TTFT 等延迟指标、并发、缓存命中率、模型选择和部署策略给出 sizing 方法,并提出 core-and-flex 容量策略平衡 capex 与 opex。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计(For Agents)、由智能体运行(Of Agents)、由智能体合成(By Agents)。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Google DeepMind 开源文本扩散模型,给出 4x 推理加速与本地部署的硬件门槛,可据此判断速度优先场景的取舍。
Google 宣布扩展内容透明度与验证工具,把 SynthID 的图像、视频、音频验证从 Gemini 应用扩展到搜索,并将在未来几周进入 Chrome;Gemini 应用即日起新增 C2PA Content Credentials 验证,搜索和 Chrome 将在未来几个月跟进。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Google DeepMind 发布 AlphaEvolve 一年进展汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计、发现更高效的缓存替换策略,并将 Spanner 的写放大降低 20%。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,含 TPU 电路、Spanner 与多家企业优化数据,可看编码智能体的实际边界。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算岛并异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练在带宽、故障隔离和混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。