NVIDIA 讲解如何在 Jetson 上部署和优化推理模型
NVIDIA 发布教程,讲解在 Jetson 上部署新一代开放推理模型的方法,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。
推荐理由:官方教程给出模型选型、NVFP4 量化与投机解码配置和实测吞吐数据,可迁移到自己的 Jetson 部署流程。
NVIDIA 发布教程,讲解在 Jetson 上部署新一代开放推理模型的方法,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。
推荐理由:官方教程给出模型选型、NVFP4 量化与投机解码配置和实测吞吐数据,可迁移到自己的 Jetson 部署流程。
小红书与 vivo 联合打通从 vivo 相册生成 3D 图到小红书发布、分发与消费的完整 3D 内容链路,并共同设计面向移动社交场景的新型 3D 格式。
9月3日,京东旗下附身智能品牌JoyInside上榜2026年《财富》中国最佳设计榜。JoyInside实现从被动响应到主动服务的升级,通过自然对话或模糊指令操控全屋设备,已与近200家品牌达成技术合作,覆盖智能家居、厨房家电、健康医疗、智能玩具等品类;今年618期间搭载JoyInside的AI家电家居新品开门红52小时成交额环比增长200%。
林亦团队在 NVIDIA 与抖音平台联合创作合作中,基于 MiniCPM-o 4.5 的低延迟全双工能力打造了本地全模态桌面 Agent AI Jarvis,并开源在 https://github.com/LYiHub/pub-local-jarvis。
推荐理由:原文给出了 MTP 加速的具体倍数、显存门槛和各量化档位内存需求,读者可以据此判断自己的设备能否跑通。
千问APP官方宣布Qoder正式接入千问AI眼镜,覆盖从一句想法到需求梳理、代码实现与项目推进的场景,主打灵感出现时随时开始创造。原文仅提供宣传性口号,未给出具体功能细节。
Google DeepMind 发布多语言手语转文本模型 SL2T,在 Gboard 和 Live Transcribe 中为 Pixel 11 提供手语听写功能,首发支持美国手语(ASL)转英文。
推荐理由:Google DeepMind 发布多语言手语转文本模型 SL2T,并首次落地 Gboard 与 Live Transcribe,可了解其数据规模与隐私设计。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。