跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

最新精选

第 1–17 条 · 共 17 条
今天10月8日周四
  1. NVIDIA Blog78

    NVIDIA 与 Microsoft 发布 RTX Spark 笔记本及 Windows 智能体基础设施

    在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 的智能体时代共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一起端上 Windows,读者可据此判断本地智能体的落地条件。

10月7日周三
10月2日周五
9月24日周四
  1. Google Developers Blog(RSS)60

    Antigravity SDK 支持本地模型,首发 Gemma 4 26B A4B 配合 LiteRT

    Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线获得智能体辅助能力,建议机器配备超过 24GB VRAM 或统一内存。

    推荐理由:官方给出完整的本地模型接入步骤和混合编排示例,开发者可以直接照此把智能体工作流搬到离线环境。

9月23日周三
  1. vLLM 官方博客(RSS)74

    vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务

    vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。

    推荐理由:官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。

9月22日周二
  1. Hugging Face:Blog(RSS)73

    transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp

    Hugging Face 宣布 transformers 支持直接运行 GGUF 量化模型,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核。

    推荐理由:官方宣布 transformers 直接加载 GGUF,给出在 Apple Silicon 上接近 llama.cpp 的实测吞吐和加载方法,可帮助本地推理用户选择工作流。

9月15日周二
  1. Apple:Newsroom(RSS)77

    Apple 发布新一代 Apple Intelligence,Siri AI 正式以测试版上线

    Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI,支持个人语境理解、屏幕感知、系统级应用操作和跨设备对话,今日起以英文测试版随 2027 系统更新推出,下月扩展至法语、日语、韩语、葡萄牙语和西班牙语。

    推荐理由:官方公告完整列出 Siri AI 的能力清单、设备与语言范围,以及欧盟和中国市场暂不可用等限制,读者可据此评估适用性。

9月10日周四
  1. Apple:Newsroom(RSS)66

    Apple 发布首款折叠屏 iPhone Duo,起售价 $1,999

    Apple 发布首款折叠屏 iPhone Duo,展开为 7.6 英寸内屏,合盖后为 5.4 英寸外屏,提供 iPhone 上最大显示面积。搭载 A20 Pro 芯片和蒸汽室散热,iPhone 17 Pro 续航最高 44 小时视频播放,10 月 16 日开启预购、10 月 23 日发售,起售价 $1,999。

    推荐理由:官方完整披露了屏幕、铰链、A20 Pro、续航与售价等参数,读者可据此评估这款折叠 iPhone 的实际取舍。

  2. Apple:Newsroom(RSS)63

    Apple 发布 iPhone 18 Pro 与 iPhone 18 Pro Max

    Apple 发布 iPhone 18 Pro 和 iPhone 18 Pro Max,配备带可变光圈的 48MP Fusion 主摄、A20 Pro 芯片和新一代 vapor chamber,eSIM 版 iPhone 18 Pro Max 视频播放最长可达 45 小时。

    推荐理由:官方发布稿给出了可变光圈相机、A20 Pro 和电池续航的具体规格与售价,读者可以据此了解这代 Pro 机型的主要变化。

  3. Apple:Newsroom(RSS)63

    Apple 发布 Health Sensing System 与重构版 Health app,Apple Watch Series 12 和 Ultra 4 主打 readiness 与 Health Age

    Apple 发布全新健康与健身功能,Apple Watch Series 12 和 Apple Watch Ultra 4 引入 Health Sensing System,支持每 5 秒测心率、HRV 测量频率提升至 24 倍、每日 0-10 的 readiness 评分。

    推荐理由:官方发布列出心率监测频率、readiness 评分和 Health app 各新标签的具体能力,读者可据此评估对自身健康管理的可用性。

9月4日周五
9月2日周三
8月12日周三
7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。

6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。