跳到正文
原文
Hugging Face:Blog(RSS)· Marc Sun·· 16 天前精选AI 评分73

transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 宣布 transformers 支持直接运行 GGUF 量化模型,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核。

推荐理由

官方宣布 transformers 直接加载 GGUF,给出在 Apple Silicon 上接近 llama.cpp 的实测吞吐和加载方法,可帮助本地推理用户选择工作流。

整理与数据来源:AIHOT

来源:Hugging Face:Blog(RSS) · huggingface.co