Transformers、GGUFのMac実行に対応
詳細を読む
Hugging Faceは2026年9月22日、機械学習ライブラリTransformersで、llama.cpp向けの量子化モデル形式GGUFを直接読み込み、ローカル実行できる機能を発表しました。初期対応はApple Silicon上のQwen3.5系で、ggmlのMetalカーネルと生成処理の改善を組み合わせ、使い慣れたPythonとPyTorchの環境に高効率な推論を持ち込みます。
利用者はHub上のモデルIDとGGUFファイル名をfrom_pretrainedに渡すだけで、標準のTransformers APIから生成できます。対応する量子化カーネルがなければ重みを展開してメモリ使用量が増え、注意機構のカーネルを取得できない場合はSDPAへ切り替わります。
量子化は精度とメモリ使用量を交換する仕組みで、Qwen3.5-4BのQ4_K_M版は、BF16版の8.42GBから2.74GBまで縮小します。Hugging FaceはQ4_K_Mを出発点とし、余裕があればQ5_K_MやQ6_Kを試し、実際の業務で品質を評価するよう勧めています。
MacBook Pro M2 Maxでの測定では、Transformersは3種類のGGUFモデルでllama.cppに近い生成速度を示しました。ただしTransformers側は入力処理を含み、llama.cpp側は生成部分だけを測るため、同一条件の比較ではありません。効率を最優先するローカル推論には、引き続きllama.cppが推奨されています。
開発者は同じGGUFモデルをPythonで調査・改変し、既存の評価手順や独自の生成処理を使えるほか、OpenAI互換APIとして配信できます。一方、圧縮状態の高速実行は現時点でMPSに限られ、パディングやバッチ処理には課題があり、対応アーキテクチャもQwen3.5のDense版とMoE版などに限定されています。