Liquid AI、画像言語AIを最大2.62倍高速化
速度と規模
処理全体で最大2.62倍
デコードで最大3.13倍
小型ドラフト
追加は約2.8億パラメータ
対象モデル比8.9%増
対応と留意点
主要3基盤への初日対応
高速化対象はデコード
出典:Hugging Face
詳細を読む
Liquid AIは2026年9月24日、Hugging Faceで画像言語モデルLFM2.5-VL-3B向け投機的デコードモデル「DSpark」を公開しました。端末上のデコードを最大3.13倍、処理全体を最大2.62倍高速化し、対象モデル比8.9%の追加規模で応答待ち時間を抑えます。llama.cpp、MLX-VLM、SGLangに公開初日から対応し、端末からデータセンターまで展開できます。
DSparkは対象モデルの固定レイヤーから隠れ状態を受け取り、複数の候補トークンを先に生成します。対象モデルが候補を逐次検証するため、貪欲法での出力は対象モデル単体と一致し、高速化しても出力の一致を保ちます。
ドラフトモデルは4層の簡素なアテンション構成で、約2億7950万パラメータです。視覚と言語の入力を同じ次元の表現に投影するため、テキスト向けDSparkと同じ推論手順を使えます。
M5 MaxとMLXの組み合わせでは、デコードが2.30〜3.13倍、処理全体が1.56〜2.62倍に高速化しました。M3 Ultraとllama.cppでは、それぞれ1.57〜2.14倍、1.30〜1.77倍でした。H100ではデコードが最大2.66倍、処理全体が1.64〜2.27倍になりました。
ただし、DSparkが高速化するのはデコード処理であり、画像処理やプロンプトの事前計算は対象外です。導入時はデコード速度だけでなく、実際の入力長や業務タスクで処理全体の短縮幅を測ることが重要です。