Hugging Face、符号化を最大30倍高速化
速度と互換性
単一スレッドで3〜30倍
8ワーカーで線形比76%
既存IDとAPIを維持
設計の刷新
対応分割をSIMD処理
反復語を局所キャッシュ
作業領域の再利用
提供と今後
Rust候補版を公開
追加モデル対応を予定
出典:Hugging Face
詳細を読む
Hugging Faceは2026年9月21日、次期tokenizers v1のリリース候補版が、旧版v0.23よりテキスト符号化を単一スレッドで3〜30倍高速化したとの測定結果を公表しました。Apple M4 Max上で10種類のモデル群を比較した結果で、既存のトークンID、API、語彙、マージ順位を維持しながら、CPU側の処理待ちでGPUが遊休する事態の抑制を狙います。
性能比較には公開ベンチマークのtokbenchを使い、全エンジンに同じ計測ループを適用しました。読み込み時間を除外し、出力IDのハッシュ一致を確かめ、主要結果ではキャッシュに収まり切らない異なる文書を処理しています。
高速化の柱の一つは、対応するBPEモデルで正規表現による分割をSIMD対応のビット演算に置き換えた点です。64バイト単位で境界を判定しますが、未対応の分割パターンは従来の正規表現経路を使うため、効果はモデルごとに異なります。
反復するプリトークンには、処理済みのIDを保存するスレッドローカルキャッシュを使います。加えて、呼び出し元の作業バッファーを再利用し、マージ処理でのメモリ割り当てをなくしたほか、複数のプリトークンを一括処理します。
リリース候補版はRust向けにcrates.ioで公開され、従来と同じAPIで導入できます。今後は1.0.0に向けて対応モデルを増やし、Pythonバインディングの簡素化や、CおよびC++向けの推論用バインディングも進める計画です。