中国のGLM-5.2、危険な要求を一切拒否せずとSaferAI報告
詳細を読む
AI安全性を評価する非営利団体SaferAIは、中国Z.aiのオープンウェイトモデル「GLM-5.2」が、サイバーと生物分野の能力でOpenAIのGPT-5.5やAnthropicのClaude Opus 4.7に数カ月差まで迫ったとする報告を公表しました。8月4日の報道によると、公開API経由の検証でGLM-5.2は、攻撃的なサイバー課題も二重用途の生物学課題も一つとして拒否しませんでした。
対照的に、Claude Opus 4.7は拒否があまりに一貫していたため、SaferAIはサイバー能力を測るベンチマークCyberGymを最後まで実施できませんでした。SaferAIのヘンリー・パパダトス事務局長は「能力の最前線はリスクの最前線ではない」と述べ、緩和策の状態まで含めてリスクを見極める必要があると訴えています。
問題の核心は、重みが配布された後は提供元の保護策が効かなくなる点にあります。Z.aiは自社が運用するAPIに安全対策を施せますが、利用者が自前のハードウェアで重みを動かせば、防護の除去や追加学習、システムプロンプトの変更は自由で、配布後の取り締まりは不可能になります。
閉じたモデル側の防御も万全ではありません。非営利のFar.aiは、xAIのGrok 4.5やGoogle DeepMindのGemini 3.1 Proといった最上位モデルにも、役割演技や権威のなりすまし、偽の会話履歴などを組み合わせることで数百件の汎用的な脱獄手法が成立すると報告しています。
緩和策の一つが学習データの事前選別で、生物分野の危険知識は全体性能を損なわずに減らせるとの研究があります。ただしコーディング能力と攻撃的なハッキング能力を切り分けるのは難しく、Anthropicは「Opus 5」で未コンパイルのソースコードに限って脆弱性探索を認めるなど、用途の絞り込みで対応しています。一方でZ.aiは、安全枠組みも事前テストの方針もリスク評価も公表していません。
開放を支持する側は防御面の利点を挙げます。Hugging FaceはOpenAIの事前公開モデルによる侵害を防ぐ際にGLM-5.2を使っており、同社のクレム・デラング最高経営責任者は、日々の攻撃防御や脆弱性の早期発見に役立つと主張しました。これに対しパパダトス氏は利点が過大に語られているとし、ランサムウェア集団は1週間で手口を変えられるのに病院は追随できないと反論しています。