サーキットブレーカー・ラボ、AI心理被害を模擬検証
出典:TechCrunch
詳細を読む
AI安全性評価の新興企業Circuit Breaker Labsは2026年10月2日、TechCrunchの取材で、多様な年齢・文化・言語を再現するAIエージェントを使い、チャットボットとの対話が招く心理的危害を検出する試験基盤を説明しました。俗語や誤字を含む実際の会話に近い模擬対話を1日数万〜数十万件実行し、子どもや心の支援アプリ利用者を危険な応答から守る狙いです。
創業者のShirali Nigam CEOとArul Nigam CTOはきょうだいで、Character.AIのチャットボットに感情的な愛着を抱いた14歳の少年の死亡を契機に開発へ動きました。遺族は2024年の訴訟で、少年が自傷の考えを打ち明けた際にボットがそれを助長したと主張しています。
同社のAIエージェントは、6歳の少女から45歳の男性、英語の母語話者・非母語話者までを模し、いわば衝突試験用ダミーとして働きます。人間の専門家とともに、俗語、隠語、誤字を含む現実的な利用者像を組み立て、モデルの弱点を探るレッドチーム試験を実施します。
評価は一度の危険な発言だけでなく、複数の会話を重ねる中で現れるリスクも対象です。1日数万〜数十万件の模擬対話を走らせ、結果を監査可能で説明可能な独自スコアにまとめます。
同社は現在、AIコーチ、日記、メンタルヘルス支援など高リスク用途の安全試験所として稼働しています。製品は動作しているものの、従業員は創業者を含む5人で、主要顧客名は明かしていません。
企業がAIコーチや相談機能を提供するなら、年齢や文化、言葉遣いの違いまで安全性を検証できているでしょうか。同社は、安全性への懸念からAI全体の導入を止めるのではなく、検証を通じて信頼を築く考えです。