データポイズニング - 学習データの汚染

学習データに毒を仕込む「データポイズニング」攻撃。その手法と、品質管理による防御策を解説。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
雪村 ましろ(普段) 雪村 ましろ

先生、ましろね、お菓子作りで砂糖と塩を間違えたことあるの。
材料が間違ってたら、料理が全部おかしくなっちゃうでしょ?
AIもそういうことある?

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃん、いい導入ね! 今日はまさにその『材料汚染』のお話、データポイズニングよ。
学習データに有害データを意図的に混入して、モデルの振る舞いを変える攻撃ね。

深見 つむぎ(普段) 深見 つむぎ

有名なのは Microsoft の Tay 事件 (2016年)。
Twitter で公開後、悪意ある投稿を学習して差別的発言を連発し、数時間で停止しました。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

うそっ!? ユーザー全員で集団ポイズニングってこと…?
SNS怖すぎでしょ。

香月 リサ 先生(普段) 香月 リサ 先生

攻撃は大きく3パターン。
① クリーンラベル攻撃、② ラベル反転 (spam ↔ ham を逆にする等)、③ バックドア攻撃ね。

雪村 ましろ(普段) 雪村 ましろ

バックドア…裏口からこっそり入ってくるみたいだねぇ。

深見 つむぎ(普段) 深見 つむぎ

バックドア攻撃では、例えば顔画像の右上に特殊なマークが入った時だけ別人と誤認識させる、といった仕込みができます。

戸倉 ジャスミン(しょんぼり) 戸倉 ジャスミン

えっ、それ気づけなくない? 普段はちゃんと動いてるわけでしょ?

香月 リサ 先生(普段) 香月 リサ 先生

そう、だから危険なの。
検知には異常値検出や学習データの出所検証が必須よ。

深見 つむぎ(普段) 深見 つむぎ

業界ではSBOMの AI版『AI-BOM』を整備する動きもあります。
モデルがどのデータセットを使ったか透明化するためです。

雪村 ましろ(笑顔) 雪村 ましろ

AIの材料表示、ってことだねぇ。
ひね、お菓子のアレルギー表示とちょっと似てる気がするよぉ。

香月 リサ 先生(笑顔) 香月 リサ 先生

まさにその発想よ、ましろちゃん。
食品も AI も『中身の透明性』が信頼の基盤になるの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

要は攻撃が『学習前』に起きるから、運用してる側じゃ気づきにくいってこと?

香月 リサ 先生(普段) 香月 リサ 先生

そう。
だからデータのサプライチェーン全体を守る発想が必要。
サイバーセキュリティと同じ考え方よ。

深見 つむぎ(普段) 深見 つむぎ

まさに AI のサプライチェーン・セキュリティですね。

香月 リサ 先生(普段) 香月 リサ 先生

対策の最前線として、2024年には OpenAI がPreparedness Frameworkを公表し、AI のセキュリティリスクを定量評価する枠組みを提示したわ。
業界全体のベンチマークになりつつあるの。

深見 つむぎ(普段) 深見 つむぎ

日本の AISI も同様のフレームワーク策定を進めており、国際的な整合性確保が期待されます。

香月 リサ 先生(普段) 香月 リサ 先生

データポイズニングの発想を裏返すと、フェデレーテッド学習のような分散型アプローチでは、一部のノードがポイズニングされても全体への影響を限定できる設計が可能なの。

深見 つむぎ(普段) 深見 つむぎ

ただし分散学習でもビザンチン攻撃の研究が進んでおり、分散は分散で新たな脅威に晒されます。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

入力段階・学習段階・出力段階——AIの攻撃面って3段階全部あるんだ。

深見 つむぎ(普段) 深見 つむぎ

OWASP の LLM Top 10 を読み解くと、この3段階全てに脆弱性が網羅されています。
設計時点で全段階を意識するセキュア・バイ・デザインが理想です。

雪村 ましろ(普段) 雪村 ましろ

お料理でも『作る前』『作る最中』『盛り付け』ぜんぶ気をつかうもんねぇ。
AIもおんなじなんだねぇ。

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃんの例えは本当に的確。
料理もAIも、プロセス全体への配慮が品質を決めるのよ。

確認クイズ

データポイズニング攻撃の説明として最も適切なものは?

  1. AIの出力文を改ざんする後処理攻撃
  2. AIの学習データに有害データを混入させて、モデルの振る舞いを意図的に変える攻撃
  3. AIとユーザー間のネットワーク通信を傍受する攻撃
  4. AIの管理者アカウントのパスワードを盗む攻撃
こたえを見る

正解: 2. AIの学習データに有害データを混入させて、モデルの振る舞いを意図的に変える攻撃

データポイズニングは『学習段階』を標的にする攻撃です。バックドア型の場合は特定条件でのみ誤動作するため検知が難しく、出所検証と継続モニタリングが重要です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。