先生、この前ネットで『パンダの画像にノイズ加えたら、AIがテナガザルって答えた』って記事を見たんすけど、あれネタ?
ガチ?
ジャスミンちゃん、それ実在の研究です! Goodfellow らの2014年論文『Explaining and Harnessing Adversarial Examples』ですね。
えぇっ、ほんとに? 10年以上前から知られてるんだ。
今日のテーマがまさにそれ、敵対的攻撃。
Adversarial Attack とも呼ばれるわ。
人間には見えないのに、AIだけ騙されるの? 不思議〜!
この人間に見えない変更を摂動 (perturbation)というのよ。
数学的には、モデルの勾配情報を使って『誤分類を最大化する方向』に画素を微調整しているの。
自動運転の文脈では、実世界の看板にシールを貼るだけで一時停止標識を速度制限標識と誤認識させる研究もあります (Eykholt et al. 2018)。
それヤバすぎない? 命に関わるじゃん!
そう、だから安全系AIでは深刻な脅威として研究されているの。
攻撃タイプは大きく2つに分けられるわ。
ホワイトボックス攻撃とブラックボックス攻撃ね。
対策としては敵対的学習が有名です。
攻撃サンプルを学習に混ぜて耐性をつけるイメージです。
予防接種みたいだねぇ。
ちょっとずつ攻撃に慣れさせるの。
ましろちゃん、例えが本当に上手ね! まさにそのイメージよ。
つまり、パンダの画像にノイズが乗る前提で訓練しておけば、AIも動じないってことだね!
敵対的攻撃は画像分野が有名ですが、LLMに対しても『敵対的サフィックス』等の研究が進展中です。
分野横断のテーマだから、継続的なアップデートが必要ね。
敵対的攻撃の研究は、同時に『ロバストなAI』を作る技術の発展にも繋がっているの。
攻撃と防御のいたちごっこが、結果としてAIの強靱性 (robustness) を高めていくのよ。
Robustness Certificationという分野も進展しており、認証付きロバストAIの研究が盛んです。
『人間には分からない』レベルの攻撃って、言ってしまえばAIの『超過学習』を利用した攻撃なんだね。
ジャスミンちゃん、専門家的な見方ね! まさにAIの『弱点』を突く攻撃なの。
機械学習の根本的性質に由来するため、完全な解決は難しいと言われているわ。
国際的にはAI Safety Instituteの設立が各国で進み、敵対的攻撃の研究は国家安全保障の文脈でも扱われるようになっています。
国レベルで対策してるんだね。
AIセキュリティは、もはや国の課題でもあるんだねぇ。
日本でも2024年2月に AI Safety Institute (AISI, AIセーフティ研究所) が設立されて、国家レベルで敵対的攻撃やジェイルブレイクの研究が進められているの。
日本も遅れてないんだね。
ちょっと安心したよ。
同年同月のソウルAI Safety Summitで、日米英など10カ国のAI Safety Institutes のネットワーク (International Network) 設立が発表されました。
確認クイズ
敵対的攻撃の特徴として最も適切なものは?
- 大きな破壊的ノイズでAIを停止させる攻撃
- 人間には知覚できない微小な摂動で AI の判断を誤らせる攻撃
- AI サーバをダウンさせる DoS 攻撃
- 学習データを全削除する攻撃
こたえを見る
正解: 2. 人間には知覚できない微小な摂動で AI の判断を誤らせる攻撃
敵対的攻撃の本質は『人間には気づかない微小な変更でAIだけを騙す』点にあります。物理世界攻撃 (標識へのシール等) も同じ原理の応用です。