学習データに潜むバイアス

AIのバイアスはどこから来るのか?学習データに潜む偏りの具体例と、その影響を理解しよう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(普段) 香月 リサ 先生

今日はバイアスの『源流』である学習データに潜む偏りを深掘りするわ。

深見 つむぎ(普段) 深見 つむぎ

データ収集の段階から問題が始まるわけですね。

香月 リサ 先生(普段) 香月 リサ 先生

そう。
たとえば大規模言語モデルの学習に使われるCommon Crawlは、英語が約45%、日本語は5%程度。
言語の代表性が既に偏っているの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

だから英語の質問のほうが精度が高かったりするんだ。

雪村 ましろ(しょんぼり) 雪村 ましろ

ましろ、英語苦手だから、日本語でもちゃんと答えてほしいなぁ…

香月 リサ 先生(普段) 香月 リサ 先生

さらに画像認識AIでは、訓練画像の肌の色分布が偏ることで、有色人種の顔認識精度が白人より低いという研究結果もあるわ (Gender Shades 論文, MIT 2018)。

深見 つむぎ(普段) 深見 つむぎ

MIT の Joy Buolamwini 博士の研究ですね。
商用APIで最大34%の精度差が報告されました。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

34%って、もう『精度差』なんてレベルじゃないでしょ…

香月 リサ 先生(普段) 香月 リサ 先生

そう。
医療AIでも、白人男性データ中心で訓練されたモデルが、女性・高齢者・有色人種で誤診率が上がる例が報告されている。
これがデータバイアスの怖さ。

雪村 ましろ(しょんぼり) 雪村 ましろ

ふぇぇ…命に関わることもあるんだねぇ…

深見 つむぎ(普段) 深見 つむぎ

つまりデータの多様性確保は、技術課題であると同時に倫理課題でもあるわけですね。

香月 リサ 先生(普段) 香月 リサ 先生

学習データの段階で是正しないと、下流の何百万ユーザーに影響が出るの。
だから近年はデータセットのドキュメンテーション(Datasheets for Datasets)といった動きも進んでいるわ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

データの説明書を付ける感じか。

深見 つむぎ(笑顔) 深見 つむぎ

トレーサビリティ (追跡可能性) の確保ですね。
食品の産地表示に似ています。

深見 つむぎ(普段) 深見 つむぎ

同じデータで学習したモデルでも、ハイパーパラメータ設定やファインチューニングで挙動が変わることも、バイアス問題を複雑にしています。

雪村 ましろ(普段) 雪村 ましろ

同じ材料でも、料理する人で味が違うみたいだねぇ。

香月 リサ 先生(普段) 香月 リサ 先生

さらに言えば、スケーリング則の観点で、大規模モデルほどバイアスも増幅される傾向が観察されているの。
『大きくすれば解決』ではなく、規模が大きいほど慎重な検証が必要よ。

深見 つむぎ(普段) 深見 つむぎ

バイアス評価のベンチマーク (BOLD, BBQ, StereoSet 等) も整備され、モデルリリース時の公開が増えました。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

34%の精度差って、改めて考えると恐ろしいね。
あたし、AIって『公平な審判』だと思ってたよ。

香月 リサ 先生(普段) 香月 リサ 先生

多くの人がそう思っているの。
だからこそ、私たちが『AIも偏る』という認識を広めることが重要なのよ。
『機械的=公平』という誤解こそ、バイアス対策の最大の敵なの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

『機械は公平』って、いつから言われてきたんだろうね。
コンピュータが登場してからの、漠然とした信仰なんじゃない?

香月 リサ 先生(普段) 香月 リサ 先生

鋭い観察ね。
20世紀後半から続いてきたその信仰を、AI時代はきちんと疑い直す必要があるの。

深見 つむぎ(普段) 深見 つむぎ

最近はデータシートという実践も広まっています。
食品の成分表示に倣って、AI学習データにも来歴情報を付ける運動です。

雪村 ましろ(笑顔) 雪村 ましろ

AIの材料にも『成分表』、すっごくいいアイデアだね!

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃんの実家の和菓子屋さんと同じ感覚よ。
消費者が安心して選べるように、AI も『何で作られたか』を示す時代に入ったの。

深見 つむぎ(普段) 深見 つむぎ

またModel Cardsもセットで広がっており、モデル・データ双方の透明性が標準化されつつあります。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

モデルにも『説明書』、データにも『成分表』。
AIの情報開示、どんどん成熟してるんだね。

香月 リサ 先生(笑顔) 香月 リサ 先生

信頼は透明性から生まれる、というシンプルな原則の実装ね。

確認クイズ

学習データバイアスの原因として『適切でない』ものはどれ?

  1. ネット上の偏った表現
  2. データの代表性の欠如
  3. GPU の演算性能
  4. 歴史的な社会の偏見
こたえを見る

正解: 3. GPU の演算性能

GPU 性能はバイアスの原因とは無関係。バイアスはデータの偏り・代表性の欠如・社会的偏見の反映に起因します。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。