今日はバイアスの『源流』である学習データに潜む偏りを深掘りするわ。
データ収集の段階から問題が始まるわけですね。
そう。
たとえば大規模言語モデルの学習に使われるCommon Crawlは、英語が約45%、日本語は5%程度。
言語の代表性が既に偏っているの。
だから英語の質問のほうが精度が高かったりするんだ。
ましろ、英語苦手だから、日本語でもちゃんと答えてほしいなぁ…
さらに画像認識AIでは、訓練画像の肌の色分布が偏ることで、有色人種の顔認識精度が白人より低いという研究結果もあるわ (Gender Shades 論文, MIT 2018)。
MIT の Joy Buolamwini 博士の研究ですね。
商用APIで最大34%の精度差が報告されました。
34%って、もう『精度差』なんてレベルじゃないでしょ…
そう。
医療AIでも、白人男性データ中心で訓練されたモデルが、女性・高齢者・有色人種で誤診率が上がる例が報告されている。
これがデータバイアスの怖さ。
ふぇぇ…命に関わることもあるんだねぇ…
つまりデータの多様性確保は、技術課題であると同時に倫理課題でもあるわけですね。
学習データの段階で是正しないと、下流の何百万ユーザーに影響が出るの。
だから近年はデータセットのドキュメンテーション(Datasheets for Datasets)といった動きも進んでいるわ。
データの説明書を付ける感じか。
トレーサビリティ (追跡可能性) の確保ですね。
食品の産地表示に似ています。
同じデータで学習したモデルでも、ハイパーパラメータ設定やファインチューニングで挙動が変わることも、バイアス問題を複雑にしています。
同じ材料でも、料理する人で味が違うみたいだねぇ。
さらに言えば、スケーリング則の観点で、大規模モデルほどバイアスも増幅される傾向が観察されているの。
『大きくすれば解決』ではなく、規模が大きいほど慎重な検証が必要よ。
バイアス評価のベンチマーク (BOLD, BBQ, StereoSet 等) も整備され、モデルリリース時の公開が増えました。
34%の精度差って、改めて考えると恐ろしいね。
あたし、AIって『公平な審判』だと思ってたよ。
多くの人がそう思っているの。
だからこそ、私たちが『AIも偏る』という認識を広めることが重要なのよ。
『機械的=公平』という誤解こそ、バイアス対策の最大の敵なの。
『機械は公平』って、いつから言われてきたんだろうね。
コンピュータが登場してからの、漠然とした信仰なんじゃない?
鋭い観察ね。
20世紀後半から続いてきたその信仰を、AI時代はきちんと疑い直す必要があるの。
最近はデータシートという実践も広まっています。
食品の成分表示に倣って、AI学習データにも来歴情報を付ける運動です。
AIの材料にも『成分表』、すっごくいいアイデアだね!
ましろちゃんの実家の和菓子屋さんと同じ感覚よ。
消費者が安心して選べるように、AI も『何で作られたか』を示す時代に入ったの。
またModel Cardsもセットで広がっており、モデル・データ双方の透明性が標準化されつつあります。
モデルにも『説明書』、データにも『成分表』。
AIの情報開示、どんどん成熟してるんだね。
信頼は透明性から生まれる、というシンプルな原則の実装ね。
確認クイズ
学習データバイアスの原因として『適切でない』ものはどれ?
- ネット上の偏った表現
- データの代表性の欠如
- GPU の演算性能
- 歴史的な社会の偏見
こたえを見る
正解: 3. GPU の演算性能
GPU 性能はバイアスの原因とは無関係。バイアスはデータの偏り・代表性の欠如・社会的偏見の反映に起因します。