AIモデルの性能を評価する代表的な指標「精度」「再現率」「F値」を学びましょう。
AIの性能って、「90%当たりました」で十分でしょ?
なんでいくつも指標があるの?
つまり1つの指標だけでは測れない、という理解で合っていますか?
そうなの。
一例を出すわ。
仮に100人中1人が病気という検査で、AIが全員「健康」と答えたら正解率は99%。
でも病気の人は100%見逃していて、臨床的には全く使えない。
これが正解率だけで判断する危険よ。
え、正解率高いのに役立たずって…怖いですぅ…!
だから他の指標が要るってことか〜!
よっしゃ、意味わかった!
代表的な2つを紹介するわ。
精度(Precision)は「AIが陽性と判定したもののうち、本当に陽性だった割合」。
再現率(Recall)は「実際の陽性のうち、AIが見つけた割合」ね。
混同しやすいので言い換えると、精度=「AIの当て具合の正確さ」、再現率=「AIの取りこぼさなさ」ね。
うぅ〜ん…「精」の方が「正確」、「現」の方が「見つけ出す」って覚えるといいのかもぉ?
ましろ、語呂合わせ天才じゃん!
それ採用するね。
そしてこの2つはトレードオフになることが多いの。
精度を上げれば再現率が下がる、逆も然り。
両方のバランスを1つの指標で示すのがF値(F1 Score)、精度と再現率の調和平均よ。
ちょうわへいきん…ぽわっとした名前ですねぇ。
数学的には 2 × (Precision × Recall) / (Precision + Recall) で計算される値。
単純平均ではなく調和平均を使うことで、片方が極端に低いとF値も大きく下がる性質があるの。
バランスよく両方高くしろってプレッシャーかけてくる指標じゃん!
さらに混同行列(Confusion Matrix)という表で、真陽性・偽陽性・真陰性・偽陰性の4象限を整理する方法も覚えておいてね。
スパムフィルターの例で言うと、真陽性=スパムを正しくスパム判定、偽陽性=大事なメールをスパム誤判定、みたいなケース分けができるわ。
大事なメールがスパム扱いだなんてショックですぅ!
試験では「精度と再現率の違い」「F値=調和平均」「混同行列の4象限」が頻出よ。
丸暗記でなく定義を確認する習慣をつけて。
確認クイズ
再現率(Recall)の説明として最も正しいものはどれか。
- AIが陽性と判定したうち本当に陽性だった割合
- 実際の陽性のうちAIが正しく検出できた割合
- AIの処理速度
- 学習にかかる時間
こたえを見る
正解: 2. 実際の陽性のうちAIが正しく検出できた割合
再現率(Recall)は実際の陽性のうち、AIが正しく検出できた割合です。病気検診など「見逃しを減らしたい」場面で重視されます。陽性判定の中の正解率は精度(Precision)であり、混同しないよう注意が必要です。