次元削減 - 情報を圧縮する技術

次元削減の基本と主成分分析(PCA)を理解しよう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針

『100項目のアンケートを3つの軸に要約する』ような発想が『次元削減』です。身近な例えから、PCAという代表手法まで会話で橋渡しします。なぜ次元を減らしたいのか、その理由にも注目してください。

戸倉 ジャスミン(あせる) 戸倉 ジャスミン

昨日さ、学園祭のアンケート100問に答えたんだけど、途中でもうわかんなくなっちゃってさ…なんで同じようなこと何回も聞くわけ? って思ったよ。
マジ疲れた〜。

深見 つむぎ(普段) 深見 つむぎ

たぶん項目間に重複があるんですよ。
『楽しかった?』『満足でしたか?』みたいに、似た意味の質問は一つの軸にまとめられる。

香月 リサ 先生(笑顔) 香月 リサ 先生

いい題材ね。
機械学習でも同じ話があるの。
特徴量(変数)が多すぎると計算が重くなるし、似た情報が重複していることも多い。
そこで次元削減の出番よ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

100問を3問くらいに圧縮するってイメージ? うそっ!?
SFみたいじゃん!

香月 リサ 先生(普段) 香月 リサ 先生

現実の技術よ。
代表的手法が主成分分析(PCA)。
データのばらつきが大きい方向を新しい軸にとって、主要な情報を残すの。

雪村 ましろ(普段) 雪村 ましろ

写真をZIP圧縮する感じですか〜? 情報は減るけど全体像は残る?

深見 つむぎ(普段) 深見 つむぎ

似ていますが、ZIP圧縮は可逆(解凍すれば元通り)、次元削減は一般に非可逆です。
本質的でない情報は捨てて、主要な情報だけ残します。

香月 リサ 先生(普段) 香月 リサ 先生

目的は3つあるわ。
(1)計算コスト削減、(2)可視化(2次元や3次元に落とせば絵にできる)、(3)ノイズ低減による過学習防止。
3つ目が意外と大事で、無駄な特徴を削ぐことで学習が安定するの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

データは多ければ多いほど偉いと思ってたけど、逆に多すぎると困るんだね。

深見 つむぎ(普段) 深見 つむぎ

まさに『次元の呪い』と呼ばれる現象で、次元が増えるほどデータ点が空間内で疎らになり、学習が難しくなります。
次元削減はその対処法のひとつですね。

雪村 ましろ(笑顔) 雪村 ましろ

ぎゅっと濃縮還元ジュースにする感じですね〜。
大切な味だけ残すんですね〜。

香月 リサ 先生(笑顔) 香月 リサ 先生

いい例えね、ましろちゃん。
濃縮還元、まさにその発想。

深見 つむぎ(普段) 深見 つむぎ

PCA以外にも、可視化に特化したt-SNEやUMAPといった手法があります。
高次元データを2次元に落として絵にする時によく使われます。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

画像認識とかで使われるのかな? 顔写真も超高次元だよね。

香月 リサ 先生(普段) 香月 リサ 先生

正解。
たとえば100x100の白黒画像は1万次元。
その中で意味のある軸は実はもっと少ないから、次元削減で本質的な特徴を抽出できるわ。
顔認識や異常検知にも使われるの。

雪村 ましろ(笑顔) 雪村 ましろ

高次元の世界をコンパクトにまとめるって、なんだかカッコいいですね〜!

戸倉 ジャスミン(普段) 戸倉 ジャスミン

画像認識や生成AIの内部でも使われてる技術なら、覚えておいて損はなさそうじゃん。

深見 つむぎ(普段) 深見 つむぎ

その通り。
オートエンコーダという深層学習の手法も、次元削減の発展形と見なせます。
入力を圧縮→復元する過程で、本質的な特徴を抽出する仕組みです。

香月 リサ 先生(普段) 香月 リサ 先生

試験ポイントは『次元削減=特徴量を減らしつつ情報を保持』『代表手法PCA』『目的は計算削減・可視化・過学習防止』の3つを確実に。

確認クイズ

次元削減の目的として最も適切なものはどれか?

  1. データ量を増やして学習精度を上げる
  2. 特徴量を減らして重要な情報を残す
  3. データにラベルを付与する
  4. 新しいデータを人工的に生成する
こたえを見る

正解: 2. 特徴量を減らして重要な情報を残す

次元削減の目的は、情報量を極力保ったまま特徴量の数を減らすことです。計算コスト削減・可視化・過学習防止などに役立ちます。データ生成はGANなど別の技術、ラベル付けはアノテーション作業の話です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。