放課後、ジャスミンちゃんが妹の誕生日プレゼントの話をしていたところから、今日の本題であるCNNに話題が流れていきます。画像認識が得意な畳み込みニューラルネットワークの世界を、雑談から自然に覗いてみましょう。
なあ、あたし、妹の誕生日に生成AIで絵を作ろうと思っててさ。
スマホで顔を撮ると勝手に人物モードに切り替わるのも、あれってAIだよね?
つまり、画像の中に何が映っているかを認識しているということですね。
それには大抵CNN (畳み込みニューラルネットワーク) が使われているんですよ。
ふふ、いいタイミングで本題に辿り着いたわね。
CNNは Convolutional Neural Network の略で、畳み込みニューラルネットワークと訳すの。
画像認識ですご〜い成果を上げてきた立役者よ。
うそっ!?
先生『すご〜』って言った?
……口が滑ったわね、忘れなさい。
でね、CNNの中心は『畳み込み層』。
小さなフィルタを画像の上でスライドさせて、エッジや模様といった局所的な特徴を抽出するのよ。
1989年にLeCunらが手書き数字認識で実用化したのが原点ね。
全結合層だと画素1つ1つを独立に扱ってしまうけれど、畳み込み層なら近くの画素同士の関係を捉えられます。
しかも同じフィルタを画像全体で共有するので、パラメータ数が劇的に少なくなります。
めっちゃ賢い仕組みじゃん。
画像っていう2次元情報をちゃんと『近所付き合い』として扱うってことか〜!
虫眼鏡で写真のあちこちを覗き込んでるみたいですぅ〜! こっちで『目だ!』、あっちで『鼻だ!』って。
素敵な例えね。
さらに階層が深くなると、浅い層ではエッジや色の変化、中間層では目や耳のパーツ、深い層では顔全体のような抽象的な概念、というふうに学習が進んでいくの。
これは人間の視覚野 (脳の視覚処理領域) の情報処理とも似ていると言われていますね。
実際、深層学習の研究は脳科学との対話からも進んでいます。
じゃあ、妹にAIで似顔絵作るとき、そのAIの中ではこんな層が動いてるんだ〜。
なんか感動してきた!
つまり CNN は『局所性 + パラメータ共有 + 階層的特徴抽出』の3点で画像にめっぽう強いということ。
試験ではこの3点セットでよく問われるから押さえておいてね。
2012年のAlexNet優勝で、CNNは画像認識の主役として爆発的に広まりました。
現在はさらに改良版のResNet、EfficientNet、Vision Transformerなどが登場しています。
研究者さんたちが切磋琢磨してモデルが進化していくんですねぇ、ぽわわ。
確認クイズ
CNNが画像認識に適している主な理由はどれか?
- 学習速度が最も速いから
- 画像の局所的な空間パターンを効率的に捉えられるから
- テキストデータにも汎用的に使えるから
- 教師データが不要だから
こたえを見る
正解: 2. 画像の局所的な空間パターンを効率的に捉えられるから
CNNは畳み込み層を使って画像の局所的な空間パターン (エッジ、テクスチャなど) を効率的に捉えられます。パラメータ共有によって計算効率も良いため、画像認識で主流となりました。