CNN - 画像を理解するニューラルネット

画像認識を得意とするCNN (畳み込みニューラルネットワーク) の基本構造を学びます。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針

放課後、ジャスミンちゃんが妹の誕生日プレゼントの話をしていたところから、今日の本題であるCNNに話題が流れていきます。画像認識が得意な畳み込みニューラルネットワークの世界を、雑談から自然に覗いてみましょう。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

なあ、あたし、妹の誕生日に生成AIで絵を作ろうと思っててさ。
スマホで顔を撮ると勝手に人物モードに切り替わるのも、あれってAIだよね?

深見 つむぎ(笑顔) 深見 つむぎ

つまり、画像の中に何が映っているかを認識しているということですね。
それには大抵CNN (畳み込みニューラルネットワーク) が使われているんですよ。

香月 リサ 先生(笑顔) 香月 リサ 先生

ふふ、いいタイミングで本題に辿り着いたわね。
CNNは Convolutional Neural Network の略で、畳み込みニューラルネットワークと訳すの。
画像認識ですご〜い成果を上げてきた立役者よ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

うそっ!?
先生『すご〜』って言った?

香月 リサ 先生(普段) 香月 リサ 先生

……口が滑ったわね、忘れなさい。
でね、CNNの中心は『畳み込み層』。
小さなフィルタを画像の上でスライドさせて、エッジや模様といった局所的な特徴を抽出するのよ。
1989年にLeCunらが手書き数字認識で実用化したのが原点ね。

深見 つむぎ(普段) 深見 つむぎ

全結合層だと画素1つ1つを独立に扱ってしまうけれど、畳み込み層なら近くの画素同士の関係を捉えられます。
しかも同じフィルタを画像全体で共有するので、パラメータ数が劇的に少なくなります。

戸倉 ジャスミン(笑顔) 戸倉 ジャスミン

めっちゃ賢い仕組みじゃん。
画像っていう2次元情報をちゃんと『近所付き合い』として扱うってことか〜!

雪村 ましろ(笑顔) 雪村 ましろ

虫眼鏡で写真のあちこちを覗き込んでるみたいですぅ〜! こっちで『目だ!』、あっちで『鼻だ!』って。

香月 リサ 先生(笑顔) 香月 リサ 先生

素敵な例えね。
さらに階層が深くなると、浅い層ではエッジや色の変化、中間層では目や耳のパーツ、深い層では顔全体のような抽象的な概念、というふうに学習が進んでいくの。

深見 つむぎ(普段) 深見 つむぎ

これは人間の視覚野 (脳の視覚処理領域) の情報処理とも似ていると言われていますね。
実際、深層学習の研究は脳科学との対話からも進んでいます。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

じゃあ、妹にAIで似顔絵作るとき、そのAIの中ではこんな層が動いてるんだ〜。
なんか感動してきた!

香月 リサ 先生(普段) 香月 リサ 先生

つまり CNN は『局所性 + パラメータ共有 + 階層的特徴抽出』の3点で画像にめっぽう強いということ。
試験ではこの3点セットでよく問われるから押さえておいてね。

深見 つむぎ(普段) 深見 つむぎ

2012年のAlexNet優勝で、CNNは画像認識の主役として爆発的に広まりました。
現在はさらに改良版のResNet、EfficientNet、Vision Transformerなどが登場しています。

雪村 ましろ(笑顔) 雪村 ましろ

研究者さんたちが切磋琢磨してモデルが進化していくんですねぇ、ぽわわ。

確認クイズ

CNNが画像認識に適している主な理由はどれか?

  1. 学習速度が最も速いから
  2. 画像の局所的な空間パターンを効率的に捉えられるから
  3. テキストデータにも汎用的に使えるから
  4. 教師データが不要だから
こたえを見る

正解: 2. 画像の局所的な空間パターンを効率的に捉えられるから

CNNは畳み込み層を使って画像の局所的な空間パターン (エッジ、テクスチャなど) を効率的に捉えられます。パラメータ共有によって計算効率も良いため、画像認識で主流となりました。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。