CNNが画像分野でどれだけ応用されているかを整理します。画像分類・物体検出・セグメンテーションの違いを押さえれば、社会実装の話題にもついていけるようになります。自動運転や医療画像など、身近な応用例を通して実感してみましょう。
CNNって画像認識だけじゃなくていろいろ使えるんでしょ? 具体的にどんなのがあるの?
代表的な応用は大きく3つね。
まず『画像分類』は『この画像は猫です』と1枚に1ラベルを付けるタスク。
次に『物体検出』は、画像中の物体の位置と種類を同時に特定する。
そして『セグメンテーション』は画素ごとに何が映っているかを塗り分けるの。
つまり、分類は『何?』、検出は『どこに何が?』、セグメンテーションは『画素ごとに何?』という粒度の違いですね。
補足すると……あら、補足はつむぎさんのお仕事だったわね。
ふふっ。
補足すると、自動運転では物体検出が不可欠で、歩行者・信号・他の車をリアルタイムに見分ける必要があります。
遅延が1秒でもあれば事故につながるので、速度と精度の両立が要求される厳しい領域です。
ふふ、さすがね。
代表的なモデルだとYOLOやSSDといった、1回の計算で位置と種類を同時に出す高速モデルが使われているわ。
R-CNN系 (Faster R-CNN, Mask R-CNNなど) はやや重いけれど高精度な選択肢ね。
うそっ!? 自動運転の裏でそんなAIが動いてるの!? ……めっちゃすごいじゃん!
医療分野でもCNNは大活躍で、X線やCT画像からがんを検出するのにも使われているの。
転移学習で少量の医療画像でも実用精度に届きつつあるわ。
スマホの顔認証もCNNですよね! 毎日お世話になってますぅ。
製造業では不良品検出、農業では作物の病害虫検出、小売ではレジの自動認識、スポーツ分析では選手のトラッキングなど、応用例は挙げきれないくらいあります。
画像で判定するもの、全部CNNが関わってるってこと!?
最近ではTransformerベースのVision Transformerも台頭しているけれど、産業実装ではCNNが依然として主力よ。
軽量さ・速度・実績の3つで強みがあるわ。
最新ではCNNとTransformerを混ぜたConvNeXtやCoAtNetなどのハイブリッドも登場しています。
つまり、CNNは過去の技術ではなく、今も第一線で進化し続けているモデルだと言えます。
進化すごいね……。
バドミントンと一緒で、戦術に終わりはないんだね。
試験では『画像分類/物体検出/セグメンテーション』の3つの違いが頻出なので、それぞれの代表モデル名とセットで覚えておくと安心よ。
ましろも、分類は1ラベル、検出はどこ+何、セグメンテーションは画素ごと、って呪文にしますぅ!
確認クイズ
画像中の複数の物体の位置と種類を同時に特定するタスクは何か?
- 画像分類
- 物体検出
- 画像生成
- 画像圧縮
こたえを見る
正解: 2. 物体検出
物体検出 (Object Detection) は、画像中に存在する複数の物体について、それぞれの位置 (バウンディングボックス) と種類 (クラス) を同時に特定するタスクです。自動運転や監視カメラに欠かせません。