構造化データと非構造化データ

構造化データと非構造化データの違いを具体例とともに解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針

AIが扱うデータは大きく2種類に分かれます。構造化データと非構造化データの違いを学びましょう。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

データってさ、パソコンの中では全部0と1なんでしょ?
じゃあどれも同じ形式じゃん、違いなんてある?

香月 リサ 先生(笑顔) 香月 リサ 先生

ふふっ、物理層ではそうね。
でも上位の表現形式で見ると構造化データと非構造化データに大別されるのよ。
AI開発では決定的に重要な分け方ね。

深見 つむぎ(普段) 深見 つむぎ

補足すると、構造化データは「表形式に整然と収まるデータ」、非構造化データは「それ以外」というざっくりした分類ね。

雪村 ましろ(普段) 雪村 ましろ

えぇっと、構造化データの例って何ですかぁ?

香月 リサ 先生(普段) 香月 リサ 先生

Excel の売上表、顧客データベースの行データ、銀行の口座履歴…。
列名(カラム)と行(レコード)で整理されているものね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

じゃあ非構造化データは何があるの?

深見 つむぎ(普段) 深見 つむぎ

SNSの投稿文、写真、音声ファイル、動画、LINEのやり取り、メールの本文、論文PDF…要は世の中のほとんど全部よ。

雪村 ましろ(びっくり) 雪村 ましろ

ほとんど全部…?
具体的にはどのくらいの割合なんですかぁ?

香月 リサ 先生(普段) 香月 リサ 先生

一般的な推計では、世界中のデータの約80%が非構造化データと言われているの。
残りの20%が構造化データ。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

まじで?!
8割も非構造化ってことは、そっち扱えないと意味なくない?!

深見 つむぎ(普段) 深見 つむぎ

そこが生成AI(特にLLM)の革命的な点ね。
テキストや画像という非構造化データを、人間並みに理解・生成できるようになった。

雪村 ましろ(笑顔) 雪村 ましろ

わぁ、すごーい!
じゃあ生成AIって、この8割の宝の山を初めて掘り起こしたってことですかぁ?

香月 リサ 先生(普段) 香月 リサ 先生

そう。
ただし注意点もあって、非構造化データは解釈が文脈依存で、バイアスや誤読も起きやすい。
だからこそファインチューニングやプロンプト設計が重要になるの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

あとさ、中間の「半構造化データ」ってのもあるらしいけど、何それ?
めっちゃ気になる!

深見 つむぎ(普段) 深見 つむぎ

半構造化データね。
JSON や XML、HTML などがそれ。
タグや階層はあるけれど表形式ではないデータよ。

香月 リサ 先生(笑顔) 香月 リサ 先生

試験では「世界の8割は非構造化データ」「生成AIは非構造化データを扱うのが強み」「半構造化という中間カテゴリ」の3点を押さえて。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

非構造化を扱えるようになったから、生成AIが爆発したんだ!
よっしゃ、納得!

雪村 ましろ(普段) 雪村 ましろ

うちの和菓子屋さんのお客様アンケートも、手書きのコメントばっかりなんですぅ。
あれも非構造化データなんですかぁ?

深見 つむぎ(普段) 深見 つむぎ

そう、手書きコメントは代表的な非構造化データ。
OCR(光学文字認識)でテキスト化してからLLMで傾向分析する、といった活用が今トレンドよ。

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃんのご実家でも活用できそうね。
非構造化データから顧客インサイトを引き出すのは、生成AI時代の中小企業の武器になり得るのよ。

確認クイズ

非構造化データに該当するものはどれか。

  1. Excelの売上表
  2. 顧客管理データベースのレコード
  3. SNSに投稿された画像
  4. CSVファイルの在庫リスト
こたえを見る

正解: 3. SNSに投稿された画像

SNSに投稿された画像は非構造化データの典型です。Excelの表、DBのレコード、CSVの在庫リストはいずれも行と列で整理された構造化データに分類されます。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。