AIが扱うデータは大きく2種類に分かれます。構造化データと非構造化データの違いを学びましょう。
データってさ、パソコンの中では全部0と1なんでしょ?
じゃあどれも同じ形式じゃん、違いなんてある?
ふふっ、物理層ではそうね。
でも上位の表現形式で見ると構造化データと非構造化データに大別されるのよ。
AI開発では決定的に重要な分け方ね。
補足すると、構造化データは「表形式に整然と収まるデータ」、非構造化データは「それ以外」というざっくりした分類ね。
えぇっと、構造化データの例って何ですかぁ?
Excel の売上表、顧客データベースの行データ、銀行の口座履歴…。
列名(カラム)と行(レコード)で整理されているものね。
じゃあ非構造化データは何があるの?
SNSの投稿文、写真、音声ファイル、動画、LINEのやり取り、メールの本文、論文PDF…要は世の中のほとんど全部よ。
ほとんど全部…?
具体的にはどのくらいの割合なんですかぁ?
一般的な推計では、世界中のデータの約80%が非構造化データと言われているの。
残りの20%が構造化データ。
まじで?!
8割も非構造化ってことは、そっち扱えないと意味なくない?!
そこが生成AI(特にLLM)の革命的な点ね。
テキストや画像という非構造化データを、人間並みに理解・生成できるようになった。
わぁ、すごーい!
じゃあ生成AIって、この8割の宝の山を初めて掘り起こしたってことですかぁ?
そう。
ただし注意点もあって、非構造化データは解釈が文脈依存で、バイアスや誤読も起きやすい。
だからこそファインチューニングやプロンプト設計が重要になるの。
あとさ、中間の「半構造化データ」ってのもあるらしいけど、何それ?
めっちゃ気になる!
半構造化データね。
JSON や XML、HTML などがそれ。
タグや階層はあるけれど表形式ではないデータよ。
試験では「世界の8割は非構造化データ」「生成AIは非構造化データを扱うのが強み」「半構造化という中間カテゴリ」の3点を押さえて。
非構造化を扱えるようになったから、生成AIが爆発したんだ!
よっしゃ、納得!
うちの和菓子屋さんのお客様アンケートも、手書きのコメントばっかりなんですぅ。
あれも非構造化データなんですかぁ?
そう、手書きコメントは代表的な非構造化データ。
OCR(光学文字認識)でテキスト化してからLLMで傾向分析する、といった活用が今トレンドよ。
ましろちゃんのご実家でも活用できそうね。
非構造化データから顧客インサイトを引き出すのは、生成AI時代の中小企業の武器になり得るのよ。
確認クイズ
非構造化データに該当するものはどれか。
- Excelの売上表
- 顧客管理データベースのレコード
- SNSに投稿された画像
- CSVファイルの在庫リスト
こたえを見る
正解: 3. SNSに投稿された画像
SNSに投稿された画像は非構造化データの典型です。Excelの表、DBのレコード、CSVの在庫リストはいずれも行と列で整理された構造化データに分類されます。