教師あり学習のもう一方の顔『回帰』を学びます。今日はジャスミンちゃんがちょっとだけ先生を訂正する、珍しい場面もあるかも。分類との違いに注目しながら読み進めてください。
先生、『回帰』って名前だけで難しそうです〜…ましろには無理かも。
大丈夫よ、ましろちゃん。
名前ほど難しくないから、肩の力を抜いて聞いてね。
回帰は、連続した数値を予測するタスクのこと。
明日の気温、来月の売上、家の価格、そういう『いくつ?』を当てる問題ね。
たとえば明日の最高気温が『23.7度』とか『24.1度』とか、小数点もありの値で当てるやつか?
そうそう、連続値だから小数点もOK。
分類は『犬か猫か』のように離散的なラベル、回帰は『28.3度』のように連続した数字ね。
値の『性質』が全然違うの。
実務例も豊富で、不動産価格予測、株価、消費電力の見込み、広告クリック数の予測、健康診断の検査値予測、全部回帰のカテゴリに入ります。
ビジネスでもサイエンスでも定番の教師あり学習タスクですね。
えへへ、身近な予測ぜんぶ回帰なんですね〜。
バドミントンで言うと、次の試合の得点予想みたいなやつか? 2.3点とか小数点ありで出すやつ。
いい例ね! スポーツ統計でも回帰は大活躍よ。
選手の出場時間、パス成功率、疲労度などから結果を予測するモデルがプロチームで使われているわ。
ちなみに『分類と回帰の境目』は、クラスが0か1の二値分類だと回帰と見分けにくいけど、答えがカテゴリなら分類、連続数値なら回帰、って覚えてね。
あれ先生、ちょっと待って。
さっき『クラスが0か1』って言ったけど、二値分類の答えは『0』か『1』のラベルであって数値じゃないよね? 数値っぽく見えても分類扱いじゃん?
…あら、ジャスミンちゃんいいところを突いたわ。
そう、0/1はラベルの記号にすぎず、連続値ではないので分類です。
言い方が雑だったわね、ごめんなさい。
ジャスミンちゃん、ナイスツッコミ。
名前に惑わされず『出力が連続値か、離散的なクラスか』で見分けるのが正解ですね。
すごい、ジャスミンちゃんが先生を直した…!
たまにはね、どやっ! でも先生を困らせるつもりじゃなかったよ、念のため。
ふふ、学びは教える側にもあるわね。
ジャスミンちゃんありがとう、助かったわ。
ちなみに、回帰の精度は平均二乗誤差(MSE)や平均絶対誤差(MAE)、決定係数(R²)で評価します。
分類の正解率とは使う指標が違うのもポイントですね。
R²って何ですか〜?
決定係数は、モデルの予測がデータの分散をどれだけ説明できているかを示す指標で、1に近いほど良いです。
0.8以上なら実務では合格点とされることが多いですね。
回帰の代表アルゴリズムには、線形回帰、決定木回帰、サポートベクター回帰、ニューラルネットワーク回帰などがあるわ。
Phase 2の後半で線形回帰を詳しく見ていくから楽しみにしてね。
試験では『回帰=連続値予測』『分類との違い』をはっきりさせておきましょう。
ここは選択問題で頻出のポイントよ。
確認クイズ
住宅の販売価格を予測するタスクはどれに該当するか?
- 二値分類
- 多クラス分類
- 回帰
- クラスタリング
こたえを見る
正解: 3. 回帰
販売価格は連続した数値(例: 3850万円)なので回帰タスクに該当します。カテゴリに分ける問題ではないので分類ではなく、ラベルを使わないクラスタリングとも異なります。『連続値か離散ラベルか』が判別のポイントです。