機械学習における次元の呪いをどう理解するか?意味・影響・対策を整理
機械学習では、特徴量を増やせば増やすほど情報量が豊かになり、より賢いモデルが作れそうに見えます。たしかに、ある程度まではその発想は正しく、必要な特徴量を増やすことで分類や回帰の精度が改善することも珍しくありません。しかし、特徴量の数が増え続けると、あるところから状況は急に複雑になります。情報が豊かになるどころか、距離の意味が弱くなり、データが疎になり、必要なサンプル数が急増し、モデルが安定して学習しにくくなることがあります。この現象を表す代表的な概念が、次元の呪いです。
次元の呪いという言葉は印象的ですが、単なる比喩ではありません。高次元空間では、低次元では自然に機能していた直感が崩れやすくなります。近い点と遠い点の差が小さくなり、局所的な近傍探索が難しくなり、同じ密度でデータを埋めたいなら必要なサンプル数が爆発的に増えます。つまり、次元が増えることは、単に計算量が少し増えるという話ではなく、データの幾何学的な性質そのものを変えてしまう問題なのです。
EN
JP
KR