評価指標(精度、再現率、F1スコア、ROC-AUC、MSEなど)

機械学習におけるモデル評価と検証では、タスクの種類(分類・回帰)に応じて適切な評価指標(evaluation metrics)を選ぶことが重要です。以下では、代表的な評価指標について分類別に詳しく説明します。


分類問題の評価指標

分類問題では、モデルの予測がどれだけ正しいかを評価するために、以下の指標が使われます。

1. 精度(Accuracy)

  • 定義: 全予測のうち、正しく予測された割合。

  • 計算式:

    Accuracy=TP+TNTP+TN+FP+FN\text{Accuracy} = \frac{TP + TN}{TP + TN + FP + FN}

    • TP(True Positive): 正例を正しく分類

    • TN(True Negative): 負例を正しく分類

    • FP(False Positive): 負例を正例と誤分類

    • FN(False Negative): 正例を負例と誤分類

  • 特徴: データが均衡している場合に有効。ただし、クラス不均衡がある場合は過信すべきでない。


2. 再現率(Recall)または感度(Sensitivity)

  • 定義: 実際の正例のうち、正しく予測された割合。

  • 計算式:

    Recall=TPTP+FN\text{Recall} = \frac{TP}{TP + FN}

  • 特徴: 正例を見逃したくない(例: 病気の診断など)場合に重要。


3. 適合率(Precision)

  • 定義: 正例と予測された中で、実際に正しいものの割合。

  • 計算式:

    Precision=TPTP+FP\text{Precision} = \frac{TP}{TP + FP}

  • 特徴: 誤検出を避けたい場合(例: スパムフィルタ)に重要。


4. F1スコア(F1 Score)

  • 定義: Precision と Recall の調和平均。

  • 計算式:

    F1=2PrecisionRecallPrecision+RecallF1 = 2 \cdot \frac{\text{Precision} \cdot \text{Recall}}{\text{Precision} + \text{Recall}}

  • 特徴: Precision と Recall のバランスを取りたい場合に適する。


5. ROC-AUC(Receiver Operating Characteristic – Area Under Curve)

  • 定義: ROC曲線の下の面積(AUC)を評価。ROC曲線は、**偽陽性率(FPR)真陽性率(TPR)**の関係をプロットしたもの。

  • 特徴:

    • AUC = 1: 完璧な分類器

    • AUC = 0.5: ランダム予測と同じ

    • AUCが高いほど、分類性能が高いとされる。

  • 利点: しきい値に依存しない比較ができる。


回帰問題の評価指標

回帰問題では、予測値と実際の値との誤差に基づいて評価します。

1. 平均二乗誤差(MSE: Mean Squared Error)

  • 定義: 予測値と実測値の差の二乗を平均したもの。

  • 計算式:

    MSE=1ni=1n(yiy^i)2\text{MSE} = \frac{1}{n} \sum_{i=1}^{n} (y_i – \hat{y}_i)^2

  • 特徴:

    • 大きな誤差をより強くペナルティ。

    • 単位は元の値の2乗。


2. 平均絶対誤差(MAE: Mean Absolute Error)

  • 定義: 誤差の絶対値の平均。

  • 計算式:

    MAE=1ni=1nyiy^i\text{MAE} = \frac{1}{n} \sum_{i=1}^{n} |y_i – \hat{y}_i|

  • 特徴: MSEよりも外れ値に強い。直感的に理解しやすい。


3. 決定係数(R²スコア)

  • 定義: モデルがどれだけデータの分散を説明できているかを表す指標。

  • 計算式:

    R2=1(yiy^i)2(yiyˉ)2R^2 = 1 – \frac{\sum (y_i – \hat{y}_i)^2}{\sum (y_i – \bar{y})^2}

  • 特徴:

    • 値は通常0〜1(マイナスになることもありうる)

    • 1に近いほどモデルが良好


まとめ表

タスク 指標 特徴
分類 Accuracy 全体の正解率(クラス不均衡に注意)
分類 Precision 誤検出を避けたいときに有効
分類 Recall 見逃しを避けたいときに有効
分類 F1スコア Precision と Recall のバランス
分類 ROC-AUC モデル全体の性能を評価(しきい値不要)
回帰 MSE 大きな誤差に敏感
回帰 MAE 外れ値に強い
回帰 R²スコア 分散の説明力を測定

生成日:2025/06/01