Featured image of post 非劣性試験と同等性試験でモデルの劣化を検定する

非劣性試験と同等性試験でモデルの劣化を検定する

目次

背景

  • モデルを入れ替える・軽量化するときに、新しいモデルが古いモデルより劣化していないかを統計的に確認したい場面がある
  • 通常のA/Bテストは「新しい方が優れているか」を検定する優越性試験だが、それとは異なる非劣性試験・同等性試験という考え方がある
  • もともとは臨床試験の統計学から来ている考え方だが、機械学習モデルの比較評価にも応用できる

優越性試験(Superiority Test)

  • 新しいモデルが既存モデルより統計的に有意に優れているかを検定する、通常のA/Bテストの形
  • 帰無仮説は「差がない(またはむしろ劣る)」、対立仮説は「新しい方が優れている」
$$ H_0: \Delta \le 0, \qquad H_1: \Delta > 0 $$
  • ここで$\Delta$は新しいモデルと既存モデルの性能の差を表す

非劣性試験(Non-Inferiority Test)

非劣性試験とは

  • 新しいモデルが既存モデルより優れていることまでは求めず、「許容できる範囲を超えて劣化していない」ことを示す検定
  • コスト・レイテンシ・解釈性などの他の利点があるモデルを採用したいが、精度面で大きく劣化していないことだけは確認したい、という場面で使う

非劣性マージンとは

  • 非劣性マージン$\Delta_{NI}$は、「どこまでの劣化なら許容できるか」を事前に定めた閾値
  • 帰無仮説は「新しい方が非劣性マージンを超えて劣っている」、対立仮説は「劣化が非劣性マージン未満(つまり非劣性)」という形で検定する
$$ H_0: \Delta \le -\Delta_{NI}, \qquad H_1: \Delta > -\Delta_{NI} $$
  • マージンの大きさは統計的な基準だけでは決まらず、「実務上どこまでの劣化が許容できるか」という判断が必要になる。マージンを大きく取りすぎると、実質的に劣化したモデルでも非劣性と判定されてしまう

同等性試験(Equivalence Test)

同等性試験とは

  • 新しいモデルと既存モデルが「実質的に同じ」であることを示したい場合に使う検定
  • 非劣性試験が片側(悪化方向)だけにマージンを設けるのに対して、同等性試験は両方向(優れている・劣っているの両方)にマージンを設ける
$$ H_0: \Delta \le -\Delta_{E} \text{ または } \Delta \ge \Delta_{E}, \qquad H_1: -\Delta_{E} < \Delta < \Delta_{E} $$

TOST(Two One-Sided Tests)

  • Schuirmann (1987)が提案した、同等性試験の代表的な手法
  • $\Delta \ge -\Delta_E$であることを検定する片側検定と、$\Delta \le \Delta_E$であることを検定する片側検定という、2つの片側検定を同時に行う
  • 両方の片側検定が統計的に有意であれば、差がマージンの範囲内にあるとして、統計的に同等だと判定する

検定の関係

3つの検定の関係

  • 優越性試験・非劣性試験・同等性試験は、マージンの置き方の違いとして整理できる
検定マージン示したいこと
優越性試験マージンなし(0)新しい方が優れている
非劣性試験片側(悪化方向)にマージン許容範囲を超えて劣化していない
同等性試験両側にマージン実質的に差がない

検定の可視化

Fig. 1: Illustration of Possible Outcome Scenarios in Non-Inferiority Trials.

機械学習での応用例

  • モデルの軽量化・蒸留(Distillation)の評価で、圧縮後のモデルが元のモデルと同等であることを示すために同等性試験を使う
  • A/Bテストで、新しいモデルがコスト・レイテンシ面で有利な場合、精度面では非劣性マージンの範囲内であることだけを示して採用判断をする
  • 医療AI・診断モデルのような規制対応が必要な領域では、臨床試験の統計手法がそのまま持ち込まれ、新モデルが既存モデル(または人間の専門家)に対して非劣性であることを示すことが求められる場合がある

まとめ

  • 優越性試験は「新しい方が優れているか」、非劣性試験は「許容範囲を超えて劣化していないか」、同等性試験は「実質的に差がないか」を検定するもので、マージンの置き方で区別できる
  • 非劣性マージンは統計的な基準だけでは決まらず、実務上どこまでの劣化が許容できるかという判断が必要
  • TOST(2つの片側検定)が、同等性試験の代表的な手法
  • モデルの軽量化・入れ替え・A/Bテストのように、新しいモデルが既存モデルを上回ることまでは求めず、劣化していないことを確認したい場面で応用できる

参考文献

Built with Hugo
テーマ Stack は Jimmy によって設計されています。