Featured image of post 確率的グラフィカルモデルの分類

確率的グラフィカルモデルの分類

目次

背景

  • MeCabの仕組みで、Naive Bayes・Logistic Regression・HMM・CRFの対応関係(generative-discriminative pairs)を扱ったが、これはさらに一般化できる
  • この記事では、確率的グラフィカルモデル(Probabilistic Graphical Models, PGM)全体を、「生成か識別か」という軸と、「データ構造の複雑さ」という軸の、2つの軸で整理する

前提知識

Naive Bayes

  • 特徴量$X$の各要素がクラス$Y$ごとに独立に生成されると仮定した、最も単純な生成モデルの分類器
  • 詳しい仕組みと計算例はナイーブベイズ分類器で扱う

Logistic Regression

  • Naive Bayesと同じ特徴量を使うが、同時分布$P(X,Y)$を生成的にモデル化せず、条件付き分布$P(Y\mid X)$を直接モデル化する識別モデルの分類器
  • 特徴量の重み付き線形和を、シグモイド関数(2クラスの場合)やソフトマックス関数(多クラスの場合)に通して確率に変換する
$$ P(Y=1\mid X) = \frac{1}{1+\exp(-w\cdot X)} $$
  • Naive Bayesのような特徴量の独立性の仮定を置かないため、特徴量同士の相関が強い場合でも、Naive Bayesより精度が高くなりやすい
  • Naive Bayesとは「生成・識別ペア」の関係にあたる(Ng & Jordan, 2002)

確率的グラフィカルモデルとは

  • 複数の確率変数の関係性を、グラフ(ノードとエッジ)で視覚的に表現し、確率の計算を効率化・体系化するための枠組み
  • ノードが確率変数、エッジが変数間の依存関係を表す
  • 有向グラフ(ベイジアンネットワーク、因果関係を矢印で表す)と、無向グラフ(マルコフ確率場、条件付き確率場)の2種類に大きく分かれる

PGM

軸1: 生成モデルと識別モデル

生成モデル(Generative Models)

  • データがどのように発生したかを、同時分布$P(X,Y)$としてモデル化する
  • 未知のデータが入力されたとき、「もっともらしいか」を評価したり、新しいデータを生成したりできる
  • 例: Naive Bayes、Markov Models(マルコフモデル)、有向グラフィカルモデル(ベイジアンネットワーク)

識別モデル(Discriminative Models)

  • 入力$X$から正解ラベル$Y$を予測する条件付き分布$P(Y\mid X)$を直接モデル化する
  • 分類・予測の正確さに特化しており、多くの場合、生成モデルより予測精度が高くなりやすい
  • 例: Logistic Regression、Linear-Chain CRF、CRF(条件付き確率場)

軸2: データ構造の複雑さ

独立データ

  • データ同士のつながりを考えない(あるいは独立と仮定する)、最もシンプルなモデル

シーケンスデータ

  • 文章の単語の並びや時系列データのように、前後の文脈・順序関係があるデータを扱う

一般のグラフ構造

  • 一列(チェーン)ではなく、網の目のように複雑に絡み合った関係性を扱う

2つの軸によるモデルのマッピング

  • 2つの軸を組み合わせると、見た目の違うモデルが同じ構造の中に位置づけられる
-独立データシーケンスデータ一般のグラフ構造
生成モデルNaive BayesMarkov Models(HMMなど)ベイジアンネットワーク(有向グラフィカルモデル)
識別モデルLogistic RegressionLinear-Chain CRFCRF(一般のグラフ上の条件付き確率場)
  • 横に見ると、同じ「生成・識別」のペアが、データ構造が複雑になるにつれて進化していく
    • Naive Bayes → Markov Models: 特徴量の独立性の仮定を、系列方向のマルコフ性に拡張したもの
    • Logistic Regression → Linear-Chain CRF: 条件付き分布のモデル化を、系列全体に拡張したもの
  • 縦に見ると、同じデータ構造に対して、生成モデルと識別モデルという2つのアプローチが対になっている
  • この整理は、Sutton & McCallum (2010) “An Introduction to Conditional Random Fields"が示した、生成・識別モデルの対応関係(generative-discriminative pairs)を、データ構造の軸まで拡張したもの

MeCabとの接続

  • MeCabの仕組みで扱ったMeCabのCRFは、まさにこの表のLinear-Chain CRFにあたる。系列ラベリング(形態素解析の分割・品詞タグ付け)という、シーケンスデータへの適用そのもの
  • より複雑な依存関係(例えば、文全体の構文木のような、チェーンに収まらない構造)を扱う場合は、表の右下、一般のグラフ構造上のCRFが使われる

まとめ

  • 確率的グラフィカルモデルは、「生成か識別か」という軸と、「データ構造が独立・シーケンス・一般グラフのどれか」という軸の組み合わせで整理できる
  • Naive BayesからCRFまで、見た目の違うモデルも、この2軸のマッピングの中では同じ位置づけ(generative-discriminative pair)として理解できる
  • MeCabのCRFは、この表のシーケンスデータ×識別モデル(Linear-Chain CRF)にあたる

参考文献

Built with Hugo
テーマ Stack は Jimmy によって設計されています。