<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Bayesian on M1KE BL0G</title><link>https://www.m1ke.org/tags/bayesian/</link><description>Recent content in Bayesian on M1KE BL0G</description><generator>Hugo -- gohugo.io</generator><language>ja-jp</language><copyright>mike</copyright><lastBuildDate>Mon, 28 Sep 2026 20:00:00 +0900</lastBuildDate><atom:link href="https://www.m1ke.org/tags/bayesian/index.xml" rel="self" type="application/rss+xml"/><item><title>ベイズ実験計画法</title><link>https://www.m1ke.org/p/%E3%83%99%E3%82%A4%E3%82%BA%E5%AE%9F%E9%A8%93%E8%A8%88%E7%94%BB%E6%B3%95/</link><pubDate>Mon, 28 Sep 2026 20:00:00 +0900</pubDate><guid>https://www.m1ke.org/p/%E3%83%99%E3%82%A4%E3%82%BA%E5%AE%9F%E9%A8%93%E8%A8%88%E7%94%BB%E6%B3%95/</guid><description>&lt;img src="https://www.m1ke.org/p/%E3%83%99%E3%82%A4%E3%82%BA%E5%AE%9F%E9%A8%93%E8%A8%88%E7%94%BB%E6%B3%95/b.png" alt="Featured image of post ベイズ実験計画法" /&gt;&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;データを集める・実験をするというのは、時間もコストもかかる行為&lt;/li&gt;
&lt;li&gt;どうせ限られた予算しかないなら、次にやる実験・次に集めるデータは、なるべく多くの情報が得られるものを選びたい&lt;/li&gt;
&lt;li&gt;ベイズ実験計画法（Bayesian Experimental Design）は、この「次に何を試すべきか」という問題を、ベイズ統計の枠組みで定式化する&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="実験計画法とは"&gt;実験計画法とは&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;実験計画法（Design of Experiments）は元々、統計学の分野で、限られた実験回数からできるだけ多くの情報を得るために、実験条件（factor）をどう組み合わせるかを設計する手法&lt;/li&gt;
&lt;li&gt;要因実験・直交表・応答曲面法などが古典的な手法として知られている&lt;/li&gt;
&lt;li&gt;これらの多くは、実験条件の組み合わせを事前に固定的に設計するのに対し、ベイズ実験計画法は「今の知識（事後分布）を踏まえて、次の一手を選ぶ」という逐次的な発想を取る&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="ベイズ実験計画法とは"&gt;ベイズ実験計画法とは&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;パラメータ$\theta$についての事前分布$p(\theta)$があるとする&lt;/li&gt;
&lt;li&gt;ある実験デザイン$d$を行うと、結果$y$が$p(y \mid \theta, d)$に従って観測される&lt;/li&gt;
&lt;li&gt;実験を行った後は、ベイズ更新で事後分布$p(\theta \mid y, d)$が得られる&lt;/li&gt;
&lt;li&gt;ベイズ実験計画法は、この事後分布の更新によって「どれだけ情報が得られるか」を事前に見積もり、それが最大になるような$d$を選ぶ&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;情報の増加量は、期待情報利得（Expected Information Gain, EIG）として、次のように定義される。&lt;/p&gt;
$$
\text{EIG}(d) = \mathbb{E}_{y \sim p(y \mid d)}\left[ D_{\text{KL}}\bigl(p(\theta \mid y, d) \,\|\, p(\theta)\bigr) \right]
$$&lt;ul&gt;
&lt;li&gt;実験結果$y$がまだ分からない段階なので、あらかじめ$y$の分布で期待値を取っている&lt;/li&gt;
&lt;li&gt;事後分布が事前分布からどれだけ変化するか（KLダイバージェンス）を、期待値として測っている&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;この量は、実は$\theta$と$Y$の間の相互情報量（Mutual Information）と一致することが知られている。&lt;/p&gt;
$$
\text{EIG}(d) = I(\theta; Y \mid d) = \mathbb{E}_{\theta, y}\left[\log\frac{p(y \mid \theta, d)}{p(y \mid d)}\right]
$$&lt;h2 id="直感-最も不確実な実験を選ぶ"&gt;直感: 最も不確実な実験を選ぶ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;直感的には、モデルが「結果がどうなるか全く予想できない」実験ほど、情報量が大きい&lt;/li&gt;
&lt;li&gt;逆に、結果がほぼ確実に予想できる実験（すでに分かっていることの繰り込み）は、情報利得が小さい&lt;/li&gt;
&lt;li&gt;つまりEIGが大きい$d$とは、事前知識のもとでの結果の不確実性（予測分布のエントロピー）が大きい実験、というイメージ&lt;/li&gt;
&lt;li&gt;無作為にデータを集めるのではなく、モデルが最も自信を持てていない領域を狙って実験・データ収集することで、同じ予算でも効率よく知識を更新できる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="active-learningとの関係"&gt;Active Learningとの関係&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Active Learning（能動学習）は、ラベル付けするサンプルを選ぶ問題に、この考え方を応用したもの&lt;/li&gt;
&lt;li&gt;代表的なクエリ戦略に、以下がある
&lt;ul&gt;
&lt;li&gt;Uncertainty Sampling: モデルの予測確信度が最も低いサンプルを選ぶ&lt;/li&gt;
&lt;li&gt;Query-by-Committee: 複数モデルの予測が割れるサンプルを選ぶ&lt;/li&gt;
&lt;li&gt;BALD（Bayesian Active Learning by Disagreement）: モデルパラメータの事後分布からサンプリングした複数のモデル間で、予測の不一致（相互情報量）が最大のサンプルを選ぶ&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;BALDのスコアは、次のように書ける。&lt;/p&gt;
$$
\text{BALD}(x) = H\bigl[y \mid x, D\bigr] - \mathbb{E}_{\theta \sim p(\theta \mid D)}\Bigl[H\bigl[y \mid x, \theta\bigr]\Bigr]
$$&lt;ul&gt;
&lt;li&gt;第1項は、モデル全体（パラメータの事後分布で積分した予測）の予測エントロピー&lt;/li&gt;
&lt;li&gt;第2項は、個々のパラメータ$\theta$のもとでの予測エントロピーの期待値&lt;/li&gt;
&lt;li&gt;この差が大きいサンプルは、「個々のモデルはそれぞれ自信を持って予測しているが、モデル同士の意見が割れている」状態を表し、パラメータの不確実性そのものが高い領域を指す&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="逐次実験計画法とベイズ最適化"&gt;逐次実験計画法とベイズ最適化&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;実験を1つ選んで結果を観測し、事後分布を更新し、次の実験を選ぶ、というのを繰り返す設計を逐次実験計画法（Sequential Experimental Design）と呼ぶ&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%83%A2%E3%83%87%E3%83%AB%E3%81%AE%E5%AD%A6%E7%BF%92%E3%81%AE%E5%A4%9A%E4%BF%A1%E9%A0%BC%E5%BA%A6%E6%9C%80%E9%81%A9%E5%8C%96/" &gt;モデルの学習の多信頼度最適化&lt;/a&gt;で扱ったベイズ最適化は、この逐次実験計画法の一種と見なせる&lt;/li&gt;
&lt;li&gt;ベイズ最適化における獲得関数（Expected Improvement, Upper Confidence Boundなど）は、EIGとは目的が少し異なる（「最適値を早く見つける」ことが目的で、「パラメータについての情報を最大化する」ことが目的ではない）が、どちらも「次にどこを試すべきか」を事後分布から計算するという構造は共通している&lt;/li&gt;
&lt;li&gt;同様に、Freeze-Thaw Bayesian Optimizationのような手法も、逐次的に「どの候補にどれだけ計算資源を割くか」を決める、ベイズ実験計画法の一種として整理できる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="実務での応用例"&gt;実務での応用例&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ラベル付けの優先順位付け: 大量の未ラベルデータのうち、どれを人手でラベル付けするかを選ぶ（Active Learning）&lt;/li&gt;
&lt;li&gt;A/Bテストの設計: どの施策を検証すれば、最も早く意思決定に必要な情報が得られるかを選ぶ&lt;/li&gt;
&lt;li&gt;ハイパーパラメータ探索: 次にどの設定を試すかを選ぶ（ベイズ最適化）&lt;/li&gt;
&lt;li&gt;診断データセットの拡充: &lt;a class="link" href="https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%AB%E3%81%8A%E3%81%91%E3%82%8B%E3%83%87%E3%83%BC%E3%82%BF%E3%82%BB%E3%83%83%E3%83%88%E3%81%AE%E5%88%86%E5%89%B2%E3%81%AE%E5%86%8D%E8%80%83/" &gt;機械学習におけるデータセットの分割の再考&lt;/a&gt;のDiagで見つかった不確実性の高い領域を優先して、追加のデータを集める&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="計算上の難しさ"&gt;計算上の難しさ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;EIGは、多くの場合解析的に計算できず、モンテカルロ近似や変分近似が必要になる&lt;/li&gt;
&lt;li&gt;特に、事後分布$p(\theta \mid y, d)$自体をベイズ更新するたびに近似計算する必要があり、候補となる実験デザイン$d$が多いと計算コストが膨らむ&lt;/li&gt;
&lt;li&gt;近年は、ニューラルネットワークを使ってEIGの推定・設計選択自体を学習する、amortized（償却型）なベイズ実験計画法（Deep Adaptive Design等）も研究されている&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ベイズ実験計画法は、事前知識のもとで期待情報利得が最大になる実験・データ収集を選ぶ、逐次的な意思決定の枠組み&lt;/li&gt;
&lt;li&gt;期待情報利得は、事後分布と事前分布のKLダイバージェンスの期待値であり、パラメータと観測データの相互情報量と一致する&lt;/li&gt;
&lt;li&gt;直感的には、モデルが最も不確実な実験・サンプルを選ぶという発想&lt;/li&gt;
&lt;li&gt;Active LearningのUncertainty Sampling・BALDは、この考え方をラベル付け対象の選択に応用したもの&lt;/li&gt;
&lt;li&gt;ベイズ最適化・Freeze-Thaw Bayesian Optimizationも、逐次実験計画法の一種として位置づけられる&lt;/li&gt;
&lt;li&gt;実務では、Active Learningによるラベル付けの優先順位付け、A/Bテストの設計、ハイパーパラメータ探索、診断データセットの拡充などに応用できる&lt;/li&gt;
&lt;li&gt;EIGの計算は多くの場合解析的に求まらず、近似計算やamortizedな手法が必要になる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="参考文献"&gt;参考文献&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Lindley, D. V. (1956). &amp;ldquo;On a Measure of the Information Provided by an Experiment&amp;rdquo;&lt;/li&gt;
&lt;li&gt;Chaloner, K., &amp;amp; Verdinelli, I. (1995). &amp;ldquo;Bayesian Experimental Design: A Review&amp;rdquo;&lt;/li&gt;
&lt;li&gt;Houlsby, N. et al. (2011). &amp;ldquo;Bayesian Active Learning for Classification and Preference Learning&amp;rdquo; (BALD)&lt;/li&gt;
&lt;li&gt;Foster, A. et al. (2021). &amp;ldquo;Deep Adaptive Design: Amortizing Sequential Bayesian Experimental Design&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%83%A2%E3%83%87%E3%83%AB%E3%81%AE%E5%AD%A6%E7%BF%92%E3%81%AE%E5%A4%9A%E4%BF%A1%E9%A0%BC%E5%BA%A6%E6%9C%80%E9%81%A9%E5%8C%96/" &gt;モデルの学習の多信頼度最適化&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%AB%E3%81%8A%E3%81%91%E3%82%8B%E3%83%87%E3%83%BC%E3%82%BF%E3%82%BB%E3%83%83%E3%83%88%E3%81%AE%E5%88%86%E5%89%B2%E3%81%AE%E5%86%8D%E8%80%83/" &gt;機械学習におけるデータセットの分割の再考&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>