<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Information-Theory on M1KE BL0G</title><link>https://www.m1ke.org/tags/information-theory/</link><description>Recent content in Information-Theory on M1KE BL0G</description><generator>Hugo -- gohugo.io</generator><language>ja-jp</language><copyright>mike</copyright><lastBuildDate>Sat, 03 Oct 2026 12:00:00 +0900</lastBuildDate><atom:link href="https://www.m1ke.org/tags/information-theory/index.xml" rel="self" type="application/rss+xml"/><item><title>自由の定式化</title><link>https://www.m1ke.org/p/%E8%87%AA%E7%94%B1%E3%81%AE%E5%AE%9A%E5%BC%8F%E5%8C%96/</link><pubDate>Sat, 03 Oct 2026 12:00:00 +0900</pubDate><guid>https://www.m1ke.org/p/%E8%87%AA%E7%94%B1%E3%81%AE%E5%AE%9A%E5%BC%8F%E5%8C%96/</guid><description>&lt;img src="https://www.m1ke.org/p/%E8%87%AA%E7%94%B1%E3%81%AE%E5%AE%9A%E5%BC%8F%E5%8C%96/liberty.jpg" alt="Featured image of post 自由の定式化" /&gt;&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E5%AD%98%E5%9C%A8%E3%81%AE%E8%80%90%E3%81%88%E3%82%89%E3%82%8C%E3%81%AA%E3%81%84%E8%BB%BD%E3%81%95%E3%81%AE%E6%84%8F%E5%91%B3/" &gt;「存在の耐えられない軽さ」の意味&lt;/a&gt;で永劫回帰（同じ人生が無限に繰り返されても、それを選び直せるか、という思考実験）を扱った&lt;/li&gt;
&lt;li&gt;そこから、「自由とは何か」を情報理論の言葉で定式化できないかと考えた&lt;/li&gt;
&lt;li&gt;最初の直感は単純で、今までにやったことがない行動＝情報量が多い行動をすることが、自由を測る指標になるのではないかというもの&lt;/li&gt;
&lt;li&gt;しかし、この直感をシャノンの情報理論の言葉で丁寧に組み立て直すと、見かけと違う結論にたどり着く&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="基本形-自分で考えた定式化"&gt;基本形: 自分で考えた定式化&lt;/h2&gt;
&lt;p&gt;ここまでの4つの節（情報量・過去との相互情報量・ランダムネスの反例・価値を導入した定式化）は、自分で最初に考えた部分。この後の節は、それをAIと一緒に検討しながら改善していった内容になる。&lt;/p&gt;
&lt;h3 id="最初の定式化-行動の情報量"&gt;最初の定式化: 行動の情報量&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F%E3%81%A8%E7%9B%B8%E4%BA%92%E6%83%85%E5%A0%B1%E9%87%8F/" &gt;シャノンの情報量と相互情報量&lt;/a&gt;で扱った自己情報量$I(x)=-\log p(x)$を使うと、ある行動$A_t$が自分にとってどれだけ珍しいかを、情報量として表せる&lt;/li&gt;
&lt;li&gt;普段しない行動ほど確率$p(A_t)$が低く、自己情報量$I(A_t)$は高くなる&lt;/li&gt;
&lt;li&gt;最初の直感は、この$I(A_t)$が高い行動こそ自由だ、というものだった&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="洗練-過去との相互情報量"&gt;洗練: 過去との相互情報量&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;ただし、単に珍しい行動というだけでは不十分。もう少し正確に言うと、知りたいのは「過去の自分を知っていても、今の行動を予測できない」ということ&lt;/li&gt;
&lt;li&gt;これは、過去$P$と現在の行動$A_t$の相互情報量$I(P;A_t)$が低いこと、と言い換えられる&lt;/li&gt;
&lt;li&gt;相互情報量とエントロピーには、次の関係がある（詳細は&lt;a class="link" href="https://www.m1ke.org/p/%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F%E3%81%A8%E7%9B%B8%E4%BA%92%E6%83%85%E5%A0%B1%E9%87%8F/" &gt;シャノンの情報量と相互情報量&lt;/a&gt;を参照）&lt;/li&gt;
&lt;/ul&gt;
$$
H(A_t\mid P) = H(A_t) - I(P;A_t)
$$&lt;ul&gt;
&lt;li&gt;つまり「行動そのものの情報量が高い」かつ「過去との相互情報量が低い」という条件は、「過去を条件としても、現在の行動に大きな不確定性が残っている」という、条件付きエントロピー$H(A_t\mid P)$の高さそのものに対応する&lt;/li&gt;
&lt;li&gt;例えば、毎週日曜に必ず同じ店でラーメンを食べる人がいるとする。この人の次の日曜の行動は、過去からほぼ予測できる&lt;/li&gt;
&lt;/ul&gt;
$$
I(\text{過去};\text{現在}) \approx \text{高い}
$$&lt;ul&gt;
&lt;li&gt;一方、ある日曜に突然陶芸教室に行くなら、その人の過去という情報からは現在を予測しにくい。ここに新しい情報が生まれる&lt;/li&gt;
&lt;li&gt;この意味で、自由とは、自分の過去によって現在が圧縮されきらないこと、と言えるかもしれない&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="反例-完全なランダムは自由ではない"&gt;反例: 完全なランダムは自由ではない&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;しかし、この定式化には重大な問題がある。完全なランダムも、過去との相互情報量は低い&lt;/li&gt;
&lt;li&gt;例えばサイコロを振って、「1なら会社を辞める、2なら旅行、3なら寝る……」と行動を決めれば、過去の自分との相互情報量はほぼゼロにできる&lt;/li&gt;
&lt;li&gt;しかし、これを「最大の自由」とは呼びたくない&lt;/li&gt;
&lt;li&gt;つまり&lt;/li&gt;
&lt;/ul&gt;
$$
\text{自由} \neq H(A_t\mid P)
$$&lt;ul&gt;
&lt;li&gt;だけでは足りない。過去から予測できないというだけでは、自由とランダムネスを区別できない&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="価値を導入した定式化"&gt;価値を導入した定式化&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;区別に必要なのは、もう一つの軸、自分が選んだ目的・価値との関係&lt;/li&gt;
&lt;li&gt;過去を$P$、現在の行動を$A$、現在の価値や目的を$G$とすると、求める状態は次のようになる
&lt;ul&gt;
&lt;li&gt;$I(P;A)$は低い（過去からは予測しにくい）&lt;/li&gt;
&lt;li&gt;$I(G;A)$は高い（今の価値からは説明できる）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;つまり、過去の自分からは予測しにくいが、今の自分の価値からは説明できる行動、ということ&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;これを大まかに書くと、以下のような対比になる。&lt;/p&gt;
$$
\boxed{\text{Freedom} \sim I(A;G) - I(A;P)}
$$&lt;ul&gt;
&lt;li&gt;例えば、「昔から人前で話すのが苦手だから、発表はしない」という選択は、過去→現在の相互情報量$I(P;A)$が高い&lt;/li&gt;
&lt;li&gt;一方、「ずっと苦手だったけど、今はこの研究を伝えたいから登壇する」という選択は、過去→行動の結びつきが弱く、現在の価値→行動の結びつきが強い&lt;/li&gt;
&lt;li&gt;後者の構造が、情報理論的に見た「自由な行動」に近い&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id="この式の読み替え-過去と価値どちらがよく予測できるか"&gt;この式の読み替え: 過去と価値、どちらがよく予測できるか&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;$I(A;G)-I(A;P)$という式は、実はエントロピーの言葉で書き直すと、もっと直感的な形になる&lt;/li&gt;
&lt;/ul&gt;
$$
I(A;G)-I(A;P) = \bigl[H(A)-H(A\mid G)\bigr] - \bigl[H(A)-H(A\mid P)\bigr] = H(A\mid P) - H(A\mid G)
$$&lt;ul&gt;
&lt;li&gt;つまりこの指標が実際に測っているのは、「過去$P$を知るよりも、現在の価値$G$を知った方が、その人の行動をどれだけよく予測できるか」という差&lt;/li&gt;
&lt;li&gt;相互情報量そのものは、2つの確率変数の間の統計的依存性を測る量なので、この読み替えには情報理論的な裏付けがある&lt;/li&gt;
&lt;li&gt;自由というより、value-directedness（価値駆動性）・self-direction（自己主導性）の指標として読むと、この式はかなりきれいに意味が通る&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="反例その2-一貫した価値観を持つ人を誤判定してしまう"&gt;反例その2: 一貫した価値観を持つ人を誤判定してしまう&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ただし、この定式化にはもう一つ問題がある&lt;/li&gt;
&lt;li&gt;20年間ヴィーガンという価値を貫いている人を考える。この人は毎日ヴィーガン料理を選ぶ&lt;/li&gt;
&lt;li&gt;この場合、過去の行動から今日の行動はほぼ完全に予測できるので、$I(P;A)$は高い&lt;/li&gt;
&lt;li&gt;しかし同時に、この人の価値$G$（ヴィーガンであること）からも、行動は高い精度で予測できるので、$I(G;A)$も高い&lt;/li&gt;
&lt;li&gt;価値観が一貫していればいるほど、$I(P;A)$も$I(G;A)$も同時に高くなり、差を取る$I(A;G)-I(A;P)$はゼロ付近か、場合によっては負にすらなりうる&lt;/li&gt;
&lt;li&gt;つまりこの式は、一貫した価値観を持つ人を「過去に支配されているから不自由」と誤判定しかねない。これはかなり不自然な結論&lt;/li&gt;
&lt;li&gt;問題の根っこは、相互情報量が測っているのが統計的依存性（statistical dependence）であって、その行動を生み出した理由・原因（reason / cause）ではないという点にある&lt;/li&gt;
&lt;li&gt;本人が「昨日飲んだから飲んでいるのではなく、今日も改めて選んだ」と思っていても、外形的な行動の並びだけを見る相互情報量には、その違いが分からない&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="条件付き相互情報量への改善"&gt;条件付き相互情報量への改善&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;この問題への1つの改善は、$I(A;G)$の代わりに、条件付き相互情報量$I(A;G\mid P)$を使うこと&lt;/li&gt;
&lt;/ul&gt;
$$
I(A;G\mid P) = H(A\mid P) - H(A\mid P,G)
$$&lt;ul&gt;
&lt;li&gt;これは、「過去$P$をすでに知っている状態で、それでもなお現在の価値$G$を知ることで、行動$A$がどれだけ追加的に説明できるか」を測る量&lt;/li&gt;
&lt;li&gt;ヴィーガンの例なら、もし$G$が単に過去の行動の言い換えに過ぎない（過去の焼き直しでしかない価値表明）場合、$P$を条件づけた時点で$G$が持つ追加の情報はほとんど残らず、$I(A;G\mid P)$は0に近づく&lt;/li&gt;
&lt;li&gt;逆に、過去の行動パターンが同じでも、現在の価値が変わるような状況（旅行先・体調不良・倫理観の変化など、習慣だけでは説明できない場面）で行動が変わるなら、$G$には$P$を超えた説明力があり、$I(A;G\mid P)$は正の値を持つ&lt;/li&gt;
&lt;li&gt;つまり条件付き相互情報量は、「過去の焼き直しに過ぎない価値表明」と「過去を超えて行動を導く本物の価値」を、ある程度区別できる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="統計的依存から因果的感応性へ"&gt;統計的依存から因果的感応性へ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;しかし、まだ残る問題がある。相互情報量は対称である&lt;/li&gt;
&lt;/ul&gt;
$$
I(A;G) = I(G;A)
$$&lt;ul&gt;
&lt;li&gt;この対称性のため、「$G$が$A$を生み出した」のか、「$A$と$G$がたまたま相関しているだけ」なのかを、相互情報量だけでは区別できない&lt;/li&gt;
&lt;li&gt;ここで必要になるのは、統計的な依存ではなく、因果的な感応性（causal responsiveness）&lt;/li&gt;
&lt;li&gt;過去$P=p$を固定したまま、価値$G$だけを外部から変化させたとき（$do(G=g_1)$ と $do(G=g_2)$）、行動$A$が実際に変わるかどうかを見る、という発想&lt;/li&gt;
&lt;li&gt;これは、「過去が同じでも、今の理由が違えば違う行動を取れる」という意味で、情報理論よりもかなり「自由」っぽい構造を持つ&lt;/li&gt;
&lt;li&gt;自由意志論には、これと同じ発想を持つ立場がすでにある&lt;/li&gt;
&lt;li&gt;Fischer &amp;amp; Ravizzaのreasons-responsiveness（理由応答性）理論は、行為を生み出す本人のメカニズムが、理由の変化に適切に応答するかどうかを、自由・責任の条件として重視する&lt;/li&gt;
&lt;li&gt;毎朝同じコーヒーを飲む3人がいたとしても、「健康上の理由が生じたらやめる人」「倫理的な理由に納得したら変える人」「どんな理由があっても習慣だから飲み続ける人」では、外形的な行動は同じでも、理由への感応性が異なる。この違いを捉えられるのが、因果的な定式化の強み&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="sourcehood"&gt;Sourcehood&lt;/h2&gt;
&lt;h3 id="sourcehoodとは何か"&gt;Sourcehoodとは何か&lt;/h3&gt;
&lt;p&gt;次のSourcehood問題の節は専門用語が多いので、先に直感的な説明を挟む。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;ここまでの議論は、「過去の惰性ではなく、現在の価値$G$に従って行動していれば自由」という方向で進んできた&lt;/li&gt;
&lt;li&gt;ここで素朴な疑問が出てくる。その「現在の価値$G$」自体は、一体どこから来たのか&lt;/li&gt;
&lt;li&gt;価値観・性格・好み・判断基準は、生まれつきの気質、育った家庭環境、受けた教育、属した文化、これまで出会った人々によって形作られる&lt;/li&gt;
&lt;li&gt;これらはどれも、本人が選んだものではない。生まれる家庭も、受けた教育も、育った時代も、本人には選びようがなかった&lt;/li&gt;
&lt;li&gt;つまり「自分の価値観に従って行動した」としても、その価値観自体が、本人の選択の及ばないところで与えられたものだとしたら、本当にその行動は「自分が」生み出したと言えるのか、という疑問が生じる&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="操作の思考実験"&gt;操作の思考実験&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;この疑問を鋭くするための、よく使われる思考実験がある&lt;/li&gt;
&lt;li&gt;ある人が、神経科学者によって密かに「脳を操作され、Xという価値観を持つようにされた」とする。その後、本人はXという価値観に従って、筋道立てて合理的に行動する&lt;/li&gt;
&lt;li&gt;この場合、多くの人は「この人は自由に行動したとは言えない」と感じるはず。たとえ理由に忠実に、一貫して行動していても、その理由自体が外部から植え付けられたものだから&lt;/li&gt;
&lt;li&gt;では、神経科学者による操作の代わりに、ただの「生まれ育った環境」だったらどうか。遺伝・家庭・教育・文化によって、同じように価値観が形作られたとしたら&lt;/li&gt;
&lt;li&gt;操作された場合と、ただ生まれ育った場合とで、本質的に何か違いがあるのか。どちらも、本人が選んでいない外部の要因によって、価値観が一方的に形作られたという点では同じ&lt;/li&gt;
&lt;li&gt;この問いを押し詰めていくと、「自分の価値観に従って行動すること」だけでは、本当の意味での自由の条件として足りないのではないか、という疑いが生まれる&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="sourcehoodが問うこと"&gt;Sourcehoodが問うこと&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Sourcehood（自己起源性）とは、「あなたの行動の、本当に最初の、誰のせいにもできない源は、あなた自身なのか」という問い&lt;/li&gt;
&lt;li&gt;価値観$G$に従って行動した、というだけでは不十分で、その$G$自体を、本当に自分が（それ以前の何にも由来せず）作り出したのかが問われる&lt;/li&gt;
&lt;li&gt;しかし、$G$がどこから来たかを辿ると、必ずそれ以前の要因（育ち、環境、さらにその前の要因……）に行き着いてしまう&lt;/li&gt;
&lt;li&gt;誰一人として、自分の性格や価値観を、何もないところから完全に自分一人で作り出した人はいない。この意味で、「究極的な自己起源」は、原理的に誰にも満たせない条件なのではないか、というのがSourcehood問題の核心&lt;/li&gt;
&lt;li&gt;次の節では、この直感を、より正確な哲学用語（reasons-responsiveness・mechanism ownership・ultimate sourcehood）に分けて整理する&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3つの用語をやさしく言うと"&gt;3つの用語をやさしく言うと&lt;/h3&gt;
&lt;p&gt;次の節で使う3つの用語を、専門用語抜きで先に説明する。料理のレシピ本に例えると分かりやすい。自分の行動を生み出す「判断の仕組み」を、手元のレシピ本だとイメージする。&lt;/p&gt;
&lt;h3 id="reasons-responsiveness理由応答性"&gt;Reasons-responsiveness（理由応答性）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;材料（理由）を変えたら、出来上がる料理（行動）もちゃんと変わるか、という話&lt;/li&gt;
&lt;li&gt;例えば肉を食べない人に、「実は健康にも環境にも良いと分かった」という新しい理由を与えたとき、考え直す余地があるなら理由応答性がある&lt;/li&gt;
&lt;li&gt;逆に、どんな理由を出されても一切考え直さず、常に同じ行動を繰り返すだけなら、それは理由に応答しているのではなく、ただの反射に近い&lt;/li&gt;
&lt;li&gt;つまり、理由を仮にいろいろ変えてみたとき、行動もちゃんとそれに応じて変わるか、を見る条件&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="mechanism-ownershipメカニズムの所有"&gt;Mechanism ownership（メカニズムの所有）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;そのレシピ本が、本当に「自分の」レシピ本だと言えるか、という話&lt;/li&gt;
&lt;li&gt;普通に育ち、経験を積みながら、自分なりにそのレシピ本に書き込みを加え、「これは自分のやり方だ」と受け入れてきたなら、それは自分のものと言える&lt;/li&gt;
&lt;li&gt;一方、ある日突然、誰かに気づかれないようにレシピ本をこっそり別物にすり替えられていたとしたら、その後どんなに理由に忠実に料理していても、それは「自分の」レシピ本とは言いにくい&lt;/li&gt;
&lt;li&gt;前述の「操作の思考実験」で、神経科学者に価値観を書き換えられた人は、まさにこのすり替えに当たる&lt;/li&gt;
&lt;li&gt;Fischer &amp;amp; Ravizzaは、理由応答性に加えて、このメカニズムの所有までがあれば、自由・責任には十分だと考える&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="ultimate-sourcehood究極的自己起源性"&gt;Ultimate sourcehood（究極的自己起源性）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;そのレシピ本を、誰からも何も教わらず、完全にゼロから自分一人で書き上げたか、という話&lt;/li&gt;
&lt;li&gt;普通に考えて、これは誰にも当てはまらない。どんなレシピ本も、元をたどれば親から教わった味、育った土地の食文化、誰かの本からの影響を受けている&lt;/li&gt;
&lt;li&gt;Mechanism ownershipは「今このレシピ本を自分のものとして使っている」ことだけを問題にするが、Ultimate sourcehoodは「そのレシピ本の、本当の意味での最初の書き手は誰か」までさかのぼって問う&lt;/li&gt;
&lt;li&gt;Strawsonは、この意味での自己起源は誰にも満たせないと指摘し、Pereboomはそこから、本当の意味での（basic desertの）責任は、誰にも成立しないのではないかと論じる&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;この3つを合わせると、次の節で出てくる「3段階の連鎖」の意味が掴みやすくなるはず。&lt;/p&gt;
&lt;h2 id="sourcehood問題-自由を3段階に割る"&gt;Sourcehood問題: 自由を3段階に割る&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ただし、この因果的な定式化にも、逃げられない問題が残っている&lt;/li&gt;
&lt;li&gt;$do(G=g)$という操作は、$P\to G$という通常の因果経路を外から切断し、$G$を外部から直接セットする操作&lt;/li&gt;
&lt;li&gt;つまりこの操作を持ち出すほど、「ではその価値$G$は、誰が・何がセットしたのか」という問いが、かえって鮮明になる&lt;/li&gt;
&lt;li&gt;$P\to G\to A$という構造があるなら、「$A$は$G$から生まれたから自由だ」と言った瞬間、「ではその$G$はどこから来たのか」という問いが続く&lt;/li&gt;
&lt;li&gt;さらにその答えが$P_{-1}\to P\to G$のように遡れるなら、同じ問いが無限に繰り返される&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;これは自由意志論で最も古い問題の一つだが、一括りに「sourcehood」と呼ぶと、実は性質の異なる2つの要求が混ざってしまう。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Fischer &amp;amp; Ravizzaのreasons-responsiveness理論は、実はreasons-responsivenessだけを要求しているわけではない&lt;/li&gt;
&lt;li&gt;行為を生むメカニズムが理由に適切に応答すること（moderate reasons-responsiveness）に加えて、そのメカニズムが「その人自身のもの」であること（mechanism ownership、自分の選択の結果として、そのメカニズムに対する責任を引き受けていること）も条件に含めている&lt;/li&gt;
&lt;li&gt;一方、Galen Strawsonの&amp;quot;Basic Argument&amp;quot;が要求するのは、それよりはるかに強い究極的自己起源性（ultimate self-origination）。行為に責任を持つには、その行為を生む性格に責任を持つ必要があり、その性格に責任を持つには、その性格を形成した以前の性格に責任を持つ必要があり……という無限後退を押し出し、誰もこの意味で自分自身の「原因」ではありえないと結論する&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;つまり、2項対立ではなく、3段階の連鎖として捉える方が正確になる。&lt;/p&gt;
$$
\boxed{\text{Reasons-responsiveness} \ \rightarrow\ \text{Mechanism ownership} \ \rightarrow\ \text{Ultimate sourcehood}}
$$&lt;ul&gt;
&lt;li&gt;Reasons-responsiveness（理由応答性）は、前節の$do(G)$のような因果的な操作によって、ある程度定量化できる&lt;/li&gt;
&lt;li&gt;Mechanism ownership（メカニズムの所有）は、そのメカニズムを「自分のもの」として引き受けているかという条件で、Fischer &amp;amp; Ravizzaはここまでを自由・責任の十分条件とする&lt;/li&gt;
&lt;li&gt;Ultimate sourcehood（究極的自己起源性）は、そのメカニズム自体の由来まで自分が作ったのかという、Strawsonが要求する最も強い条件&lt;/li&gt;
&lt;li&gt;Compatibilist（Fischer &amp;amp; Ravizzaら）は、最初の2段階で実践的に重要な意味での自由には十分だと考え、3段階目までは要求しない&lt;/li&gt;
&lt;li&gt;Hard incompatibilist（Strawson、Pereboomら）は、3段階目まで必要だが、それは原理的に到達不可能だと主張する。Pereboomの操作論証（manipulation argument）は特に、行為が理由に適切に応答し、メカニズムの所有条件すら満たしているように見える場合でも、その因果的来歴まで遡ると、basic desert（行為者がその行為ゆえに、純粋にそれに値するという意味での）責任を支えるだけのコントロールを欠いている、という形でこの急所を突く&lt;/li&gt;
&lt;li&gt;つまり、この記事でここまで定式化してきた$I(A;G)-I(A;P)$や$do(G)$は、自由そのものではなく、この連鎖の最初の段階（reasons-responsiveness）を切り出したものに過ぎなかった、ということになる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="永劫回帰との接続-問いの軸をずらす"&gt;永劫回帰との接続: 問いの軸をずらす&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ここで、冒頭で触れた永劫回帰との接続が、新しい意味を持ってくる&lt;/li&gt;
&lt;li&gt;ニーチェの永劫回帰は、単に「新しいことをしろ」という話ではなく、「この選択が無限回繰り返されても、それを自分の選択として肯定できるか」という問いとして読める（これはニーチェ解釈として唯一のものではなく、永劫回帰には宇宙論的な解釈も含めて議論があるが、『愉しい学問』第341節を人生の全てを肯定できるかという思考実験として読むのは、確立した主要な読み方の一つ）&lt;/li&gt;
&lt;li&gt;Ultimate sourcehoodの無限後退（$G$はどこから来たのか、その前は……）は、形而上学的に正面から解決しようとすると、原理的に行き止まりになる&lt;/li&gt;
&lt;li&gt;永劫回帰・運命愛（アモール・ファティ）は、この問いに答えようとするのではなく、問いそのものの軸をずらす動きだと読める。「究極的に、何が私の原因だったのか（Who ultimately caused me?）」という問いから、「それでも私は、こうなった自分を肯定できるか（Can I affirm what I have become?）」という問いへの転換&lt;/li&gt;
&lt;li&gt;これは単に難問から逃げた、という話ではなく、責任や自由の規範そのものを、由来の遡及可能性から、現在における引き受けへと移す、哲学的な跳躍として捉えられる&lt;/li&gt;
&lt;li&gt;これは、Fischer &amp;amp; Ravizzaのmechanism ownership、つまり究極の起源まで遡らず、そのメカニズムを自分のものとして引き受けることで自由の条件を満たす、というcompatibilist側の立場と、構造的にほぼ同じ動き&lt;/li&gt;
&lt;li&gt;同じコーヒーを毎朝飲んでいても、「昨日も飲んだから今日も飲む」なら、過去の惰性に支配されている&lt;/li&gt;
&lt;li&gt;しかし、「世界が何度繰り返されても、今日このコーヒーを選ぶ」なら、その選択の由来を遡って解決してはいないものの、由来がどうであれ今それを自分のものとして引き受け、再選択している&lt;/li&gt;
&lt;li&gt;つまり、自由とは「過去と違うこと」でも、sourcehoodの無限後退を実際に解決することでもなく、「過去を理由にしなくても、もう一度それを選べる」という、reasons-responsivenessのレベルでの再選択可能性に、実存的な引き受けを重ねることだと言えるかもしれない&lt;/li&gt;
&lt;li&gt;新奇性としての自由から、再選択可能性としての自由へ、そしてsourcehoodを解決不能なまま引き受ける自由へと、情報理論の出発点から哲学的な到達点まで、一本の道筋がつながる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;自由を「行動の情報量の高さ」だけで測ると、単なるランダムネスと区別がつかなくなる&lt;/li&gt;
&lt;li&gt;過去$P$との相互情報量が低く、現在の価値$G$との相互情報量が高いという$I(A;G)-I(A;P)$は、$H(A\mid P)-H(A\mid G)$と同値で、「過去より価値を知った方がどれだけ行動をよく予測できるか」を測る指標として読める&lt;/li&gt;
&lt;li&gt;しかしこの式は、一貫した価値観を持つ人（$P$とも$G$とも高い相関を持つ人）を誤って「不自由」と判定しうる&lt;/li&gt;
&lt;li&gt;これは相互情報量が統計的依存性しか見ておらず、行動の理由・原因を区別できないため&lt;/li&gt;
&lt;li&gt;条件付き相互情報量$I(A;G\mid P)$や、$do(G)$を使った因果的な定式化へ進むことで、過去の焼き直しに過ぎない価値表明と、本物の理由応答性をある程度区別できる&lt;/li&gt;
&lt;li&gt;ただしこれは、reasons-responsiveness・mechanism ownership・ultimate sourcehoodという3段階のうち、最初の1段階を切り出したに過ぎない。どこまでを自由の条件とみなすかで、compatibilistとhard incompatibilistの立場が分かれる&lt;/li&gt;
&lt;li&gt;永劫回帰・運命愛は、ultimate sourcehoodの無限後退を解決するのではなく、「何が私の原因だったのか」から「それでも私は、こうなった自分を肯定できるか」へと、問いの軸そのものをずらす応答として読める&lt;/li&gt;
&lt;li&gt;情報理論の出発点（$H(A\mid P)$）から出発し、因果推論（reasons-responsiveness）を経て、自由意志論の核心的な難問（sourcehood）にたどり着き、永劫回帰という実存的な問いの転換で締めくくる、一つながりの道筋として整理できる&lt;/li&gt;
&lt;/ul&gt;
$$
\boxed{\text{自由を測ろうとした結果、「何を自由と呼ぶか」が立場依存であることが露呈した}}
$$&lt;ul&gt;
&lt;li&gt;この記事は、結局「自由を定式化できた」という話ではなく、自由を定式化しようと試みる過程そのものが、自由意志論の争点のありかを数式の上に露出させた、という記録になっている&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="参考文献"&gt;参考文献&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F%E3%81%A8%E7%9B%B8%E4%BA%92%E6%83%85%E5%A0%B1%E9%87%8F/" &gt;シャノンの情報量と相互情報量&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E5%AD%98%E5%9C%A8%E3%81%AE%E8%80%90%E3%81%88%E3%82%89%E3%82%8C%E3%81%AA%E3%81%84%E8%BB%BD%E3%81%95%E3%81%AE%E6%84%8F%E5%91%B3/" &gt;「存在の耐えられない軽さ」の意味&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Nietzsche, F. (1882). &amp;ldquo;Die fröhliche Wissenschaft&amp;rdquo;（『愉しい学問』第341節、永劫回帰の思考実験が最初に提示される箇所）&lt;/li&gt;
&lt;li&gt;Nietzsche, F. (1883-1885). &amp;ldquo;Also sprach Zarathustra&amp;rdquo;（『ツァラトゥストラはこう語った』）&lt;/li&gt;
&lt;li&gt;Fischer, J. M., &amp;amp; Ravizza, M. (1998). &amp;ldquo;Responsibility and Control: A Theory of Moral Responsibility&amp;rdquo;&lt;/li&gt;
&lt;li&gt;Strawson, G. (1994). &amp;ldquo;The Impossibility of Moral Responsibility&amp;rdquo; (Philosophical Studies, 75)&lt;/li&gt;
&lt;li&gt;Pereboom, D. (2001). &amp;ldquo;Living Without Free Will&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://plato.stanford.edu/entries/compatibilism/" target="_blank" rel="noopener"
&gt;Compatibilism - Stanford Encyclopedia of Philosophy&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://plato.stanford.edu/entries/incompatibilism-arguments/" target="_blank" rel="noopener"
&gt;Arguments for Incompatibilism - Stanford Encyclopedia of Philosophy&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>シャノンの情報量と相互情報量</title><link>https://www.m1ke.org/p/%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F%E3%81%A8%E7%9B%B8%E4%BA%92%E6%83%85%E5%A0%B1%E9%87%8F/</link><pubDate>Fri, 01 May 2026 10:04:02 +0900</pubDate><guid>https://www.m1ke.org/p/%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F%E3%81%A8%E7%9B%B8%E4%BA%92%E6%83%85%E5%A0%B1%E9%87%8F/</guid><description>&lt;img src="https://www.m1ke.org/p/%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F%E3%81%A8%E7%9B%B8%E4%BA%92%E6%83%85%E5%A0%B1%E9%87%8F/shannons-formula.jpg" alt="Featured image of post シャノンの情報量と相互情報量" /&gt;&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;以前ブルーバックスでシャノンの情報量について書かれた本を読んだことがあるが、時間が経って内容をだいぶ忘れかけている&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%83%99%E3%82%A4%E3%82%BA%E5%AE%9F%E9%A8%93%E8%A8%88%E7%94%BB%E6%B3%95/" &gt;ベイズ実験計画法&lt;/a&gt;の期待情報利得（EIG）が相互情報量として定義されていることに改めて気づき、相互情報量の定義自体を曖昧にしか覚えていないことに気づいた&lt;/li&gt;
&lt;li&gt;そこで、忘れないうちに自己情報量・エントロピー・相互情報量の関係を整理しておく&lt;/li&gt;
&lt;li&gt;自己情報量とエントロピーの基礎は&lt;a class="link" href="https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%A7%E3%82%88%E3%81%8F%E5%87%BA%E3%82%8B%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F/" &gt;機械学習でよく出るシャノンの情報量&lt;/a&gt;で既にまとめているので、ここでは簡単におさらいした上で、相互情報量を中心に扱う&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="自己情報量とエントロピーのおさらい"&gt;自己情報量とエントロピーのおさらい&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;自己情報量: ある出来事$x$が実際に起きたときの「驚きの大きさ」。珍しい出来事ほど大きい&lt;/li&gt;
&lt;/ul&gt;
$$
I(x) = -\log p(x)
$$&lt;ul&gt;
&lt;li&gt;エントロピー: 自己情報量の期待値。結果を見る前の「平均的な不確実性」&lt;/li&gt;
&lt;/ul&gt;
$$
H(X) = -\sum_x p(x)\log p(x)
$$&lt;ul&gt;
&lt;li&gt;確率分布が均等なほどエントロピーは大きく、偏っているほど小さい&lt;/li&gt;
&lt;li&gt;詳しい導出・直感（なぜ対数を使うか、bitとnatの違いなど）は&lt;a class="link" href="https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%A7%E3%82%88%E3%81%8F%E5%87%BA%E3%82%8B%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F/" &gt;機械学習でよく出るシャノンの情報量&lt;/a&gt;を参照&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="結合エントロピーと条件付きエントロピー"&gt;結合エントロピーと条件付きエントロピー&lt;/h2&gt;
&lt;p&gt;相互情報量を定義する前に、2つの確率変数を扱うエントロピーを整理しておく。&lt;/p&gt;
&lt;h3 id="結合エントロピーjoint-entropy"&gt;結合エントロピー（Joint Entropy）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;確率変数$X$と$Y$を同時に観測したときの、全体の不確実性&lt;/li&gt;
&lt;/ul&gt;
$$
H(X,Y) = -\sum_x\sum_y p(x,y)\log p(x,y)
$$&lt;h3 id="条件付きエントロピーconditional-entropy"&gt;条件付きエントロピー（Conditional Entropy）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;$X$の値が分かった後に、$Y$に残っている不確実性の期待値&lt;/li&gt;
&lt;/ul&gt;
$$
H(Y\mid X) = -\sum_x\sum_y p(x,y)\log p(y\mid x)
$$&lt;ul&gt;
&lt;li&gt;$X$を知ることで$Y$の予測がどれだけ楽になるかを表す量&lt;/li&gt;
&lt;li&gt;$X$と$Y$が独立なら、$X$を知ってもYの不確実性は減らないため$H(Y\mid X)=H(Y)$になる&lt;/li&gt;
&lt;li&gt;$X$が$Y$を完全に決定するなら、$X$を知った時点で$Y$の不確実性はゼロになるため$H(Y\mid X)=0$になる&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="連鎖律chain-rule"&gt;連鎖律（Chain Rule）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;結合エントロピーは、条件付きエントロピーを使って以下のように分解できる&lt;/li&gt;
&lt;/ul&gt;
$$
H(X,Y) = H(X) + H(Y\mid X) = H(Y) + H(X\mid Y)
$$&lt;ul&gt;
&lt;li&gt;「XとYを合わせた不確実性」は、「Xだけの不確実性」と「Xが分かった後に残るYの不確実性」の和に等しい、という直感的な式&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="相互情報量mutual-information"&gt;相互情報量（Mutual Information）&lt;/h2&gt;
&lt;h3 id="定義"&gt;定義&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;相互情報量$I(X;Y)$は、「Xを知ることで、Yの不確実性がどれだけ減るか」を表す量&lt;/li&gt;
&lt;/ul&gt;
$$
I(X;Y) = H(Y) - H(Y\mid X)
$$&lt;ul&gt;
&lt;li&gt;連鎖律を使うと、対称な形にも書き換えられる&lt;/li&gt;
&lt;/ul&gt;
$$
I(X;Y) = H(X) + H(Y) - H(X,Y) = I(Y;X)
$$&lt;ul&gt;
&lt;li&gt;つまり、「Xを知ってYの不確実性が減る量」と「Yを知ってXの不確実性が減る量」は常に等しい。これが「相互」情報量と呼ばれる理由&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="直感的なイメージ"&gt;直感的なイメージ&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;$X$と$Y$が独立: $X$を知ってもYの予測は何も変わらないので$H(Y\mid X)=H(Y)$、よって$I(X;Y)=0$&lt;/li&gt;
&lt;li&gt;$X$が$Y$を完全に決定する: $X$を知った瞬間に$Y$が確定するので$H(Y\mid X)=0$、よって$I(X;Y)=H(Y)$（最大）&lt;/li&gt;
&lt;li&gt;相互情報量は、0（全く無関係）から$\min(H(X),H(Y))$（一方が他方を完全に決定する）までの範囲を取る&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="確率分布を使った別の表現"&gt;確率分布を使った別の表現&lt;/h3&gt;
&lt;p&gt;相互情報量は、同時分布$p(x,y)$と周辺分布の積$p(x)p(y)$のKLダイバージェンス（相対エントロピー）としても定義できる。&lt;/p&gt;
$$
I(X;Y) = D_{\text{KL}}\bigl(p(x,y) \,\|\, p(x)p(y)\bigr) = \sum_x\sum_y p(x,y)\log\frac{p(x,y)}{p(x)p(y)}
$$&lt;ul&gt;
&lt;li&gt;$p(x,y)=p(x)p(y)$（独立）であれば、このKLダイバージェンスは0になる&lt;/li&gt;
&lt;li&gt;$X$と$Y$の同時分布が、独立を仮定した分布からどれだけ離れているかを測っている、とも解釈できる&lt;/li&gt;
&lt;li&gt;つまり相互情報量は「エントロピーの差」であると同時に「同時分布と独立分布のズレ」でもあり、2つの見方が同じ量に一致する&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="ベイズ実験計画法との接続"&gt;ベイズ実験計画法との接続&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%83%99%E3%82%A4%E3%82%BA%E5%AE%9F%E9%A8%93%E8%A8%88%E7%94%BB%E6%B3%95/" &gt;ベイズ実験計画法&lt;/a&gt;で扱った期待情報利得（EIG）は、まさにこの相互情報量そのもの&lt;/li&gt;
&lt;/ul&gt;
$$
\text{EIG}(d) = I(\theta;Y\mid d) = \mathbb{E}_{y\sim p(y\mid d)}\Bigl[D_{\text{KL}}\bigl(p(\theta\mid y,d)\,\|\,p(\theta)\bigr)\Bigr]
$$&lt;ul&gt;
&lt;li&gt;$\theta$（モデルパラメータ）についての事前分布$p(\theta)$のエントロピーから、実験結果$Y$を観測した後の条件付きエントロピーの期待値を引いたもの、という構造になっている&lt;/li&gt;
&lt;li&gt;「情報量が大きい実験＝結果の不確実性（エントロピー）が高い実験」という直感的な言い方は、厳密には「その実験のEIG（相互情報量）が大きい」という意味であり、相互情報量自体はエントロピーの差分として定義されている&lt;/li&gt;
&lt;li&gt;つまり、ベイズ実験計画法での「最も不確実な実験を選ぶ」という発想は、シャノンのエントロピーの概念を土台にして、相互情報量という形で定式化されたもの&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;自己情報量は1回の出来事の驚きの大きさ、エントロピーはその平均（不確実性）&lt;/li&gt;
&lt;li&gt;条件付きエントロピー$H(Y\mid X)$は、Xを知った後に残るYの不確実性&lt;/li&gt;
&lt;li&gt;相互情報量$I(X;Y)=H(Y)-H(Y\mid X)$は、Xを知ることでYの不確実性がどれだけ減るかを表し、XとYについて対称&lt;/li&gt;
&lt;li&gt;相互情報量は、同時分布と独立分布のKLダイバージェンスとしても表現でき、2つの見方が一致する&lt;/li&gt;
&lt;li&gt;ベイズ実験計画法の期待情報利得（EIG）は、この相互情報量そのものであり、エントロピーという土台の上に組み立てられた量&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="参考文献"&gt;参考文献&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%A7%E3%82%88%E3%81%8F%E5%87%BA%E3%82%8B%E3%82%B7%E3%83%A3%E3%83%8E%E3%83%B3%E3%81%AE%E6%83%85%E5%A0%B1%E9%87%8F/" &gt;機械学習でよく出るシャノンの情報量&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.m1ke.org/p/%E3%83%99%E3%82%A4%E3%82%BA%E5%AE%9F%E9%A8%93%E8%A8%88%E7%94%BB%E6%B3%95/" &gt;ベイズ実験計画法&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Shannon, C. E. (1948). &amp;ldquo;A Mathematical Theory of Communication&amp;rdquo;&lt;/li&gt;
&lt;li&gt;Cover, T. M., &amp;amp; Thomas, J. A. &amp;ldquo;Elements of Information Theory&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>