<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Evaluation on M1KE BL0G</title><link>https://www.m1ke.org/tags/evaluation/</link><description>Recent content in Evaluation on M1KE BL0G</description><generator>Hugo -- gohugo.io</generator><language>ja-jp</language><copyright>mike</copyright><lastBuildDate>Sat, 05 Sep 2026 12:00:00 +0900</lastBuildDate><atom:link href="https://www.m1ke.org/tags/evaluation/index.xml" rel="self" type="application/rss+xml"/><item><title>機械学習における評価指標の再考</title><link>https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%AB%E3%81%8A%E3%81%91%E3%82%8B%E8%A9%95%E4%BE%A1%E6%8C%87%E6%A8%99%E3%81%AE%E5%86%8D%E8%80%83/</link><pubDate>Sat, 05 Sep 2026 12:00:00 +0900</pubDate><guid>https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%AB%E3%81%8A%E3%81%91%E3%82%8B%E8%A9%95%E4%BE%A1%E6%8C%87%E6%A8%99%E3%81%AE%E5%86%8D%E8%80%83/</guid><description>&lt;img src="https://www.m1ke.org/p/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92%E3%81%AB%E3%81%8A%E3%81%91%E3%82%8B%E8%A9%95%E4%BE%A1%E6%8C%87%E6%A8%99%E3%81%AE%E5%86%8D%E8%80%83/split.jpg" alt="Featured image of post 機械学習における評価指標の再考" /&gt;&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;機械学習では、データをTrain・Validation・Testの3つに分けるのが定石とされている&lt;/li&gt;
&lt;li&gt;Trainでモデルを学習し、ValidationでハイパーパラメータやEarly Stoppingを決め、最後にTestで未知データに対する性能を測るという構造&lt;/li&gt;
&lt;li&gt;しかし実際にシステムを開発していると、この3分割だけでは説明できない問題にぶつかることがある&lt;/li&gt;
&lt;li&gt;特に「Testで失敗している理由を知りたいが、Testを見て改善した瞬間、そのTestはもはやTestではなくなる」という問題がある&lt;/li&gt;
&lt;li&gt;ここでは、Train・Val・Testという古典的な3分割を、DevとChallengeを加えた5つの役割に拡張して整理する&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="trainvaltestの役割"&gt;Train・Val・Testの役割&lt;/h2&gt;
&lt;p&gt;まず、通常の3分割それぞれの役割を整理する。&lt;/p&gt;
&lt;h3 id="train"&gt;Train&lt;/h3&gt;
&lt;p&gt;モデルのパラメータを学習するためのデータ。以下の式で表される、学習データ上での損失を最小化するパラメータ$\theta^*$を求めるために使う。&lt;/p&gt;
$$
\theta^* = \arg\min_\theta \hat{R}_{\text{train}}(\theta)
$$&lt;h3 id="validation"&gt;Validation&lt;/h3&gt;
&lt;p&gt;モデルそのものではなく、学習方法を選択するためのデータ。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Learning Rate&lt;/li&gt;
&lt;li&gt;モデルサイズ&lt;/li&gt;
&lt;li&gt;正則化係数&lt;/li&gt;
&lt;li&gt;Data Augmentation&lt;/li&gt;
&lt;li&gt;Early Stopping&lt;/li&gt;
&lt;li&gt;モデルアーキテクチャ&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;これらを選ぶために使う。つまりValidationも、広い意味では学習プロセスの一部といえる。&lt;/p&gt;
&lt;h3 id="test"&gt;Test&lt;/h3&gt;
&lt;p&gt;最後までモデル開発から隔離し、最終的な汎化性能を測定するためのデータ。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Testを見て意思決定してはいけないという原則が重要&lt;/li&gt;
&lt;li&gt;Testを見ながらモデルを改善すると、モデルの重みを直接学習していなくても、開発者自身がTestに適応してしまう&lt;/li&gt;
&lt;li&gt;結果として、Testへの「開発プロセス全体の過学習」が起きる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="train分布と本番分布が違うという問題"&gt;Train分布と本番分布が違うという問題&lt;/h2&gt;
&lt;p&gt;古典的なTrain・Val・Testの説明には、以下のような暗黙の仮定がある。&lt;/p&gt;
$$
P_{\text{train}} \approx P_{\text{val}} \approx P_{\text{test}} \approx P_{\text{deployment}}
$$&lt;p&gt;しかし、実運用ではこの仮定は頻繁に崩れる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;TrainはWeb画像だが、本番はスマートフォン画像&lt;/li&gt;
&lt;li&gt;Trainは過去のユーザーだが、本番は将来のユーザー&lt;/li&gt;
&lt;li&gt;Trainはある病院のデータだが、本番は別の病院&lt;/li&gt;
&lt;li&gt;Trainはある国のデータだが、本番は別地域&lt;/li&gt;
&lt;li&gt;Train時とDeployment時で商品の構成が変わる&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;WILDSベンチマークは、病院・撮影場所・時間・地域など、実世界で自然に発生するDistribution Shiftによって、In-distribution性能とOut-of-distribution性能の間に大きな差が生じることを示している。つまり、以下の不等式で表される状況は例外ではなく、実世界ではかなり普通に起きる。&lt;/p&gt;
$$
P_{\text{source}} \neq P_{\text{target}}
$$&lt;h2 id="testのパラドックス"&gt;Testのパラドックス&lt;/h2&gt;
&lt;p&gt;例えば、最終Testで性能が大きく低下したとする。Val Accuracyが94%なのに、Test Accuracyが72%だったとすると、開発者は当然「なぜ22ポイントも落ちたのか」を知りたくなる。そこでTestデータを見ると、以下のようなことが分かる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;暗い画像で失敗している&lt;/li&gt;
&lt;li&gt;特定の端末だけ性能が低い&lt;/li&gt;
&lt;li&gt;特定カテゴリのRecallが悪い&lt;/li&gt;
&lt;li&gt;Trainに存在しない背景が多い&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;これがError Analysis。この分析結果を元に、暗所画像をTrainに追加する、Augmentationを変更する、ラベル設計を変更する、モデル構造を変更する、といった改善を行う。&lt;/p&gt;
&lt;p&gt;しかし、この瞬間に問題が起きる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Testから得られた情報でモデルを改善した以上、そのTestはもう完全なBlind Testではない&lt;/li&gt;
&lt;li&gt;形式的にモデルパラメータへTestを入力していなくても、Test→人間→モデル設計という情報経路が成立している&lt;/li&gt;
&lt;li&gt;つまりTestは、実質的にDevelopment Setになってしまう&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="target側にもdevを作る"&gt;Target側にもDevを作る&lt;/h2&gt;
&lt;p&gt;ここで自然な解決策として、Source側だけでなくTarget側も分割するという発想が出てくる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Source側: Train、Val&lt;/li&gt;
&lt;li&gt;Target側: Dev、Test&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;という構造になる。&lt;/p&gt;
&lt;h2 id="devとtestの違い"&gt;devとtestの違い&lt;/h2&gt;
&lt;h3 id="dev"&gt;Dev&lt;/h3&gt;
&lt;p&gt;DevはTarget distributionを理解するためのデータで、開発者が見てよい。サンプルを直接確認し、以下のような分析をする。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Failure Mode&lt;/li&gt;
&lt;li&gt;Slice別性能&lt;/li&gt;
&lt;li&gt;分布差&lt;/li&gt;
&lt;li&gt;ラベル問題&lt;/li&gt;
&lt;li&gt;Spurious Correlation&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Devから得られた知見は、Trainへ戻して改善に使う。&lt;/p&gt;
&lt;h3 id="test-1"&gt;Test&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Target distributionから採取するが、最後までBlindにする&lt;/li&gt;
&lt;li&gt;最終的に、「Devを見ながら作った開発プロセスが、別のTargetサンプルにもGeneralizeしたか」を確認する&lt;/li&gt;
&lt;li&gt;つまり、Train→Val→Dev→Error Analysis→Trainという改善ループと、Model→Blind Testという最終評価を分離する構造になる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="devだけでも足りない理由"&gt;Devだけでも足りない理由&lt;/h2&gt;
&lt;p&gt;もう一つ問題がある。平均的なDev performanceだけでは、モデルが持っている重要な弱点を発見できないことがある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;例えば自動運転モデルで、全体のAccuracyが99.5%だったとする&lt;/li&gt;
&lt;li&gt;夜間・豪雨・逆光・工事現場・子どもの飛び出しといった状況だけで極端に性能が低ければ、実運用では重大な問題になる&lt;/li&gt;
&lt;li&gt;しかし、これらが通常データの0.1%しか存在しなければ、平均Accuracyではほとんど見えない&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;そこで必要になるのがChallenge Set。&lt;/p&gt;
&lt;h2 id="challenge-setは分布を代表する必要がない"&gt;Challenge Setは分布を代表する必要がない&lt;/h2&gt;
&lt;p&gt;Challenge Setは、通常のTestとは目的が違う。Testは、以下のようにdeployment分布を代表することを目指す。&lt;/p&gt;
$$
P_{\text{test}} \approx P_{\text{deployment}}
$$&lt;p&gt;一方Challengeは、必ずしもDeployment distributionを代表しなくてよい。むしろ意図的に難しいケースを集める。目的が違うため、以下のように分布が一致していなくても構わない。&lt;/p&gt;
$$
P_{\text{challenge}} \neq P_{\text{deployment}}
$$&lt;p&gt;Challengeの目的は、平均性能を推定することではなく、特定の能力・弱点を診断すること。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;ImageNet-Aのような研究はこの発想の典型例&lt;/li&gt;
&lt;li&gt;通常のImageNetとは異なり、既存モデルが失敗しやすい自然画像を意図的に集めることで、平均的なテストセットでは見えにくいモデルの弱点を明らかにする&lt;/li&gt;
&lt;li&gt;Challengeは1つである必要もなく、Failure Modeごとに複数持ってもよい
&lt;ul&gt;
&lt;li&gt;Challenge（低照度）&lt;/li&gt;
&lt;li&gt;Challenge（レアクラス）&lt;/li&gt;
&lt;li&gt;Challenge（OOD）&lt;/li&gt;
&lt;li&gt;Challenge（ロングテール）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="5つの役割"&gt;5つの役割&lt;/h2&gt;
&lt;p&gt;ここまで整理すると、評価データは以下のようになる。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Dataset&lt;/th&gt;
&lt;th&gt;主目的&lt;/th&gt;
&lt;th style="text-align: right"&gt;開発者が見るか&lt;/th&gt;
&lt;th style="text-align: right"&gt;モデル改善に使用するか&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Train&lt;/td&gt;
&lt;td&gt;Parameter Learning&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Val&lt;/td&gt;
&lt;td&gt;Model Selection&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Dev&lt;/td&gt;
&lt;td&gt;Error Analysis&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Challenge&lt;/td&gt;
&lt;td&gt;Failure-mode / Capability Evaluation&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;td style="text-align: right"&gt;Yes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Test&lt;/td&gt;
&lt;td&gt;Final Generalization Estimate&lt;/td&gt;
&lt;td style="text-align: right"&gt;No&lt;/td&gt;
&lt;td style="text-align: right"&gt;No&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;つまり、Train・Val・Dev・Challenge・Blind Testという構造&lt;/li&gt;
&lt;li&gt;ただし、これは「データを機械的に5分割せよ」という意味ではなく、重要なのはそれぞれの役割を分離すること&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="valとdevの違い"&gt;ValとDevの違い&lt;/h2&gt;
&lt;p&gt;一見するとValとDevは同じものに見え、実際に多くの文献ではValidation SetとDevelopment Setがほぼ同義語として使われる。ここではあえて分離して考える。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Val: どのモデルを選ぶかを決めるためのデータ&lt;/li&gt;
&lt;li&gt;Dev: なぜ本番で失敗するのかを理解するためのデータ&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;例えば、Val AccuracyでModel Aが91.2%、Model Bが92.1%ならModel Bを選ぶ&lt;/li&gt;
&lt;li&gt;これがModel Selection&lt;/li&gt;
&lt;li&gt;一方Devでは、「Model Bは平均では良いが、夜間画像ではModel Aより悪い」といった分析をする&lt;/li&gt;
&lt;li&gt;これがError Analysis&lt;/li&gt;
&lt;li&gt;つまり、ValとDevは役割が異なる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="challengeとdevの違い"&gt;ChallengeとDevの違い&lt;/h2&gt;
&lt;p&gt;Devは、Target distributionをなるべく代表する。一方Challengeは、意図的に分布を歪める。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;例えば本番データで、通常画像98%・夜間1%・豪雨0.5%・逆光0.5%だったとする&lt;/li&gt;
&lt;li&gt;Devではこの比率をある程度維持する&lt;/li&gt;
&lt;li&gt;しかしChallengeでは、夜間33%・豪雨33%・逆光34%のように歪めてもよい&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;なぜならChallengeはPopulation Performanceではなく、Capabilityを測っているため。&lt;/p&gt;
&lt;h2 id="既存研究との関係"&gt;既存研究との関係&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ここで整理した5つの役割そのものが、機械学習の標準規格として確立されているわけではなかった&lt;/li&gt;
&lt;li&gt;むしろ、既存研究で別々に議論されてきた問題を、1つの開発フローとして整理したものと考える方が正確&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;先行研究のTopics:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;分布シフト（WILDS）
&lt;ul&gt;
&lt;li&gt;Koh et al.のWILDSは、現実世界ではTraining distributionとDeploymentに近いTest distributionが異なることを明示的に扱っている&lt;/li&gt;
&lt;li&gt;病院、地域、時刻、カメラなどによる実世界のDistribution Shiftをベンチマーク化しており、Source/Targetを分けて考える必要性を示している&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Target performanceの推定（Mandoline）
&lt;ul&gt;
&lt;li&gt;Chen et al.のMandolineは、SourceとTargetの分布差を、実務者が定義したSliceを利用してTarget上の性能推定に利用する&lt;/li&gt;
&lt;li&gt;「Target distributionを単一のAccuracyだけではなく、その構造を見ながら評価する」という、Dev的な発想に近い&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;分布シフトに対するStress Test
&lt;ul&gt;
&lt;li&gt;Subbaswamy et al.は、単一の評価分布で平均性能を見るだけでなく、分布を変化させた際のモデルのRobustness・Stabilityを評価する枠組みを提案している&lt;/li&gt;
&lt;li&gt;Challenge SetやStress Testingの考え方と接続する&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Challenge Set（ImageNet-A）
&lt;ul&gt;
&lt;li&gt;Hendrycks et al.のImageNet-Aは、既存モデルが失敗しやすい自然画像を意図的に集めることで、通常のTest Accuracyでは見えにくい弱点を評価した、Challenge evaluationの分かりやすい例&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Testから学習してしまう問題
&lt;ul&gt;
&lt;li&gt;Hernández-Orallo et al.は、AI evaluationを単一のAggregate Metricに潰すことの問題を指摘している&lt;/li&gt;
&lt;li&gt;つまり、SystemとProblemの組み合わせに対するより詳細な評価情報を利用する考え方を議論している&lt;/li&gt;
&lt;li&gt;タイトル自体が「Training on the Test Set」であり、評価データからどこまで情報を抽出してよいかという問題を正面から扱っている&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="sourceとtargetによる分類"&gt;SourceとTargetによる分類&lt;/h2&gt;
&lt;p&gt;以下のような定義になる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Train・Val:
&lt;ul&gt;
&lt;li&gt;Source distributionからサンプリング&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Dev・Test:
&lt;ul&gt;
&lt;li&gt;Target distributionからサンプリング（Devは見てよい、Testは見てはいけない）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Challenge:
&lt;ul&gt;
&lt;li&gt;Target（デプロイ環境）に関連するが、意図的に分布を歪めて集める&lt;/li&gt;
&lt;li&gt;「独立」というより「Target寄りだが非代表的」という位置づけ&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="本質はinformation-boundary"&gt;本質はInformation Boundary&lt;/h2&gt;
&lt;p&gt;ここで一番重要なのは、Train・Val・Dev・Challenge・Testという名前ではない。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;本質は、どの評価情報を開発プロセスへフィードバックしてよいのかというInformation Boundary&lt;/li&gt;
&lt;li&gt;モデル開発は、Data-&amp;gt;Metric-&amp;gt;Human-&amp;gt;Decision-&amp;gt;Modelというループで進む&lt;/li&gt;
&lt;li&gt;そのため、「モデルのWeight Optimizerに渡していないからTest leakageではない」とは限らない&lt;/li&gt;
&lt;li&gt;人間がTest結果を見てArchitectureを変更すれば、それも立派な情報伝達になる&lt;/li&gt;
&lt;li&gt;したがって評価セットは、まずDevelopmentに利用してよいデータと、Developmentから完全に隔離するデータに分ける必要がある&lt;/li&gt;
&lt;li&gt;その上でDevelopment側を、Parameter Learning・Model Selection・Error Analysis・Capability Analysisに分けると、Train・Val・Dev・Challengeが生まれ、最後にBlind Testを置く、という構造になる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;機械学習ではTrain・Val・Testの3分割が基本とされているが、実運用では学習分布と本番分布が一致しないことが珍しくない&lt;/li&gt;
&lt;li&gt;Testで性能が低下した理由を知るにはTarget側のデータを観察する必要があるが、Testを観察して改善に利用すると、そのTestはもはや完全なTestではなくなる&lt;/li&gt;
&lt;li&gt;そこでTrain・Val・Dev・Challenge・Testという役割分離を考える
&lt;ul&gt;
&lt;li&gt;Train: モデルを学習する&lt;/li&gt;
&lt;li&gt;Val: モデルを選択する&lt;/li&gt;
&lt;li&gt;Dev: 本番分布での失敗を理解する&lt;/li&gt;
&lt;li&gt;Challenge: 重要なFailure Modeを集中的に診断する&lt;/li&gt;
&lt;li&gt;Test: 最後までBlindにして最終性能を測る&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Source側からTrainとVal、TargetからTest、それと独立したDevとChallenge&lt;/li&gt;
&lt;li&gt;これはデータ分割のテクニックというより、機械学習開発における情報の流れを設計する問題&lt;/li&gt;
&lt;li&gt;本当に守りたいのは、モデル改善に使った情報と最終評価に使う情報を分離すること&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="参考文献"&gt;参考文献&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://proceedings.mlr.press/v139/koh21a.html" target="_blank" rel="noopener"
&gt;WILDS: A Benchmark of in-the-Wild Distribution Shifts&lt;/a&gt;（Koh et al., ICML 2021）&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://proceedings.mlr.press/v139/chen21i.html" target="_blank" rel="noopener"
&gt;Mandoline: Model Evaluation under Distribution Shift&lt;/a&gt;（Chen et al., ICML 2021）&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://proceedings.mlr.press/v130/subbaswamy21a.html" target="_blank" rel="noopener"
&gt;Evaluating Model Robustness and Stability to Dataset Shift&lt;/a&gt;（Subbaswamy et al., AISTATS 2021）&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://arxiv.org/abs/1907.07174" target="_blank" rel="noopener"
&gt;Natural Adversarial Examples&lt;/a&gt;（Hendrycks et al., CVPR 2021, ImageNet-A）&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://doi.org/10.1609/aaai.v36i11.21487" target="_blank" rel="noopener"
&gt;Training on the Test Set: Mapping the System-Problem Space in AI&lt;/a&gt;（Hernández-Orallo et al., AAAI 2022）&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://proceedings.mlr.press/v119/miller20a.html" target="_blank" rel="noopener"
&gt;The Effect of Natural Distribution Shift on Question Answering Models&lt;/a&gt;（Miller et al., ICML 2020）&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>