- Authors

- Name
- Youngju Kim
- @fjvbn20031
- はじめに
- SOTAの賞味期限が短い理由
- 汚染: 試験問題が教科書に混ざるとき
- ハーネスとプロンプト: 同じモデル、違うスコア
- 自己申告とリーダーボードの構造
- 審査者が人でないとき
- 数値に誤差棒をつける
- 読む順序とチェックリスト
- 確認の方法と時点
- 自分で試す
- 参考資料
はじめに
このシリーズの最終回は、モデルではなく数値についてです。先行する5回で私は同じ文を繰り返してきました。この数値は著者報告であり、ハーネスが変われば値も変わる、と。今回はその文の根拠を論文で埋めます。
論文情報は2026-08-12に原文で直接確認しました。この分野は速く変わるため、最新の状態はご自身で確認してください。
SOTAの賞味期限が短い理由
SOTAは状態ではなく時点です。「XがSOTAだ」という文は、実のところ「私が最後に確認したリーダーボードのスナップショットで、私が使ったハーネスとプロンプトで、私が選んだベンチマークで、Xが上だった」の略です。この文では四つの条件が省略されており、そのうち三つは数日単位で変わります。
ベンチマーク評価を体系化しようとした初期の試みであるHELM(arxiv.org/abs/2211.09110、2022-11-16登録)が指摘したのがこの問題です。著者らは、HELM以前のモデルが平均して中核シナリオの17.9%でしか評価されていなかったと報告します。異なる部分集合で測ったスコアで順位をつけていたということです。なおHELMの著者らは自分たちの枠組みの空白も併記します。周縁化された英語方言の質問応答と、信頼性の指標が不足しているという点です。
汚染: 試験問題が教科書に混ざるとき
最も広く知られた問題であり、それでも過小評価されています。
文字列一致による除去では足りません。 言い換え標本を扱った論文(arxiv.org/abs/2311.04850、2023-11-08登録)は、テストデータを言い換えるか翻訳するだけで標準的な除染が破られることを示し、13Bのモデルがベンチマークに過適合して極端に高い性能を出しうると報告します。実際の事前学習コーパスでHumanEvalの8〜18%が重複するという観察も併せて示されます。
しかしすべてのモデルが汚染されているわけではありません。 GSM8kを模して新たに作られたGSM1kの論文(arxiv.org/abs/2405.00332、2024-05-01登録)は、最大8%の低下と一部モデル系列の体系的な過適合を報告しつつ、とくに最前線のモデルは過適合の兆候がわずかであり、すべてのモデルが学習に含まれない新問題へ広く一般化すると併記します。汚染の議論を冷笑で終わらせるのは誤読です。
この主題の全体は汚染サーベイ(arxiv.org/abs/2406.04244、2024-06-06登録)に整理されています。対応の一つは問題を入れ替え続けることです。LiveBench(arxiv.org/abs/2406.19314、2024-06-27登録)は最近の資料から問題を毎月更新し、客観的な正解で自動採点します。題名が汚染なしではなく汚染限定である点に注目してください。著者らが選んだ語です。
ハーネスとプロンプト: 同じモデル、違うスコア
ここが実務者にとって最も効く部分です。
プロンプト形式への敏感さを定量化した論文(arxiv.org/abs/2310.11324、2023-10-17登録)は、少数ショット設定で些細な書式の違いだけで正確さが最大76点開いた事例を報告します。モデルを大きくしても、例を増やしても、指示調整をしても、この不安定さは残りました。著者らの結論は率直です。任意に固定した一つの形式でモデルを比較する方法論そのものの妥当性が問われるべきであり、単一形式のスコアではなく、ありうる形式群にわたる性能の幅を報告すべきだというものです。
同じ問題を道具の側から扱ったのが、lm-eval-harnessチームの記録(arxiv.org/abs/2405.14782、2024-05-23登録、v3は2026-05-31)です。評価設定への敏感さ、手法間の適切な比較の難しさ、再現性と透明性の欠如を列挙し、暗黙知として漂っていた知識を文書化しようとします。
音声にも同種の試みがあります。Open ASR Leaderboard(arxiv.org/abs/2510.06961、2025-10-08登録)は86のシステムを12のデータセットで比較しつつ、異なるツールキットにまたがってWERとRTFxを標準化します。標準化された比較と、各自が測った数値の集まりは別物です。
自己申告とリーダーボードの構造
技術レポートのスコアは自己申告です。しかし公開リーダーボードも中立な秤ではありません。
リーダーボードの構造的な問題を扱った論文(arxiv.org/abs/2504.20879、2025-04-29登録)は、大規模なアリーナ型の評価プラットフォームを分析します。非公開の事前テストで多数の変種を回し、良い結果だけを公開できること、標本が非対称で、いくつかの大手提供者がそれぞれ対戦データの約19〜20%を受け取る一方、83の公開重みモデルが合計で約30%だったこと、そして追加データが保守的な見積もりでも相対性能を最大112%押し上げうることを報告します。著者らの結論は、この指標が一般的なモデル品質より、そのアリーナへの過適合を反映するようになるというものです。
審査者が人でないとき
近年の評価の多くはLLMがLLMを採点します。この方式を最初に体系化した論文(arxiv.org/abs/2306.05685、2023-06-09登録)は、強い審査者が人の選好と80%以上一致すると報告しつつ、同じアブストラクトの中で位置の偏り、冗長さへの偏り、自己優遇の偏り、限られた推論能力を認めます。長所と限界が同じ段落に同居しています。
2026年の後続作業はより率直です。審査者の信頼性を負荷試験した論文(arxiv.org/abs/2603.05399、2026-03-05登録)は、自分たちが評価したどの審査者もベンチマーク全体にわたって一貫して信頼できるものではなかったと報告します。単純な書式の変更、言い換え、冗長さの調整、正解ラベルの反転だけで判定が揺れました。著者らはこれを予備実験だと述べています。
数値に誤差棒をつける
最後に、多くの評価表に欠けているのが不確実性です。評価を実験とみなして統計を当てようという論文(arxiv.org/abs/2411.00640、2024-11-01登録)は、評価設問を見えない母集団から抽出された標本として扱い、二つのモデルの差を測る式と実験設計の方法を提示します。
さらに新しい問題が上に重なります。適応的ベンチマーキングにおける勝者の呪いを扱った論文(arxiv.org/abs/2605.05973、2026-05-07登録)は、調整の過程でベンチマーク項目を再利用すると選択の偏りが生じ、性能推定が上振れすると指摘します。つまりプロンプトと設定を探索して最良の結果を選んだ瞬間、そのスコアは新しいデータでの性能の推定値ではなくなります。
読む順序とチェックリスト
[リーダーボードの数値を見るときの問い]
1. 誰が測ったか : 著者の自己測定か第三者か
2. どのハーネスか : プロンプト形式、少数ショット数、答えの抽出規則
3. いつ作られた設問か : モデルの学習時点より後か
4. 標本は公平か : 誰がどれだけ評価されたか
5. 審査者は誰か : 人かモデルか、偏りは点検したか
6. 誤差棒はあるか : 差は雑音より大きいか
7. 調整に使ったか : そのベンチマークで設定を選んだか
この七つのうち三つ以上に答えられないなら、その数値で意思決定をしてはいけません。
確認の方法と時点
本記事で引用した論文はすべて、2026-08-12にarXivのアブストラクトページを直接開き、題名と識別子、登録日、主張内容を確認しました。開けなかった候補は引用していません。引用した数値は各論文の著者が報告した値です。
このシリーズ全体が守ろうとした規則も同じです。どのモデルが最良だとは書かず、著者が何を主張し、何を自ら限定したかだけを移します。私はどのベンチマークも自分で再現していません。
自分で試す
- AIベンチマーク集 — リーダーボードのサイトをカテゴリ別にまとめています。上のチェックリストを持って任意のリーダーボードを一つ開き、七つの問いに答えてみてください。
- ブラウザAIラボ — 感情分析やゼロショット分類を自分で回すと、同じ文でも言い回しを少し変えるだけで結果が揺れる様子を目で見られます。
シリーズ前回: 画像生成・理解の技術レポート、何を読むか
シリーズの最初へ: テキストLLMの技術レポート、何を読むか
参考資料
- Holistic Evaluation of Language Models (arXiv 2211.09110): arxiv.org/abs/2211.09110
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (arXiv 2306.05685): arxiv.org/abs/2306.05685
- Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design (arXiv 2310.11324): arxiv.org/abs/2310.11324
- Rethinking Benchmark and Contamination for Language Models with Rephrased Samples (arXiv 2311.04850): arxiv.org/abs/2311.04850
- A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv 2405.00332): arxiv.org/abs/2405.00332
- Lessons from the Trenches on Reproducible Evaluation of Language Models (arXiv 2405.14782): arxiv.org/abs/2405.14782
- Benchmark Data Contamination of Large Language Models: A Survey (arXiv 2406.04244): arxiv.org/abs/2406.04244
- LiveBench: A Challenging, Contamination-Limited LLM Benchmark (arXiv 2406.19314): arxiv.org/abs/2406.19314
- Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations (arXiv 2411.00640): arxiv.org/abs/2411.00640
- The Leaderboard Illusion (arXiv 2504.20879): arxiv.org/abs/2504.20879
- Open ASR Leaderboard (arXiv 2510.06961): arxiv.org/abs/2510.06961
- Judge Reliability Harness: Stress Testing the Reliability of LLM Judges (arXiv 2603.05399): arxiv.org/abs/2603.05399
- Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking (arXiv 2605.05973): arxiv.org/abs/2605.05973