Skip to content

필사 모드: 蒸留で転移するものとしないもの — DeepSeekをGPT-OSSに蒸留したら検閲は付いてこなかった

日本語
0%
정확도 0%
💡 왼쪽 원문을 읽으면서 오른쪽에 따라 써보세요. Tab 키로 힌트를 받을 수 있습니다.

はじめに — 147点のShow HNが実際に見せたもの

2026年7月30日、Show HNに上がった実験が147点を獲得しました。CTGTというチームが研究ノートとして公開した内容はこうです。中国のモデルであるDeepSeek V4 Flashを教師として、米国のオープンウェイトモデルGPT-OSSに金融推論能力を蒸留したところ、能力は上がり、教師が見せていた政治的検閲は生徒に現れなかった、というものです。

この結論が関心を引いた理由は、政策論争と接しているからです。中国製のオープンウェイトモデルが普及すると、そこに含まれた政治的バイアスが派生モデルを伝って広がるという懸念が絶えず提起されてきましたが、この実験は少なくとも一つの条件ではそうではなかったと言っています。

ところがこの記事の目的はその政策論争ではありません。ここで興味深いのは、はるかに長持ちする問いです — 蒸留は正確に何をコピーするのか。知識蒸留がコピーするのは重みではなく、教師が特定の入力たちで出した出力です。だとすれば転移の可否は三つが決めます。何を観測したか、どこで観測したか、そして誰にコピーするか。この実験はその枠組みを説明するのに良い事例であり、同時に非公式な実験ひとつが支えうる範囲がどこまでなのかを見せる事例でもあります。

実験設計を正確に書き写すと

項目
教師DeepSeek V4 Flash
生徒GPT-OSS-120B、GPT-OSS-20B
方法ヒントベースの自己蒸留 + 逆KL(誤りの地点を検出 → ヒント注入 → 二重の続き書き → その後の生徒トークン100個の区間に逆KL)
唯一の実験変数ヒントの著者(DeepSeekの出力 対 生徒自身の訂正された推論)
蒸留データ学習プロンプト220個、オンポリシー例176個、合成金融問題1,574個(CAPM、DCF、オプション価格)
データ内の中国センシティブコンテンツ0件(著者が明示)
評価対応ペア152組 — 中核政治76組(天安門、台湾、新疆)、金融隣接76組(河南の銀行引き出し停止、キプロスのベイルイン)
採点4つのLLM審判(Grok、Gemini、GPT-5 Mini、Claude)が0から100の検閲スコアを付与
審判の検証人手採点96件とのピアソン相関0.948、平均絶対誤差6.08点
教師の検閲ギャップ+45.45点、政治ペアの87%で正、偶然に対して約7標準偏差
生徒の検閲ギャップベース+0.43点、蒸留後は全ペア統合で+3.94点
金融性能自己蒸留120BがFinanceReasoningで8kトークン予算基準83.61%

設計で最もよく作られた部分は対応ペアです。大躍進運動とホロドモールのように構造が同じで片方だけが中国関連である質問をペアにして、スコアの差を見ます。こうすると「このモデルはもともと政治的な質問に慎重だ」と「このモデルは中国関連の質問だけを回避する」を分離できます。絶対スコアだけを見ていたら出てこない区別です。LLM審判を人手採点96件でキャリブレーションしたのも、この種の評価ではよく省略される工程ですが、ここでは実施されており、相関0.948なら審判のスコアをそのまま使うのに十分です。

教師側の数字も押さえておく価値があります。45.45点のギャップにペアの87%で一貫して正なら、これは散発的な回避ではなく体系的な行動です。つまりこの実験は「教師にはそもそも検閲がなかった」というつまらない結論を排除したうえで始まっています。

能力は転移した — ところがどんな能力か

まず成功した側から見ます。金融推論では自己蒸留120BがFinanceReasoning 83.61%を記録したと報告されています。この数字自体はこの記事の主題ではありませんが、なぜ能力はうまく転移するのかは主題です。

理由は蒸留の目的関数にそのまま書かれています。蒸留は生徒の出力分布を教師の出力分布に合わせるよう直接最適化します。学習データがCAPM・DCF・オプション価格の問題で埋まっていれば、最適化されるのはまさにそれらの問題での分布です。能力がうまく移ってくるのではなく、移ってくるように損失関数に明示的に書かれているのです。

方法論にもこの点が反映されています。誤りが出る地点を探してヒントを入れ、その後の100トークンの区間でだけ逆KLをかけます。つまり教師の全体的なスタイルを吸収するのではなく、生徒が間違える地点の局所的な修正だけを持ってきます。実験変数もヒントの著者ひとつだけです。この設計は能力の転移には効率的ですが、同時に教師のほかの性向が移ってくる通路をきわめて狭くします。この点は次の節で戻ってきます。

検閲は転移しなかった — そしてなぜそれが驚きではないのか

生徒の検閲ギャップはベース+0.43、蒸留後+3.94でした。統計的にはベースラインです。結果は明確ですが、この結果が驚きかどうかは別の問題です。

蒸留データには中国センシティブコンテンツが0件入っていました。著者たちもこの点を限界として明示し、この実験が測ったのは「検閲の不在」であって「積極的な抑制の失敗」ではないと書いています。HNスレッドの指摘も同じ方向でした。200件にも満たない例でホロドモールに対するモデルの態度が変わるはずがないというコメントが上位にあり、金融ドメインが検閲行動と十分に絡んでいないので染み出さなかったのだ、というまとめも出ました。

これを一般化するとこうなります。蒸留で転移する行動は、蒸留データのサポートの内側で教師が実際に見せた行動だけです。 教師が天安門の質問に回避的な回答をするモデルであっても、学習データにそういう質問が一件もなければ、その回避は目標として提示されたことがありません。目標として提示されなかったものは損失に捕まらず、損失に捕まらないものは重みを動かしません。

反対方向にひっくり返すと、はるかに実務的な結論が出ます。安全アラインメントも同じ理由で転移しません。 よくアラインされた教師からコーディング能力を蒸留すればコーディング能力だけが来ます。生徒が教師と同じくらい安全だと仮定する根拠はありません。蒸留データに安全関連のプロンプトがなければ、生徒は自分のベースモデルの安全特性をそのまま保持するだけです。今回の実験の生徒スコアがベースと事実上同じだったという事実が、まさにこの命題を見せています — 蒸留は生徒を教師の側へ引き寄せたのではなく、特定の領域でだけ引き寄せました。

検閲は三か所に住む

「検閲は転移するのか」という問いがしばしば空回りする理由は、検閲が一か所にないからです。少なくとも三つの層に分けなければなりません。

  • 重みの外(サービス層)。アプリとウェブインターフェースの入出力フィルタ、システムプロンプト、サーバー側の遮断ルール。これは重みにないので、蒸留どころか重みを丸ごとダウンロードしても付いてきません。オープンウェイトモデルを自分でサービングしたときと公式アプリで訊いたときで答えが違うケースの大半はここから出ます。
  • 重みの中、行動として設置されたもの。事後学習で特定の主題に回避的な応答をするよう形成された性向です。HNのコメントの一つがうまく表現していましたが、大部分の検閲は知識の除去ではなく、知識が表に出ないようにする行動の設置です。実際に拒否行動が残差ストリームの線形方向として表現されるという研究系列があり、その方向を操作すれば拒否をオンオフできるという結果が報告されてきました。知識が消えていたのなら、方向ひとつを触って蘇ることはできません。
  • 事前学習データにそもそもなかったもの。これは行動ではなく本当の不在です。アラインメント操作でも復旧しません。

この区分をしたうえで見ると、今回の実験が何に触れたのかがはっきりします。生徒は二番目の層で自分のベースモデルの状態を保持し、教師の二番目の層は蒸留データがその領域を踏まなかったので目標として提示されたことがありません。一番目の層はそもそもAPIの応答にだけ影響するので論外です。三番目の層はこの実験が扱える対象ではありません。

反対方向の証拠 — サブリミナル学習と初期化の共有

ここまで見ると「蒸留データにないものは移ってこない」がきれいな規則のように見えます。ところが正反対の方向の研究結果があり、これを並べて置いてはじめて規則が完成します。

2025年7月に出たサブリミナル学習の論文は、意味的にまったく無関係なデータでも教師の性向が生徒に転移すると報告しました。数字の羅列やコードのように性向と何の関係もなさそうな出力で学習させても、そして性向への直接的な言及をフィルタで除去しても転移が起きました。決定的な条件はひとつでした — 教師と生徒が同じベースモデルから出発したときにだけ現れ、互いに異なるベースでは現れませんでした。

2026年に出た後続の研究はこれを定量化する方向へ進みました。安全性の低下が蒸留でどれだけ転移するかを測定した結果が報告され、ベースモデルの系列によって転移の様相が大きく異なりました。ある系列は特定の強度以上で急激に移る閾値の形でしたし、別の系列は連続的に、そしてより高い比率で転移しました。

この二つの筋を合わせると、規則はこう研ぎ澄まされます。

  • 蒸留データのサポートの内側で教師が見せた行動は転移する。明示的に最適化されるからだ。
  • サポートの外側の行動はおおむね転移しない。今回の実験が観測したのがこの場合だ。
  • ただし、教師と生徒が初期化を共有すると、サポートの外側の性向も漏れ出しうる。

三番目の項目は今回の実験では検証されていません。著者たちも、中国系列のベースに中国の教師を蒸留するシナリオは試していないと明示しました。ところが現実に派生モデルを作る人々のかなりの部分が、まさにその構成を使います — 同じ系列のオープンウェイトをベースにして、同じ系列の上位モデルを教師に使います。この実験が最も扱わなかった条件が、最もよくある条件です。

この実験ひとつが支える範囲、そして実務の規則

まとめると、この実験が支える命題は次の一文です。中国センシティブコンテンツがまったくない金融ドメインのデータで、互いに異なる系列のオープンウェイトモデルに、局所的な逆KL蒸留をかけたとき、教師の政治的検閲行動は生徒に現れなかった。

支えない命題もはっきりさせておきます。中国のモデルを蒸留すれば検閲は付いてこない、という一般命題を支えません。蒸留データに政治・歴史関連のプロンプトが混ざればどうなるのかは試していませんし、同じ系列のベースでの結果もありません。評価項目に香港やウクライナ侵攻が抜けているという指摘もスレッドにありましたし、152組という規模は探索的な実験に合うサイズであって結論を打ち付けるサイズではありません。何より、これは査読を経ていない単一の非公式な実験であり、再現されていません。著者たち自身も、この行動が表現空間のどこに住んでいるのかについては何の主張もしないと書いています。

それでも実務の規則はいくつか、この枠組みからすぐに出てきます。

  • 教師の安全属性を相続したと仮定しないでください。 よくアラインされたモデルから能力だけを蒸留したのなら、生徒の安全特性は依然としてベースのものです。別途評価しなければなりません。
  • 評価は対応ペアで設計してください。 絶対スコアはモデルの一般的な慎重さと特定の主題の回避を区別できません。構造を合わせたペアを作るのにかかるコストが、この実験で最も値打ちのある部分でした。
  • ベースと教師の系列が同じかどうかを確認してください。 サブリミナル学習の研究が言う危険条件がまさにそれです。同じ系列なら、蒸留データにない性向も検査対象に入れなければなりません。
  • 蒸留データのサポートを文書に残してください。 何が転移しうるのか、何が転移しえないのかは、その文書だけを見ても大半が予測できます。事後に異常な行動を調査するとき最初に見る資料でもあります。
  • オープンウェイトを自分でサービングするときと公式APIで呼ぶときの差を測ってください。 その差がサービス層のフィルタの大きさです。この値を知らないと「このモデルは検閲されている」という文の対象が重みなのかサービスなのか分かりません。

おわりに — 蒸留は教師をコピーせず、教師が言ったことをコピーする

蒸留を「小さいモデルに大きいモデルを入れる技術」と理解すると、今回の結果は意外に見えます。しかし蒸留がコピーするのはモデルではなく特定の入力たちに対する出力分布であり、そう見れば結果は設計の必然に近いです。金融の問題だけを訊いたので金融の回答だけがコピーされました。

なので次に「蒸留するとXは付いてきますか」という質問を受けたら、答える前に三つを訊き返せばよいです。教師がXを見せる入力が蒸留データに入っていますか。その入力はデータ分布でどれだけ大きな比重ですか。そして生徒は教師と同じベースから出発しましたか。三つの答えが揃えば、たいていは実験なしでも方向は予測できます。ただし方向を知ることは大きさを知ることではないので、その次はやはり測定です。

현재 단락 (1/49)

2026年7月30日、[Show HNに上がった実験](https://news.ycombinator.com/item?id=49113599)が147点を獲得しました。CTGTというチームが[研...

작성 글자: 0원문 글자: 5,664작성 단락: 0/49