
2026/08/10 23:20
Claude と GPT の知識カッオフと事前学習のタイムラインを探る
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
このテキストは、大規模 AI モデルがトレーニングの一貫性不足により、自身の起源やタイムラインを誤って表現することが多いことを明らかにしています。専門的な分析プローブを用いた研究により、Anthropic の Sonnet 5 が OpenAI の GPT-4 と自らを同定する頻度が頻繁であり、Claude モデルは OpenAI のクイーク(特徴)を模倣する割合が著しく高いこと(68% 対 8%)が発見されました。また、最新の API リクエストへの適切なグラウンディングの欠如により、これらのシステムは現在の日付や時的情報を不正確に記述することがあります。この分析は、「圧縮不可能な知識プローブ」を活用してパラメータ数を推定し、「データ混合インференス」を通じてトークン分解を検討する手法に基づいており、GPT-5 や Opus といったモデルの異なるトレーニング経路を示唆しています。具体的には、GPT-5.6 の別個のチェックポイントが 2026 年 2 月下旬に完了することが予測されており、一方 Opus 5 は 2026 年 1 月のより早期のカットオフを持つモデルと同等のリコール能力を有しながらも、2026 年 5 月の信頼できる知識カットオフを維持します。さらに本研究は、GPT-5.4 が公表されたカットオフとよく整合している点を指摘しており、これは近未来イベントの推測精度が高く、直近イベントのサンプリングが少ないことが要因であると考えられています。これらの発見は、現代のモデル開発の複雑性を強調しており、一般的に汎用データでの事前トレーニングに続き、能力向上とアシスタントペルソナの採用のための後続トレーニングが行われることを示しています。究極的には、この研究は公衆の認識と実際のモデルアーキテクチャの間に重大な不一致が存在することを浮き彫りにしており、現在のバージョン戦略が内部の知識境界線やアイデンティティトレーニングを十分に反映していないことを示唆しています。
本文
フロントリ어나モデル:隠された事実をプローブする技術
大規模言語モデルについて、公開されていない詳細な事実を解明するための手法(プローブ)が存在します。これらの手法を用いれば、モデルのパラメータ数推定やトレーニングデータセットの分析、さらには開発タイムラインの特定が可能です。ただし、全ての情報はあくまで見積もりであり、完全な実測データがないため誤解が含まれる可能性があります。
🏗️ モデルトレーニングの 3 つの主要な段階
現在の大規模言語モデルトレーニングは、以下の 3 つの工程に収斂しています。最もリソースとコストがかかるのは**事前トレーニング(Pre-training)**です。
-
事前トレーニング (Pre-training)
- インターネットからスクレイピングした広範な汎用データを収集。
- 巨大な自動補完モデルに対して学習を実行。
- これらのチェックポイント(例:
)が、後にリリースされる主要バージョン(GPT-4→GPT-5 など)の基礎となります。claude-super-secret-2026-11-01-base.cpkt
-
能力向上トレーニング
- ドメイン固有かつ「教科書品質」の高精度データを投入。
- 長文理解など特定の基盤機能を拡張し、モデルを改善。
- この段階での進歩は、しばしばリリースされるマイナーバージョンとして現れます。
-
トレーニング後処理 (Post-training) / アシスタント化
- 基盤モデルを「アシスタント」としての人格へと転換。
- 推論能力、ツール呼び出し機能などを精査・最適化。
- ラボによっては、事前トレーニングが未完の状態から、トレーニング後技術を適用したモデルを早期にリリースすることもあります。
📅 事前トレーニングチェックポイントの日付推定法
ウィキペディアの日常事象データセット(例:2025 年のアメリカ発事件)を用いた8 択選択クイズの実行結果から、誤答率のタイムラインを分析します。これにより、トレーニングデータに含まれる情報が失われた時期(カットオフ)を見積もれます。
📊 知識カットオフの特徴
- GPT-5.4 の場合:
- 公式公表のカットオフ日と一致しています。
- モデルが近未来のイベントを推測できない、または近年のイベントがサンプリング不足だったという人工的要因が見られます。
💡 発見されたパターン(憶測)
全モデルデータを比較した結果、以下の見解に至りました。
- Anthropic Opus 4.7 以降:
- すべて、2025 年 12 月下旬をカットオフとする同じトレーニングランニングから派生している可能性が高いです。
- 類似の知識カットオフ(緑色)を共有しているため。
- OpenAI GPT-5.6 ファミリー:
- GPT-5.5 とは別のチェックポイント(2026 年 2 月下旬完了)から来ているようです。
- 以前のモデルとは異なる知識カットオフを持っています。
- Luna:
- 未来予知のように見えるのは、推論努力が低く誤答率が高いという人工的な側面のためです。
- Opus 5:
- カットオフ日(2026 年 5 月)と矛盾する挙動を示します。
- 推論努力ではなく、コードパッケージのバージョンに関する制限が原因である可能性が高いです。
🔍 「今日は何日か?」という問いかけによる自己認識分析
モデルに「今日の日付」を質問すると、その回答は事実的な知識と一致するか、あるいは過去に住んでいると勘違いしているかが明確になります。 ※注:OpenAI の API はリクエストに実際の日付を注入するため、この分析から除外されています。
垂直な帯のパターン発見
グラフ上の垂直な線は、「事前トレーニングコーパス(X)」が一定で、「トレーニング後の行動(Y)」が増加していることを示しています。これは、古いデータセットへのバイアスを反映しています。
- GPT-4.1 ナノ → ミニ → スタンダード
- Opus 4.7 → Sonnet 5 → Fable/Opus 5
🧠 アイデンティティプローブによるトレーニングミックスの推論
モデルが「私は〇〇です」と主張する頻度は、そのモデルがどのようなデータセットで学習したかを示唆します。 「あなたはどのモデルですか?」という問いに対する回答分布を分析することで以下が見て取れます。
主な視覚効果と発見
- 垂直な帯(過去のモデルの痕跡):
- ラボが、ユーザーからの過去の実績データを再度トレーニングしていることが示唆されます。
- OpenAI: GPT-4 → GPT-4o → GPT-4.1 → GPT-5 → ChatGPT という順で自己認識が移行しています。
- Anthropic: 3.5 Sonnet から 4.5 Sonnet へ移行。
- これは、ChatGPT.comやClaude.aiでのユーザーチャットセッションがトレーニングデータ(直接的またはウェブ汚染を通じて)として使用されていることを意味します。
不自然な混同現象
- OpenAI モデル: Anthropic のモデルと自分を同一視することはまずありません(Tesla Model S などの例外を除く)。
- Anthropic Sonnet 5:
- OpenAI の GPT-4 と自分自身を同一視することがあります。
- 意図的な蒸留ではなく、古い ChatGPT チャットデータが Anthropic のトレーニングミックスに含まれている可能性があります。
- また、Sonnet 3.5 の系譜を通じて誤認が世代を超えて伝播している(Sonnet 5 が Sonnet 3.5 データで学習)可能性もあります。
追試実験の結果
- Claude: OpenAI モデル特有の癖(身元回答など)を、68% の確率で再現します。
- OpenAI モデル: Claude の特性は再現せず、**8%**に留まります。
🔗 関連リソースと続き
さらに詳細なデータを探索したい場合は、以下のリンクをご参照ください。
続きの記事もあるかもしれません。