1.5時間でのトレーニングで少数なトランスフォーマーモデルを構築し、多くのLLMを上回る性能を示しました

2026/09/01 18:52

1.5時間でのトレーニングで少数なトランスフォーマーモデルを構築し、多くのLLMを上回る性能を示しました

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

このプロジェクトでは、RTX 5090 を用いて从头(ゼロ)から 1.5 時間で訓練された軽量なオープンソーストランスフォーマーを導入します。本モデルは ARC リージニングベンチマークにおいてより大きな閉じたモデルを上回る性能を発揮し、大幅に少ないリソースとコスト(総額約 67 セントの訓練+推論)で動作します。その最も重要な成就是、最小限のデータと計算資源により強い汎用知的能力を達成したことを実証しました:合成データや人間バイアスを含まずに 1,000 のパズルのみを用いた場合、ARC-1(公開評価セット)では約 44% の精度を達成し、ラベルが隠されたテスト・タイムトレーニング条件下では ARC-2 で約 7% の精度を達成します。SwiGLU アクティベーションや 3D RoPE ポジショナルエンベディングなどのアーキテクチャ革新の活用、LayerNorm を RMSNorm に置換する、そして supervised objective(出力トークンのみ)を採用することで、モデルは従来の Muon で見られた問題を解決し、新規の Normuon オプティマイザを用いて安定した収束を達成しました。ARC-AGI シリーズの第 3 作として、本研究成果は大規模データセットとポストトレーニングトリックに過度に依存する現状の趨勢に挑戦します。サンプリング効率を重要なボトルネックとして位置づけ、ベース LLM が合成データや人間の事前知識による広範なポストトレーニングなしでは ARC で著しく低い性能を示すことに言及しており、 leaderboard スコアがこれらの依存関係を無視した場合は誤導的になる可能性を示しています。本モデルは研究者に対し高価な GPU の代替としてコスト効率的な選択肢を提供し、効率性が推論能力の低下をもたらさないことを証明します。今後の展望として、開発者は 65% のスコアへのさらなる向上に向け、コミュニティからの貢献を呼びかけています。これは RoPE を PoPE に置換したりデータ拡張を除去するなどのアップデートを通じて実現可能かもしれません。アブレーション研究では、3D RoPE やタスクごとのエンベディングを除去すると性能が約 25% に低下し、訓練データを ARC-1+ConceptARC に限定するとスコアが約 40% で維持されることを示しています。データスケーリングは、重み付けの重複を除くよう注意深くフィルタリングした上で、ARC-2 の非重複タスクを追加し、レイヤ数を 4 から 8 に増やすことで行われました。このイニシアチブは、小規模モデルが重要な問題解決タスクにおいて巨人と競合できるような持続可能な AI 開発への大きな転換を表しています。

本文

ARC-AGI 研究報告:高効率な Transformer モデルの構築

はじめに

NVIDIA GeForce RTX 5090 を使用し、1.5 時間以内で Small Transformer のゼロから(From Scratch)訓練を完了しました。

  • 性能: 既存大規模言語モデル(LLM;TRM や HRM など)と同等、あるいはそれ以上のスコアを達成しています。
  • 成果: ARC-2 データセットで 7% のスコア(正確には 44% 台の精度)を記録しました。
  • コンセプト: 「Faster(高速)」「better(高性能)」「cheaper(低コスト)」かつオープンソースの実現です。

本研究は ARC-AGI シリーズの第 3 報であり、Lucas Beyer や Jeremy Howard, Rohan Anil といったトップリサーチャーからも注目を集めています。

研究の目的

深層学習における**「サンプリング効率(Sample Efficiency)」の解決**に取り組んでいます:

  1. Transformer のサンプリング効率的な限界を探求する。
  2. コスト削減によるイテレーションの迅速化を達成する。

テクニカル詳細

アプローチ概要

前回の実験と比較して、以下のアップグレードを加えています。

  • トークン化: 各入力・出力ペアをトークンシーケンスに変換し、Small Transformer を用いてオートリグレッシブに訓練します。(テスト時にはテストラベルを隠蔽した状態でのゼロから訓練を実施)。
  • クロスタスク学習: 各パズルに対して学習可能な独立した**加法埋め込み(Additive Embedding)**を割り当てます。位置情報は 3D RoPE で学習されます。
  • オーガメンテーション: シーケンスを色と二面角(dihedral angle)の置換により拡張し、推論時に同様の拡張を行い逆変換を適用します(AAIVR: Augment-and-Invert Variants)。

前回のバージョンとの主な変更点

スコア向上とコスト削減のための主要な変更は以下の通りです。

パフォーマンス向上要因

  • 現代アーキテクチャ:
    SwiGLU
    (GELU の代替)、
    RMSNorm
    (LayerNorm の代替)の採用。
  • データ多様性: より効果的なデータシャッフルの実装。
  • スケーリング: レイヤー数を 4 つから 8 つへ拡大。

コスト削減要因

  • オーガメンテーションの削減: サンプル効率が大幅に向上。
  • 最適化手法の変更:
    AdamW
    から
    Normuon
    (ノルムオン)へ変更。
  • アテンション機構: Flex Attention カーネルを備えた Varlen Flash Attention の採用。

最大の仕様変更とデータ拡張

  • 教師あり学習への回帰: 入力トークンを訓練対象から除外し、損失関数は出力トークンのみにします(完全な監督学習型へ)。これによりスコアがわずかに向上しました(40% → 44%)。
  • データセットの拡張: ARC-2 の非重なりタスクを追加。ただし、データリーク防止のため慎重にフィルタリング済みです。

興味深い振る舞い

  • 入力トークンを訓練しないため、アプローチは現在「監督学習型」です。テスト損失が低下したにもかかわらずスコアが良い点、およびばらつきが少ない点が特徴的です。
  • Normuon の採用: 移行前は学習率を下げても「迷走(loiter)」する傾向がありましたが、Normuon に切り替えたことで収束問題が解消されました。

減法実験 (Ablations)

パフォーマンスへの最大の寄与は、**良い表現(3D RoPE + タスク別埋め込み)**であることが判明しました。

  • 3D RoPE またはタスク別埋め込みを削除: スコアが急激に低下し、両方で 25% で飽和します。
  • 入力データを訓練: スコアはわずかに低下(〜39%)。
  • トレーニングセットの制限 (ARC-1 単体): 約 40% を維持します。
  • 3D RoPE を 1D RoPE に変更: スコアが 〜24% に低下。
  • タスク別埋め込みの削除: スコアが 〜24% に低下。

CompressARC スタイルの圧縮実験:

  • 非監督学習時:パフォーマンスは〜18% に低下。
  • 監督学習型時:〜15%

貢献の仕方

コードはオープンソースです。修正してスコアを上げたりコストを削減したり自由にお願いいたします。(トレーニングデータを増やすのは禁止)。

目標

65% を達成してみてください。

改善の可能性

  • RoPE の再考:
    PoPE
    (Positional Prompt Embeddings)が同等かそれ以上の性能を示す可能性があります。新しい位置埋め込みを発明することもあり得ます。
  • アーキテクチャの近代化: さらに現代的な構造へ変更可能です。
  • コスト削減: 手作りの GPU コードでコストをさらに 10 倍削減できる可能性があります。
  • オーガメンテーションの除去: データ拡張を除外することでトレーニングコストを下げることが期待されます。

注記: トランスフォーマーだけで 45% を達成できるとは思っておらず、新しいアイデアが必要だと思いました。しかし、低いコストや FLOPs で達成できたことには驚きです。減法実験の結果、拡張子や合成データなしでも驚くほど多くのパフォーマンスが維持されていることがわかりました。


アペンドックス:著名リサーチャーによる批判と回答

多くの経験ある研究者からの議論を整理します。

1. テストセットでの訓練は不正/「テストデータを学習」

  • 批判: 評価パズルの訓練は Cheating です。
  • 回答: 誤りです。「テストデータを学習」はラベルを覚えることを指しますが、ここでは隠蔽したままです。ARC は Meta-learning ベンチマークであり、評価パズルから学ぶのが目的です。Test Time Training (TTT) は Meta-learning 分野で推奨されています。

2. 評価パズルの入力を学習させるのはリーク

  • 批判: 入力データを訓練すると情報がリークします。
  • 回答: 誤りです。「誘導的推論(Transductive Reasoning)」であり、継続学習の文脈では正当です。本質的に異なるアプローチは単一の前方関数の重みを直接 Meta-learn することです。(最新結果では入力を訓練する必要がなくなりましたが)。

3. テストポリシー違反

  • 批判: テストポリシーに反しています。
  • 回答: 誤りです。ポリシーは「出題者がテスト内容を知らなければならない」ことを指し、AI システム自体には制限がありません。ARC コミュニティでは常に TTT が許可されています。

4. 訓練コストの除外

  • 批判: 訓練コストを含んでいません。
  • 回答: 誤りです。全ライフサイクル(初期化からモデル訓練 + 推論実行)のコストを示しています。RTX 5090 を 2 時間使用して約 67 セント

5. テストタイムトレーニングの実現可能性

  • 批判: 同時訓練は非現実的です。
  • 回答: LLM がインターネット全体を学習できていないのに「非現実的」と言えないのと同様です。「コスト/タスク」での比較では、同時学習モデルに不利になります。

その他の批判と反証

  • ARC-AGI 解決=AGI 達成ではない: 主張していません。
  • 妥当な批判: 合成データの禁止(トップスコアが依存)、オフライン学習の排除(公平性の確保)については同意します。
  • 他のアプローチの誤り:
    • TRM/HRM は再帰性を謳いますがアブレーションが少ない点に問題があります。
    • 7M モデルと宣伝されていますが、実際には O(100M+) の埋め込み重みが訓練されており誤解を招きます。
    • LLM のスコア上昇は主にトレーニング後のプロセス(合成データ量)によるものです。

LLM から得られた教訓

LLM は現在 ARC-AGI v1/v2 で飽和しています。そこから以下のことが推測できます:

  • ARC-AGI は LLM 以前: 当初は事前トレーニングで推論能力が伴いませんでした。
  • O1 の勝利: 75% を達成し、十分なデータがあれば何でも学習可能であることを示唆。
  • ARC-2 登場時のリセット: 高性能な思考系 LLM もリセットされ、モデルは ARC パズルそのものを学習していることが判明。

結論:

  • ARC-2 スコアはトレーニング後に駆動されます(合成データ量に依存)。
  • ラボによるベンチマックスングが行われている可能性があります。
  • LLM はサンプリング効率において全く優れていません

完全な変更リスト

学習ダイナミクス

  • Optimizer:
    AdamW-only
    から
    NorMuon
    + 補助的
    AdamW
    に変更。
  • LR スケジュール:
    Warmup+Cosine
    から
    WSD
    (Warmup %, Hold, Linear Decay to Floor)に変更。
  • LayerNorm:
    RMSNorm
    に置換。
  • FFN:
    Linear->GELU->Linear
    から
    SwiGLU
    様式へ変更。
  • Weight Decay: グループ別減衰の明示的実装(Attention Weights, Token Embeddings などに個別設定)。
  • トレーニング目的:
    outputs["loss"]
    (非監督風)から
    outputs["output_loss"]
    (監督風)へ変更。

データセット構築

  • ソース: ARC-1, ARC-2, ConceptARC、クロスデータセットタスクを使用。
  • カラー拡張: グローバル置換から例ごとのアンプルアップル元組へ変更。
  • 重複排除: ハッシングによるユニークサンプル多様性の向上。

速度向上(学習ダイナミクス変更なし)

  • バッチ構造: Padded [B,S] から
    cu_seqlens
    を持つパケットトークンストリームへ変更。
  • アテンションパス: Padded SDMA マスキングから
    Varlen Flash Attention
    サポートへ変更。

その他

  • 訓練スプリット: Build-time で
    ("train", "test")
    から
    ("train",)
    へ変更。
  • Scheduler Stepping: フラクショナルエポジ進捗に変更。

同じ日のほかのニュース

一覧に戻る →

2026/09/02 2:53

Claude Fable 5.1 と Claude Mythos 5.1

## Japanese Translation: Anthropic は、一般利用のための Claude Fable 5.1 と、サイバーセキュリティおよび生命科学分野の信頼できる政府プログラムを通じた制限されたアクセス用の Claude Mythos 5.1 を公式にリリースしました。特に、これらは異なる安全対策レベルを持つ同一の基盤モデルの変種です。主要なアップデートとして、コストが削減されおり、典型的なワークロードでは価格低下率が 25%、複雑な自動化タスクでは 45% まで低下すると推定されています(キャッシュ要件の減少により、100 万トークンあたり 0.25 ドルへ)。エンタープライズ顧客は、秋以降に「Frontier Safeguards」を採用する予定で、顧客管理下のインフラストラクチャ上でのデータ保持ゼロを提供します。Mythos 5.1 は、分子結合体設計のヒットレートが 10〜15% からほぼ 50% に向上し、カスタムキャッシュにより深層学習のトレーニングを最大 2.5 倍加速させるなど、安全性と能力の向上を示しています。また、エクスプロイトコードの生成を防ぎつつ高忠実度の研究を支援するため、米国政府のプロトコルに厳格に準拠しています。8 月 2 日(2026 年)以降にリリースされる次期モデルには、EU AI 法への適合のために出力ウォーターマークの導入が義務付けられ、規制当局や企業向けのプライベートプレビュー検出 API が用意されます。

2026/09/02 3:35

Ed ゼイトロンの AI 懐疑論者の予言はどれほど正確だったのか?

## 日本語翻訳: 本テキストの核心的なメッセージは、技術懐疑主義者である Ed Zitron の産業崩壊が迫っているという予言が事実に反し、データによって裏付けられていない点にあります。彼の予測は、Meta、Alphabet、Microsoft といった大手企業が「死んでいる」と宣言し、生成 AI がピークに達したと主張していますが、これらは 2023 年から 2026 年の計画期間にかけて業界全体で見られた堅調な財務成長により直接反証されています。例えば、OpenAI は収益目標を上回り、CoreWeave は資金調達後に IPO 価格を倍額まで引き上げました。また、Cursor は 600 億ドルの評価額での exit を実現しており、これらは Zitron の敗北または低評価という悲惨な警告を直接的に否定しています。さらに具体的な指標に関するエラーも彼の信用力を損なっています:Meta の利用者数は不正確な Similarweb データを用いて誤算され、Gemini は 5 億ユーザーという目標を超えて 7.5 億ユーザーに達し、Google Search の問題は単にリーダーシップのせいであると単純化されており、エンジニア側はこれに反対しています。Zitron の経済分析は「絶対的なゴミ」と批判され、反駁されない点で批評家を圧倒するために「ギッシュ・ガロップ(gish gallop)」という戦術を用いる傾向があり、不正確なデータ源に依存しています。加えて、彼の文章スタイルは怒りと悪口を多用し、人々の心を改心させるのではなくエンゲージメントを高めることを目的としており、過去の過ちを認めなかった Paul Ehrlich などの破綻した未来学者と同じスタンスです。したがって、投資家や執行役員は、彼の自信に満ちた警告を企業の健全さを示す有効な指標ではなく、市場は彼のリズミカルなノイズにもかかわらず継続的に革新しているため、信頼性の低い distraction( distractions )として扱うべきです。

2026/09/02 7:06

Show HN: Weedout – YouTube のAI 評価動画を表示しないSafari拡張機能

## Japanese Translation: 新しい Mac 用アプリケーションは、フィード、検索結果、関連動画、および Shorts シェルフに表示される「AI で作成された」とラベル付けされた YouTube 動画を自動的にフィルタリングするプライバシーを最優先としたソリューションを提供します。このツールは完全にローカルで動作し、ユーザーアカウントやデータ収集を必要とせず、視聴習慣が秘密に保たれます。検出方法は YouTube の公式に提示されたバッジのみを使用するため、プラットフォーム自身によって明示的にマークされていない動画に対する誤った非難は回避され、そのコンテンツのみを隠します。パフォーマンステストの結果、アプリケーションはリアルタイムのストリームを約半秒で処理し、キャッシュ済みコンテンツは瞬時に処理します。現在、このツールは一般的な低品質な素材ではなく AI 生成物の公開情報のみに焦点を当てており、Shorts の自動スキップ機能や、動画がビューから削除される前に特定の動画を検証できるダークモードなどの有用な機能を備えています。将来のアップデートではロジックの拡張が行われる可能性がありますが、現在のバージョンは厳密に公式ラベルに従います。質問、バグレポート、あるいは検出漏れについては、masteranza@gmail.com 宛てにメールでサポートが可能です(偽陰性レポートには動画のリンクが必要です)。このアプローチにより、視聴者は手動操作や侵襲的な広告なしに直ちに人間が作成したコンテンツにアクセスでき、画面に表示される AI 生成物の雑多なものを単に我慢する対抗としての効果的な代替手段を提供します。

1.5時間でのトレーニングで少数なトランスフォーマーモデルを構築し、多くのLLMを上回る性能を示しました | そっか~ニュース