オルニス 1.5:自己足場付けから自己改善へ

2026/08/19 23:48

オルニス 1.5:自己足場付けから自己改善へ

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

本記事は、独自の「自己足場(self-scaffolding)」フレームワークを通じてエンドツーエンドの自己改善を実現することを目的とした 3 つのスケール(397B MoE、35B MoE、9B dense)を備えた高度な基盤モデルシリーズ Ornith-1.5 を紹介する。先代である Ornith-1.0 とは異なり、このシステムは強化学習(GRPO)を用いてタスク生成、足場構築、およびソリューションのロールアウトを同時に最適化し、自動進化の持続的なサイクルを形成する。旗艦モデルである 397B モデルは最先端のオープンソースパフォーマンスを発揮し、複雑なコーディングベンチマークにおいて Claude Opus に相当するトップティアのプロプライエタリモデルと同等の性能を達成する一方で、小規模な 9B バリエーションは Qwen 3.6 や Gemma 4 といった大きな競合他社よりも優れたパフォーマンスを示す。特に notable なのは、35B MoE バリエーションがトークン当たりで活性化されるパラメータが 3B に限られるにもかかわらず、Meta の Muse などの dense モデルを大幅に上回っている点である。自己改善ループは、妥当性(validity)、フロンティア難易度(成功確率を約 0.2 に設定)、および新規性(冗長性の削減)の 3 つの報酬シグナルに基づいて新しいタスクを生成する。「報酬ハッキング」に抵抗できる報酬を活用することに重点を置くことで、このフレームワークは真のタスク対齐を保証し、Ornith-1.5 をオープンソース領域を再定義する継続的な自己発見のリーダーとして位置づける。

本文

Ornith-1.5:自己改善による基盤モデル構築への画期的な一歩

本日発表の Ornith-1.5 は、エンドツーエンドの自己改善を介した基盤モデル構築における重要な進展です。Ornith-1.0 で導入された「自己スケルトン化」フレームワークを発展させ、より完全な自己改善のループへと拡張しました。

  • 自己改善の仕組み: モデルが新たなタスクを提案し、タスク固有のスケルトンを生成し、強化学習用の解答展開を生み出すことで、絶えず学習経験を創出し、継続的に自己改良を遂げていきます。
  • 構成モデル規模:
    • 397B MoE (超大規模)
    • 35B MoE (中規模)
    • 9B dense (軽量版)

推論、エージェント(agentic)、コーディングを含む幅広いタスクにおいて高い汎用知能を実現することを目的として設計され、同等規模のオープンソースモデルの中で広範なベンチマークにおいて最先端のパフォーマンスを達成しました。

主要なベンチマークスコアと性能比較

Ornith-1.5-397B の主要スコア:

  • Terminal-Bench 2.1: 86.1
  • DeepSWE: 56.0

これらの結果により、Ornith-1.5-397B は以下の性能を発揮しました。

  • Claude Opus 4.8(85.0 および 59.0)と同レベルのパフォーマンスを実現。
  • 同規模の主要なオープンソースモデルを凌駕する結果を出しています:
    • GLM-5.2(82.7 / 46.2)
    • DeepSeek-V4-Flash-0731(82.7 / 54.4)

軽量版の優位性:

  • Ornith-1.5-9B (および量化的された Ornith-1.5-9B-Mobile) は、iPhone や Android デバイスへの容易なデプロイが可能です。
  • Gemma 4-31B や Qwen 3.6-35B のようなより大型のモデルに比べて、大幅な優位性を示します。

自己生成タスクによる包括的な自己改善ループ

Ornith-1.5 は、固定された人手によるキュレーションや手動で設計されたハルネス(評価器)への依存から解放され、モデル自体が絶えず新たな学習タスクを生成し、強化学習を通じてポリシー自体を改善します。

各トレーニングサイクルは以下の 3 つの段階 を通じて進行します。

  1. タスクの提案(Task Proposal)

    • システムは、過去の解決履歴や高レベルな指示に基づき、モデルが既に解決済みを超えた、徐々に難度の高いタスクを提案します。
    • これにより能力のギャップを浮き彫りにし、トレーニングのフロンティア(境界)を絶えず押し進めます。
  2. スケルトンの生成(Scaffold Generation)

    • モデルは各タスクに対し、問題に取り組みに使用される指示、ツール、分解戦略、およびオーケストレーションを含む、タスク固有のスケルトンを生成・改善します。
  3. 解答展開(Solution Rollout)

    • ポリシーがタスクとスケルトンに対して条件付けられ、解答の展開を生み出します。
    • 展開から得られる報酬は全ての段階に伝播するため、システムは「より良い解答」「より有用なトレーニングタスク」「より効果的なスケルトン」の生成を学習します。

このプロセスが反復されることで、閉じた自己改善ループが形成されます:

  • 強力なポリシーがより困難で情報豊かなタスクの生成を可能にします。
  • 進化するスケルトンモデルが発見するモデル能力を引き出す方法を向上させます。
  • 高品質な展開が提供する学習シグナルが次第に効果を高めます。

これにより、Ornith-1.5 は自らのカリキュラムを絶えず拡張し、推論・コーディング・エージェントタスクにおいて持続的な能力の向上を推進します。


タスク報酬(Task Reward)の定義

「質問 → スケルトン → 展開」というセットアップにおいて、タスク報酬 ( R_{\text{task}} ) は以下の 3 つのシグナルに基づいて定義されます。

[ R_{\text{task}} = \underbrace{V(q,s)}{\text{妥当性}} \times \underbrace{D!\left(q,s,{\tau_i}\right)}{\text{フロンティア難度}} \times \underbrace{N(q)}_{\text{新規性}}. ]

各シグナルの詳細

  • ( V )(妥当性と検証可能性):

    • 生成されたタスクとスケルトンが、妥当かつ検証可能な学習環境を形成しているかを測定します。
    • スケルトンの正常動作、高自信度の解答の通過、評価結果との整合性などをチェックし、決定されます。
    • 重要: 妥当性が 0 である場合(( V(q,s)=0 ))、報酬は自動的に 0 となり、単に難度が高くても変なタスクには与えられません。
  • ( D )(フロンティア難度):

    • タスクがモデルの現在の能力フロンティアの付近にあるかを測定します。
    • 経験的達成率 ( p ) が目標とするフロンティ ( p^* ) (0.2) に近いタスクに対して高報酬を与えます。
    • モデルが向上するにつれ、より困難な問題へと導かれるよう設計されています。

[ D(q,s,{\tau_i}) = \exp!\left(-\frac{(p-p^*)^2}{2\sigma^2}\right) ]

  • ( N )(新規性と多様性):
    • 以前に生成されたタスクとの相対的な新規性を測定します。
    • 同じタスクの小さなバリエーションを繰り返すことを防ぎ、冗長性を減らします。
    • 目的は「奇抜なタスク」を作ることではなく、「多様な学習経験」を提供することです。

[ N(q) = 1 - \max_{q_j \in \mathcal{B}} \operatorname{sim}(q,q_j) ]

この乗算形式により、提案側は**「妥当・検証可能」「適切な難度」「十分な新規性」**の 3 条件を同時に満たすタスクを生成することを促されます。


ハルネスおよび展開報酬

ハルネス ( h ) は、タスクと整合しており、解答の質に忠実で、報酬ハッキングに対して強靭な評価環境を提供します。

[ R_{\text{harness}} = \underbrace{C(q,h)}{\text{タスクとの整合性}} \times \underbrace{F!\left(h,{\tau_i}\right)}{\text{報酬の忠実度}} \times \underbrace{H(h)}_{\text{ハッキングへの抵抗力}}. ]

  • ( C ): ハルネスがタスク仕様を忠実に反映しているか。
  • ( F ): 報酬が候補解答の真の質を追跡しているか。
  • ( H ): 評価機の失敗やショートカット、報酬ハッキングへの抵抗力。

展開最適化:

  • 各展開 ( \tau_i ) は生成されたハルネスによって直接スコアリングされます: [ R_{\text{rollout}}(\tau_i) = h(q,\tau_i) ]
  • 質問生成、ハルネス生成、解答展開はそれぞれ GRPO(Group Relative Policy Optimization)で最適化され、3 つの段階が同一の自己改善ループ内で同時に改善されます。

モデルベンチマークサマリー

スケールパフォーマンスハイライト
Ornith-1.5-397BTerminal-Bench 2.1 で 86.1、DeepSWE で 56.0。Claude Opus 4.8 と同水準で、GLM-5.2 や DeepSeek-V4 等主要なオープンソースモデルを上回ります。
Ornith-1.5-35Bコーディングおよびエージェントベンチマークにおいて Qwen 3.6-35B に著しく優れています。
有効パラメータが僅か 30 億(3B)にもかかわらず、Gemma 4-31B よりもエージェントコーディング性能で上回ります (68.5 vs 43.4)。
Ornith-1.5-9Bエッジデバイス向け版。
Terminal-Bench 2.1 で 47.0、SWE-Bench Verified で 70.6 を達成。パラメータ数 9B のモデルでありながら、はるかに大きなモデルと同等かそれ以上のパフォーマンスを発揮します。

詳細な比較表については技術報告をご覧ください。

同じ日のほかのニュース

一覧に戻る →

2026/08/20 2:32

OpenRouter が Stripe に参画

## Japanese Translation: OpenRouter は、コアアイデンティティを維持しつつミッションとグローバルなスケーリングを加速させるため、Stripe と戦略的提携を正式に発表しました。このアライアンスは、質、スケーラビリティ、そして AGI 後の経済におけるビルダーの支援にコミットした 2 つのデベロッパー向けのインフラストラクチャプラットフォームを結びつけるものです。Stripe の大規模な顧客ネットワーク、ビジネス成長データ、および不正防止専門知識との統合により、市場慣性による影響で単一のモデルがデフォルトとなるのを防ぎながら OpenRouter がスケールするのを支援します。OpenRouter は現在、400 以上のモデルを通じて 1,000 万人以上のユーザーをサービスしており、2023 年初頭の設立以来、推論ボリュームは少なくとも 10 倍の年間増加を示しています。毎日大量のトークンを処理しています。取引は来週中に完了見込みであり、OpenRouter の製品、ミッション、名称、ロードマップ、ユーザー統合、またはルーティングロジックを変更することなく、判断は常にユーザーにとって最善のものに基づいて行われます。この提携は多様な AI エコシステムの育成を目指し、両社は異なる運営文化とスタートアップの機動性を維持することを可能にします。OpenRouter はグローバルな成長に伴い効率的な 90 名の体制を維持する予定であり、好奇心、厳格さ、主体性、透明性を備えた新しいチームメンバーを招致しています。

2026/08/20 3:33

Go 1.27

## Japanese Translation: Go チームはバイナリアーカイブと公式インストーラーを提供するとともに、言語仕様とツールングにおいて重要な進歩をもたらすバージョン 1.27 をリリースしました。主要な言語更新には、ジェネリックメソッド(例:`math/rand/v2.Rand`)、ネスト化済みまたは埋め込まれた構造体に対する直接フィールド選択、および汎用化された関数型推論が含まれます。ツールングの向上としては、`go fix` における 4 つの新しいモダナイザー(`atomictypes`、`embedlit`、`slicesbackward`、`unsafefuncs`)、`go doc` でのパッケージ@バージョン照会への対応、ならびに `go.mod` において統合されたブロックによる依存関係管理の簡素化が挙げられます。パフォーマンス向上は、サイズ特化型メモリアロケーションの導入により実現されており、これによって小規模オブジェクト(<80B)のコストを最大 30% 削減し、アロケーション負荷の高いプログラムの全体的なパフォーマンス向上を約 1% に貢献しています。セキュリティ面では、量子耐性のある ML-DSA 署名の統合と標準ライブラリ内蔵の UUID サポートによる強化が図られました。その他のハイライトとしては、実験的な SIMD サポート、安定性を高めるための一般利用可能な `goroutineleak` プロファイラー、`encoding/json/v2` の厳格なデフォルト設定、ならびにテスト用として新しいユーティリティである `NewTestServer` などがあります。

2026/08/20 3:36

Unsloth デイナミック 3.0 GGUF

## Japanese Translation: Unsloth Dynamic v3.0 のリリースは、同じディスクサイズで比較した場合の Qwen3.8-27B モデルに対して他社よりも優れた精度を実現しており、これが最大の成果となっています。このアップデートは前バージョンを踏襲し、クオンタイゼーション手法の改良と、小型ファイルサイズにおける特定モジュールの削除による容量削減を行いました。層選択の改善およびポストトレーニングクオンタイゼーション(PTQ)を通じて品質は維持され、過学習リスクを回避するために QAT/QAD は全く使用しません。このアプローチは、エージェントコーディングや多言語性能などの多様なタスクに最適化された高品質な imatrix カリブレーションデータセットを用いています。新しいベンチマーク結果では、Unsloth クォンツが最大 10% の高いトップ 1% 精度を達成することが示されており、これは標準的な Wikipedia データではなく、専門データセットから保持した例を利用する Divergence-300@32 および KL ダイバージェンスというメトリクスによって確認されました。早期プレビューでの成功の後に、5 日間で 510 万回のダウンロードが記録されました。ユーザーは今や、6.2GB の UD-IQ1_S バージョンなど、従来のモデルの最大 89% のサイズ削減が可能でありながら依然として高い精度を保持する高性能モデルを利用できるようになりました。業界全体の効率性は、小型ファイルから MTP モジュールを削除することで約 500MB のディスクスペースを節約し、Llama 4 および Wolfram Ravenwolf の実装における重大なバグも同時に修正されたことで向上しています。imatrix ファイルは直ちにコミュニティへのテスト、評価、ファインチューニングやバリエーションの作成に利用可能となっています。

オルニス 1.5:自己足場付けから自己改善へ | そっか~ニュース