
2026/07/22 2:17
ラグーナ・S 2.1
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Laguna S 2.1 は、複雑で長時間にわたるコーディングタスクのために特別に設計されたソフトウェアエンジニアリング AI の重要な飛躍であり、100 万 トークンの超大規模コンテキストウィンドウを備えています。409,000 以上の環境にわたる専門データ(ターミナルおよびソフトウェアエンジニアリングドメインを含む)で訓練され、FP8 精度の RL を採用するこのエージェント型モデルは、Terminal-Bench 2.1(思考モードにおいて 70.2%、60.4% の対比)、DeepSWE(40.4% vs 16.5%)などのベンチマークで優れたパフォーマンスを発揮し、その重みクラス内で最も能力に富むエージェント型コーディングモデルとしての地位を固めています。
このモデルには、「off」と「max」の 2 つのモードを持つ独自の「thinking(思考)」機能があり、「max」モードでは AI がコード生成前に内部独白を通じて斟酌を行うことで、パフォーマンスが大幅に向上します。このアーキテクチャにより、1 つの 50 分間のセッションでブラウザエンジンを一から構築したり、約 1 時間にわたる計算時間の間に Erdős問題 #397 の証明を独自に導出したりという驚くべき成果が達成されました。効率は、速度向上とメモリアロケーション削減を実現する高度なエージェントハネスを通じて最適化されています。
4,096 台の NVIDIA H200 GPU で事前学習された Laguna S 2.1 は、すぐに Hugging Face でオープンウェイトを提供され、Baseten や OpenRouter などのプラットフォーム経由でもホストアクセスが利用可能であり、柔軟なコンテキストウィンドウを支援しています。強力ではあるものの、現時点での制限点については留意が必要です。例えば、サードパーティ製ツールスキーマ(Hermes Agent など)との偶発的な互換性問題、配列引数に対する無効な JSON の生成、特定の複雑な数学問題に対する「過剰思考」の傾向が含まれます。全体として、Laguna S 2.1 は即座に導入可能な推論駆動型コーディングアシスタントにおいて新たな基準を設定しています。
本文
Laguna S 2.1 の公開:長期タスクと効果的な推論への新たな一歩
本日、より長期にわたるタスクへの対応と効果的な推論能力を追求するモデル開発において大きな一歩となる**「Laguna S 2.1」**の公開をお知らせいたします。
モデル概要
- アーキテクチャ: ミクスト・オブ・エキスパート(MoE)
- 総パラメータ数: 1180 億
- 活性化パラメータ (A): トークンあたり 80 億
- コンテキストウィンドウ: 思考モードおよび非思考モードで最大 100 万トークンに対応
- 開発スピード: トレーニング開始から公開までわずか9 週未満
ベンチマークスコアと実績
Laguna S 2.1 は、自社の規模の数倍を持つ大規模モデル(Kimi K3 2.8T や DeepSeek-V4-Pro-Max など)との対抗において優位性を発揮しました。
達成したベンチマーク
以下の各ベンチマークで「解決されたタスク」を達成しています:
- Terminal-Bench 2.1
- SWE-Bench Multilingual
- SWE-Bench Pro(公開データセット)
- DeepSWE
- SWE Atlas(コードベース Q&A)
- Toolathlon Verified
スコア集計方法の注記
スコアは以下のいずれかの最も高い値を採用しています(※ SWE Atlas の第三者リーダーボード数値は使用除外)。
- ベンチマーク作成者によるリーダーボード
- 第三者リーダーボード(Artificial Analysis)
- メーカーが公式に報告したスコア
各タスクあたり、通常は 4 回の試行平均(pass@1)で算出されます。DeepSWE、SWE Atlas(Codebase QnA)、Toolathlon Verified については 3 回ずつです。
比較表:Terminal-Bench 2.1
※スコアは各ベンチマークの最大値を採用。SWE Atlas(Codebase QnA)を除く全ベンチマークで適用されます。
| ランク | モデル | スコア | タイプ / 備考 |
|---|---|---|---|
| 1 | GPT-5.6 Sol | 88.82 | オープンウェイト / クローズド / サイズ非公表 |
| 2 | Kimi K3 2.8T-A50B | 88.33 | - |
| 3 | Claude Fable 5 | 88.04 | - |
| 4 | GPT-5.6 Terra | 87.45 | - |
| 5 | GPT-5.6 Luna | 84.76 | - |
| 6 | Claude Opus 4.8 | 84.67 | - |
| 7 | Claude Sonnet 5 | 80.48 | - |
| 8 | Muse Spark 1.1 | 80.09 | - |
| 9 | Qwen-3.7 Max | 74.51 | - |
| 10 | Hy3 295B-A21B | 71.70 | - |
| 11 | Laguna S 2.1 118B-A8B | 70.20 | 小型ながら大活躍 |
| 12 | MiniMax M3 428B-A23B | 66.00 | - |
| 13 | DeepSeek-V4-Pro-Max 1600B-A49B | 64.00 | - |
| 14 | Inkling 975B-A41B | 63.80 | - |
| ... | (以降略) |
Terminal-Bench 2.1 の意義:
- エージェントモデルをターミナルを通じて環境と接続し、多岐にわたる高品質な長期タスクを評価します。
- Laguna S 2.1 はこのサイズカテゴリーにおいて際立った性能を発揮しました(横軸は対数スケール)。
DeepSWE ベンチマークへの注目
- 現状: 最前線に近い位置に立ちますが、成熟したベンチマークの特性上、トップスコアは 70〜90% の範囲に集まりつつあります。
- 課題: Datacurve が提供する DeepSWE はまだ大きな改善余地があります(長期かつ部分的解決が困難)。
- v1.1 バージョンでは、最前線のモデルで 54% から 73% の範囲に分布しています。
- Laguna S 2.1 の成果:
- DeepSWE v1.1 において、思考モード(Pool ハネス)で**40.4%**というスコアを記録しました。
DeepSWE コンプアティビリティ表
※ハネスは「pool」を使用し、DeepSWE リーダーボードの mini-swe-agent ではありません。最大値を採用しています。
| ランク | モデル | スコア |
|---|---|---|
| 1 | GPT-5.6 Sol | 73.00 |
| 2 | Claude Fable 5 | 70.00 |
| 3 | GPT-5.6 Terra | 70.00 |
| 4 | Kimi K3 2.8T-A50B | 69.00 |
| 5 | GPT-5.6 Luna | 67.20 |
| 6 | GPT-5.5 | 67.00 |
| 7 | Claude Opus 4.8 | 59.00 |
| 8 | Claude Sonnet 5 | 54.00 |
| 9 | Grok 4.5 | 54.00 |
| 10 | Muse Spark 1.1 | 53.30 |
| ... | (以降略) | |
| 13 | Laguna S 2.1 118B-A8B | 40.40 |
| ... | (以降略) |
モデルの実働とケーススタディ
定量的なスコアに加え、実際のタスクでの動作を確認しました。
ケーススタディ 1: ブランクフォルダーからブラウザエンジンを構築する
- 課題: 視覚能力を持たない Laguna に、人類の関与なしに 50 分間で空のフォルダーから動作する HTML/CSS レンダリングエンジンを作成させました。
- 成果:
- 純粋な JavaScript で完全なパイプライン(パーサ→カスケード→レイアウト→レンダラー)を構築。
- HTML トークナイザー、DOM ツリー、CSS パーサー、ボックスモデル、キャンバス 2D レンダラーを実装。
- 自己検証: ホスティングブラウザ内の iframe で自身を描画し、両者の出力をピクセル単位で比較して正確性を確認。
ケーススタディ 2: 私たちのハネスの最適化
- 課題: エージェントハネス(学習・評価・ユーザー相互作用)自体の自動ループ最適化を行いました。
- 成果:
- **5.2%**の高速化、**約 70%**のメモリ割り当て削減を達成。
- 発見された最適化事項:
- ストリーミングプロセッサー内の
をサブスライスで置換。strings.Builder - 二段階の事前割り当て(Step Group)の実装。
- 連続したサブスライスのグループ化とキャップ事前割り当ての適用。
のメモ化。Entries()
- ストリーミングプロセッサー内の
- 評価: Go のレース検出器と go vet ゲーティングで検証済み。隠れたバグによる成果ではないことを確認。
ケーススタディ 3: Erdős 問題 #397 の独自再導出(オフライン、Perl で)
- 課題: 知識カUTOFF が 2025 年 11 月のため、2026 年 1 月に発見された GPT-5.2 Pro の成果には触れず、完全な独立した解決を求めました。
- 成果:
- サンドボックスに Python が無かったため、Perl を利用して数理論理学を遂行。
- 強力的な素因数分解とパターン分析を行い、**「8 インデックスを持つ閉じた形の無限ファミリー」**を見出しました。
- 導出された公式: $$B_{11+10n} \cdot B_{14+12n} \cdot B_{18+15n} \cdot B_{22+20n} = B_{12+10n} \cdot B_{13+12n} \cdot B_{17+15n} \cdot B_{23+20n}$$ (任意の $n \ge 0$ に対して成立)
- 意義: 以前出版された構成とは構造的に異なる新しい導出であり、単なる記憶ではなく真の推論能力を示しています。
思考モード(Thinking Effort)
Laguna S 2.1 は、問題に応じて適切な思考/テストタイムコンピューティング予算を決定する2 つのモードを採用しています。
- オフ: 非思考モード
- マックス(デフォルト有効): 長期にわたる一貫した生産的な思考が可能。
- Terminal-Bench 2.1: **60.4% → 70.2%**への向上
- DeepSWE: **16.5% → 40.4%**への向上
※本リリースでは「低・中・高」の粒度制御は未実装ですが、近日での提供予定。
制限事項と改善点
- ハネスへの過学習: サードパーティのエージェントハネス(例:Hermes)で使用時、ツールの初回呼び出しに失敗する場合があります。通常は文脈学習により解消されます。
- ネストされたツールの呼び出し: XML 風のタグ形式でのツール呼出において、JSON アレイを期待するケースで不適切なエスケープを行う可能性があります。
- 想定より長い思考時間: 特に競合数学問題で停滞することがあります。次期モデルでは思考努力の制御(エフォートコントロール)を導入予定です。
強力な基礎と新たなポストトレーニング
Laguna S 2.1 は、単なるサイズ増加だけでなく、**「作業する仕方」**の向上が重要です。
- より多くの検証
- 無前提での受け入れ減少
- 早期勝利宣言の回避
- より高い持続性
ポストトレーニングとトレーニングループの変更
- データ: XS 2.1 と同じ予備トレーニングデータを使用(新データの追加ではなく、スケーリング・コード修正)。
- RL: 最初の RL を FP8 精度で実行。
- コンテキスト拡張: 100 万トークンの拡大により、困難なタスクでの最強パフォーマンスを実現。
- トレーニングループの改善:
- より寛容なロールアウト予算(タイムアウト・ターン数増加)。
- より優れたサンドボックスインフラストラクチャ。
- マルチハネスロールアウトにより、特定のハネスへの過学習を回避。
開発スピードとリリース戦略
- Model Factory: 研究イテレーション速度の向上により、3 ヶ月足らずで大幅に強力なモデルを提供。
- 2026.4.28: Laguna M.1 / XS.2 公開
- 2026.7.2: Laguna XS 2.1 / 33B 公開
- 2026.7.21: Laguna S 2.1 / 118B-A8B 公開
スタートとアクセス方法
ライセンス: OpenMDW-1.1
利用環境
- NVIDIA: TRT-LLM サービング、Blackwell システム(NVFP4)、単一 NVIDIA DGX Spark。
- 推論フレームワーク: vLLM、SGLang、Ollama(Day One から対応)。
- ホストされたアクセス: Baseten, Frontier Gateway, OpenRouter (無料/$0.10 入/ $0.20 出), Vercel AI Gateway。
- OpenRouter: 専用課金エンドポイントでは全 1M コンテキストウィンドウ利用可能。
- エージェント連携: Kilo, Hermes Agent, Pi, OpenCode, OpenClaw, Cline, pool(ターミナルベース)。
コマンドで思考切り替えが可能。/thought-level
詳細情報・コンタクト
- Web チャット (ログイン不要): chat.poolside.ai(Web 検索と基本的なコード実行機能付き)
- ウェイト配布: ベースモデル(研究用や独自ポストトレーニング用)のご要望は、
までメールをご送付ください。models@poolside.ai