Cognition の SWE-2 が Terminal-Bench 2.1 で 92.8 を達成

2026/09/11 1:52

Cognition の SWE-2 が Terminal-Bench 2.1 で 92.8 を達成

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Cognition は、Agentic コーディングタスクに特化して設計された 2.8 兆パラメータの Mixture of Experts (MoE) モデルを発表しました。このモデルは、Kimi K3 base に Cognition の後トレーニングを組み合わせたものです。このリリースは同社の強化学習 (RL) スケーリングにおける初の主要な取り組みであり、プロプライエタリな重みは 2026 年 9 月にリリース予定となっています。モデルは NVFP4 および FP8 コアを使用し、提供スタックによって受容長を 15% 拡張すると同時に、プリフィルされたデレイヤーがスループットを向上させますが、Time to First Token (TTFT) に悪影響を及ぼします。

パフォーマンステストでは、モデルは自己報告による FrontierCode Main スコア 50.0 および DeepSWE 1.1 スコア 73.0 を達成しました。FrontierCode で Claude Fable 5.1 より 0.9 ポイント下がり、GPT-6 Astra より 3.3 ポイント低いものの、特に長期的なホライズンの Terminal-Bench 4.0 タスクで顕著に性能が劣りますが、大幅な効率性の向上を提供しています。モデルは SWE-1.7 ではステップ 48 に対してステップ 18 で最初の修正を行い、Medium エフォートのタスクを 81% のコスト削減で完了し、主要なコーディングテストにおいて Claude Fable 5.1 と同様の性能を維持しました。

9 月から、モデルは Devin Desktop、CLI、およびウェブプラットフォームをベースにタスクに基づいた課金モデル(トークン単価ではなく)を使用してリリースされます。ユーザーには、プロプライエタリなライセンス制限によりローカルインストールが利用できないこと、またクォンタイゼーションラダーも公開されていないことに注意してください。

本文

Kimi K3 ベースの超大規模 RL モデル「SWE-2」:ベンチマークと運用特性

概要とアーキテクチャ

  • モデルベース: Cognition の後学習済み 「Kimi K3 ベース」
  • アーキテクチャ:
    • 全体パラメータ:2.8 兆
    • アクティブパラメータ(MoE): トークンごとの 1040 億
    • Cognition が初回に超大規模領域(数千億〜兆パラメータ級)へ強化学習(RL)を拡張したモデル。
  • ベース調整: エージェント型コーディング向けに RL を重視して調整済み。後学習により主要ベンチマークで +5〜6 ポイント のスコア向上を実現。

推論スタックと最適化技術

  • MoE インフェレンス: NVFP4 および FP8 カーネルを採用。
  • クオンタ化認識トレーニング: FP8 を MLA(Multi-Head Latent Attention)内の K、Q、V 計算およびスコア計算に適用。
  • SpecForge によるドラフトモデル再トレーニング:
    • 受け入れ可能な長さ:15% 延長
    • GPU あたり TPM およびリクエスト単位生成速度:10〜20% 向上(TTFT は若干劣化)。
    • プリフィル用遅延層の導入による効率化。

運用効率とコストパフォーマンス

  • 実行ステップ数(平均):
    • 「中級」:53 ステップ
    • 「高級」:80 ステップ
    • 「最大級」:98 ステップ
    • (対比: SWE-1.7 は 127 ステップ)
  • SWE-1.7 との比較(「中級」レベル):
    • FrontierCode スコアはより高スコア。
    • ターン数:58% 減少
    • 平均コスト:81% 低減
  • コードエディット生成:
    • 最初の実行可能エディットの中央値ステップ:18(SWE-1.7 は 48 ステップ)。
    • 大幅な効率化と早期完了を実現。

ベンチマークスコア(Cognition 自己報告)

評価指標スコア
FrontierCode 1.1 Main50.0
DeepSWE 1.173.0
Terminal-Bench 2.192.8 (公開表中最高値)
Terminal-Bench 4.027.3

スコア分析と競合比較

  • FrontierCode 1.1 Main (50.0):
    • Claude Fable 5.1 (50.9) に僅か 1 ポイント差。
    • GPT-6 Astra (53.3) から 3.3 ポイント離れるが、コストは Fable の64% 低く、Astra の1/4に抑えられている。
  • Terminal-Bench 2.1: 公開表中で最高値を記録。
  • Terminal-Bench 4.0 (弱点):
    • スコア:27.3
    • Fable 5.1 (55.8) および GPT-6 Astra (57.9) と比べて大きく後れを取っている。
    • 長期的視野を持つエージェントタスクにおいて、Frontier モデルとのギャップが依然として残っていることを示唆。

モデル基本情報

  • パラメータ数: 2,800.0 兆
  • ライセンス: プロプライアトリー(非公開)
  • 開発元: Cognition
  • 出所国: 🇺🇸 アメリカ合衆国
  • 公開日: 2026 年 9 月

価格・利用方法

  • ローカル実行:
    • 無料プランに登録し、測定されたトークン生成速度(tok/s)を共有可能。
    • 自身のマシン環境確認と速度測定が可能。
  • クラウド API:
    • 現時点でトークン単位のパータイシング価格情報は提供されません
    • フラッグシップモデルのリストプライスについては別途計算ツールの利用が必要。
  • 価格履歴: 推論コストの変遷は OpenRouter のスナップショット情報に基づくため、歴史的な API コストシリーズとは異なります。

同じ日のほかのニュース

一覧に戻る →

2026/09/11 0:29

Cognition が新たな SWE-2 モデルを発表。Fable 5.1 や GPT-Astra と競合する性能を誇ります。

## Japanese Translation: Cognition は、Fable 5.1 や GPT-5.6 Sol といったトップクラス競合に匹敵する最新コーディングモデルである SWE-2 を発表しました。SWE-2 は、大規模な Kimi K3 ベースモデル(パラメータ数 2.8 兆)での後学習により実現され、コストペナルティ付き報酬とファーストプリンシプルに基づくアプローチ、そして長さに基づく報酬ベースラインを採用してトレーニングを安定化させながら、多兆パラメータ領域への強化学習のスケーリングを達成しました。FrontierCode 1.1 Main では 50.0% のスコア(Fable 5.1 より僅か 1 ポイント下)を記録しながらコストは 64% 削減され、DeepSWE 1.1 では 73.0% を達成しました。単なるスコアを超え、SWE-2 は「エンジニアリング的判断」の優位性も示し、不要な迂回を避けることで初期コードエディットの中央値ステップ数を 48 から 18 に削減しました。また、モデルは安全性と信頼性を最優先しており、プロパガンダおよび検閲テストのうち 98% をパスしています。Devin Desktop と CLI 経由で即時利用可能(Web および Fusion では段階的展開中)の SWE-2 は、高パフォーマンス AI をアクセス可能な価格点で提供し、信頼性や安定性を損なうことなくソフトウェア開発サイクルの効率化を目的としています。 ## Text to translate: Cognition has introduced SWE-2, its most advanced coding model, which rivals top competitors like Fable 5.1 and GPT-5.6 Sol while offering significant efficiency gains. Achieved through post-training on the massive 2.8 trillion-parameter Kimi K3 base model, SWE-2 scales Reinforcement Learning to a multi-trillion parameter regime using cost-penalized rewards derived from first principles and a length-weighted reward baseline to stabilize training. On FrontierCode 1.1 Main, it scores 50.0% (just one point behind Fable 5.1) while being 64% cheaper; on DeepSWE 1.1, it achieves 73.0%. Beyond raw scores, SWE-2 demonstrates superior "engineering judgment," reducing the median steps to an initial code edit from 48 down to 18 by avoiding unnecessary detours. The model also prioritizes safety and reliability, passing 98% of propaganda and censorship tests. Available immediately via Devin Desktop and CLI (with rolling deployments on Web and Fusion), SWE-2 is designed to streamline software development cycles by delivering high-performance AI at an accessible price point without compromising trustworthiness or stability.

2026/09/11 6:30

米運輸安全委員会、マイアミでのボーイング767滑走路逸脱事故調査結果更新発表

## Japanese Translation: 9月6日のマイアミ国際空港におけるランウェイ逸脱事故に巻き込まれたボーイング7598貨物機からフライトレコーダーが回収され、正常に読み出されたことが、2026年9月9日に国立輸送安全委員会(NTSB)によって確認されました。アクロン航空社(Acron Aviation)のCVRからの高品質な音声および54時間以上にも及ぶフライトデータレコーダーのデータ——400以上のパラメータを記録——が確保されました。予備的分析によると、飛行機は conflicting なパイロットによる離陸再行(ゴーアラウンド)指令を受けながら、危険に甚だしい速度(ノーズギア158ノット)で接地しており、スピードブレーキやスラストリバーサの展開はされていなかったとのことです。現時点での記録は同期されていませんが、ワシントンDCのNTSBチームによって書面による要約が作成され、フラップ調整、オートパイロットの離脱、地形警告など特定の行動を含む事件の経過を明確にします。詳細なコックピット会話とデータパラメータのタイムラインは、専用調査ウェブページで確認できます。あるいは24時間365日の対応オペレーションセンター(1-844-373-9922)にお問い合わせいただくことも可能です。すべての所見は、公式要約が確定するまで予備的なものとされています。

2026/09/11 0:29

火星用に開発されたNASAの色彩トリックが、今や地球で岩壁画を解読する役割を果たすことになった

## Japanese Translation: 考古学者のジョン・ハーマンは、NASA の decorrelation stretch 手法を応用して古代岩絵の研究を行ないました。この手法は当初、JPL で 1978 年にジム・ソーハによってリモートセンシング画像の強化のために開発され、後にロナルド・アレイによって速度と精度の向上を目的として 1996 年に改良されました。ハーマンはこの研究成果に基づき、数学および医療イメージングの背景を応用し、Karhunen–Loève 変換定理に基づく Dstretch プラグインを開発しました。このソフトウェアは単なるコントラストの引き上げではなく、色彩を拡張された範囲へマッピングします。Dstretch を用いることで、研究者たちは複数の遺跡において以前は目に見えなかった図像を発見しました:カリフォルニア州バイアのカベ・デ・サン・ボルヒタスで新たな黄色の図像が確認され、カンボジアのアングルワット周辺で 200 点以上の色あせた絵画が発見されています。エジプトのベニハッサンではコウモリや豚の画像が、カナダ・アルバーツアのライティングオンストーン州立公園ではクロ族の戦士による初期のグラフィティと解釈される馬と騎士を描いたピクトグラフが、ノルウェーのアールサンド 1 遺跡では新たに約 15 点の図像に加え、28 点で新たな詳細が浮き彫りになりました。このプラグインのカスタムカラー空間は岩絵のイメージングに特に有用であることが実証されています。火星イメージングの強化に元々使用された既確立のリモートセンシング手法を適用することで、Dstretch は低コントラストの写真に対して侵襲のないデジタルアクセスを提供し、世界中の隠れた芸術作品の解明に貢献しています。