誰も語らないナビエ - ストークスの一部

2026/09/11 6:22

誰も語らないナビエ - ストークスの一部

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

OpenAI は、数十年にわたるナビエ=ストークス方程式の問題に対し、人間が読めるものおよび Lean 4 の形式証明を両方生成することで画期的な突破を遂げ、流体力学の長年の疑問に解答しました。この進展は、AI が今や以前の費用の僅少で機械検証可能な数学論理を生産できるようになり、歴史的に過酷とされたタスクを転換したことを示しています。以前では、簡単な学部生の教科書の 1 ページを検証するだけでも約 40 時間必要でしたが、研究論文は複雑な依存関係が多く密度が高いため、その努力量は 20 倍も多かったと推定されていました。こうした制約の下では、全 166 ページのナビエ=ストークス証明を形式化する作業は、132,800 人の時数が必要と予測されていました。OpenAI の新しい手法はこの要件をたった 17 時間に削減し、労働量を 4 オーダー(10,000 倍)もの減少を実現しました。数学以外に、この技術はスマートコントラクトやセキュリティポリシーなどの重要ソフトウェアシステムの検証にも適用でき、誤りが深刻な帰結を招く分野において有効です。数学研究とは異なり、セキュリティポリシーの検証やスマートコントラクトの責任限度の確認といった問題は形式化が容易であり、投資対効果を定量化できます。金融やサイバーセキュリティなどの産業はこれにより莫大な恩恵を受け、ハイリスクアルゴリズムの検証を実践的に可能にします。この変化は、理論的可能性から実用的な応用への移行を象徴し、信頼性が最優先される形式検証タスクにおける広範な AI 採用への道を開きました。AI を用いて解決された他の最近の数学的予想についても、Lean 4 を用いた形式証明が伴っています。

本文

OpenAI のナビエ・ストークス方程式証明:形式化の革命と Lean 4 の役割

発表の内容

  • OpenAI が、長年にわたり懸念されていた流体力学のナビエ・ストークス方程式に関する解存在・滑らかさ問題に対する証明を発表。
  • 同社は人間が読みやすい従来の証明と併せて、Lean 4 で記述された形式化された証明も公開。
  • この発表は予想通り大きく注目を集めている。

Lean 4 を用いた数学的推測の解決

  • 近年、AI を用いて複数の数学的推測が解決されている。
  • これらの解決にも特にLean 4 を用いた形式化された証明が添えられている。

形式化証明生成の難易度とコスト変化

従来の通則(2005 年時点)

  • Henk Barendregt と Freek Wiedijk が指摘した基準:
    • 学部数学の教科書 1 ページを形式化するのに約1 ヶ月(5 日勤務 × 8 時間/日)かかる。
    • コスト指標:ページあたり 40 人時
  • 研究論文特有の課題:
    • 密度が高く、内容が濃縮されている。
    • 一文内に公表されたあらゆる内容への言及が含まれる可能性があるため、教科書より形式化が複雑。

OpenAI の実績による劇的な変化

  • OpenAI の公開論文: 166 ページ。
  • 従来方式での推定コスト: ページあたり 40 人時 × 166 ページ × 20 倍(研究論文の密度考慮)= 約 132,800 人時
  • OpenAI の実際所要時間: わずか 17 時間(Lean を用いた検証のみ)。
  • 結論:コストが桁違いに低下し、これは革命的な変化である。

AI を活用した形式化の実践例

  • 著者自身がブログ投稿用の作業チェックのために、形式化証明の生成に AI を使用。
  • もし週給を払う人間をチェック员を雇った場合、この規模の作業を行うことは現実的に不可能(非経済的)であったはず。

その他の適用分野:形式検証のメリット

形式検証は数学に限らず、以下の分野でも活用可能:

  • セキュリティポリシー: 矛盾なく整合性を保ち、前提条件の下で目的を達成するかを検証。
  • スマートコントラクト: 課す最大責任額などの制約を形式的に検証。
  • システムアルゴリズム: アルゴリズムの正しさを検証。
    • 数学的研究の形式化と比較して容易
    • **投資対効果(ROI)**の定量化が比較的简单である。

関連記事

同じ日のほかのニュース

一覧に戻る →

2026/09/11 0:29

Cognition が新たな SWE-2 モデルを発表。Fable 5.1 や GPT-Astra と競合する性能を誇ります。

## Japanese Translation: Cognition は、Fable 5.1 や GPT-5.6 Sol といったトップクラス競合に匹敵する最新コーディングモデルである SWE-2 を発表しました。SWE-2 は、大規模な Kimi K3 ベースモデル(パラメータ数 2.8 兆)での後学習により実現され、コストペナルティ付き報酬とファーストプリンシプルに基づくアプローチ、そして長さに基づく報酬ベースラインを採用してトレーニングを安定化させながら、多兆パラメータ領域への強化学習のスケーリングを達成しました。FrontierCode 1.1 Main では 50.0% のスコア(Fable 5.1 より僅か 1 ポイント下)を記録しながらコストは 64% 削減され、DeepSWE 1.1 では 73.0% を達成しました。単なるスコアを超え、SWE-2 は「エンジニアリング的判断」の優位性も示し、不要な迂回を避けることで初期コードエディットの中央値ステップ数を 48 から 18 に削減しました。また、モデルは安全性と信頼性を最優先しており、プロパガンダおよび検閲テストのうち 98% をパスしています。Devin Desktop と CLI 経由で即時利用可能(Web および Fusion では段階的展開中)の SWE-2 は、高パフォーマンス AI をアクセス可能な価格点で提供し、信頼性や安定性を損なうことなくソフトウェア開発サイクルの効率化を目的としています。 ## Text to translate: Cognition has introduced SWE-2, its most advanced coding model, which rivals top competitors like Fable 5.1 and GPT-5.6 Sol while offering significant efficiency gains. Achieved through post-training on the massive 2.8 trillion-parameter Kimi K3 base model, SWE-2 scales Reinforcement Learning to a multi-trillion parameter regime using cost-penalized rewards derived from first principles and a length-weighted reward baseline to stabilize training. On FrontierCode 1.1 Main, it scores 50.0% (just one point behind Fable 5.1) while being 64% cheaper; on DeepSWE 1.1, it achieves 73.0%. Beyond raw scores, SWE-2 demonstrates superior "engineering judgment," reducing the median steps to an initial code edit from 48 down to 18 by avoiding unnecessary detours. The model also prioritizes safety and reliability, passing 98% of propaganda and censorship tests. Available immediately via Devin Desktop and CLI (with rolling deployments on Web and Fusion), SWE-2 is designed to streamline software development cycles by delivering high-performance AI at an accessible price point without compromising trustworthiness or stability.

2026/09/11 6:30

米運輸安全委員会、マイアミでのボーイング767滑走路逸脱事故調査結果更新発表

## Japanese Translation: 9月6日のマイアミ国際空港におけるランウェイ逸脱事故に巻き込まれたボーイング7598貨物機からフライトレコーダーが回収され、正常に読み出されたことが、2026年9月9日に国立輸送安全委員会(NTSB)によって確認されました。アクロン航空社(Acron Aviation)のCVRからの高品質な音声および54時間以上にも及ぶフライトデータレコーダーのデータ——400以上のパラメータを記録——が確保されました。予備的分析によると、飛行機は conflicting なパイロットによる離陸再行(ゴーアラウンド)指令を受けながら、危険に甚だしい速度(ノーズギア158ノット)で接地しており、スピードブレーキやスラストリバーサの展開はされていなかったとのことです。現時点での記録は同期されていませんが、ワシントンDCのNTSBチームによって書面による要約が作成され、フラップ調整、オートパイロットの離脱、地形警告など特定の行動を含む事件の経過を明確にします。詳細なコックピット会話とデータパラメータのタイムラインは、専用調査ウェブページで確認できます。あるいは24時間365日の対応オペレーションセンター(1-844-373-9922)にお問い合わせいただくことも可能です。すべての所見は、公式要約が確定するまで予備的なものとされています。

2026/09/11 0:29

火星用に開発されたNASAの色彩トリックが、今や地球で岩壁画を解読する役割を果たすことになった

## Japanese Translation: 考古学者のジョン・ハーマンは、NASA の decorrelation stretch 手法を応用して古代岩絵の研究を行ないました。この手法は当初、JPL で 1978 年にジム・ソーハによってリモートセンシング画像の強化のために開発され、後にロナルド・アレイによって速度と精度の向上を目的として 1996 年に改良されました。ハーマンはこの研究成果に基づき、数学および医療イメージングの背景を応用し、Karhunen–Loève 変換定理に基づく Dstretch プラグインを開発しました。このソフトウェアは単なるコントラストの引き上げではなく、色彩を拡張された範囲へマッピングします。Dstretch を用いることで、研究者たちは複数の遺跡において以前は目に見えなかった図像を発見しました:カリフォルニア州バイアのカベ・デ・サン・ボルヒタスで新たな黄色の図像が確認され、カンボジアのアングルワット周辺で 200 点以上の色あせた絵画が発見されています。エジプトのベニハッサンではコウモリや豚の画像が、カナダ・アルバーツアのライティングオンストーン州立公園ではクロ族の戦士による初期のグラフィティと解釈される馬と騎士を描いたピクトグラフが、ノルウェーのアールサンド 1 遺跡では新たに約 15 点の図像に加え、28 点で新たな詳細が浮き彫りになりました。このプラグインのカスタムカラー空間は岩絵のイメージングに特に有用であることが実証されています。火星イメージングの強化に元々使用された既確立のリモートセンシング手法を適用することで、Dstretch は低コントラストの写真に対して侵襲のないデジタルアクセスを提供し、世界中の隠れた芸術作品の解明に貢献しています。