Gemini 4 アルゴン(高機能版):知能、パフォーマンス、価格分析

2026/10/01 5:50

Gemini 4 アルゴン(高機能版):知能、パフォーマンス、価格分析

RSS: https://news.ycombinator.com/rss

要約▶

日本語訳:

人工知能分析インデックス v4.3.2 は、多様な AI 能力を測定するための 10 の明確な評価指標を導入することで、新たな重要な基準を確立します。これらには、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience および医療領域の長文脈推論に焦点を当てた AA-LCR v1.1 が含まれます。最も重要なのは、このフレームワークが一般推論やコーディングから医療のような専門分野まで、幅広い複雑なタスクにおけるモデルのパフォーマンスを信頼性を持って比較できるようにする点です。

Elo スケール(相対的なスキルレベルを計算するための統計的手法)と厳格な採点基準チェックを組み合わせて使用することで、インデックスはより高いスコアが一貫して優れた品質を示すことを保証します。具体的には、AA-Briefcase Elo は採点基準通過率、分析質の Elo、プレゼンテーション Elo を統合した複合指標です。システムは幻覚を効果的に罰則化し、知識の正確性を確保します。また、AA-Omniscience インデックスはこの信頼性を -100 から 100 の範囲でスコアリングすることで測定します。さらに、システムは検索拡張生成(RAG)ワークフローに対する主要な技術指標を定義しており、コンテキストウィンドウは入力と出力のトークンの最大合計数を表す例として挙げられます。

生粋の能力を超えて、このスイートは意思決定者にとって不可欠な実用的データを提供し、評価ウェイトによって加重された入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格を用いて運用コストを詳細に算出します。フレームワークはまた、ライセンス制限を明確にするとともに、「商用利用制限付き」と使用が限定される場合、「非商用」と禁止される場合にそれぞれモデルをラベル付けします。さらに、エージェント型の現実世界の作業タスクは (Elo-500)/2000 メトリックを用いて測定され、エージェント型知識およびコーディング/ターミナルタスクには Elo スケールが使用されます。この標準化されたアプローチにより、企業は将来リリースの特定の予測を必要とせずに、明確なパフォーマンスデータと財政的制約に基づいて情報を得た選択を行うことができます。究極的には、それは AI モデル選択というしばしば不透明な景観を、個人ユーザーおよび信頼できる技術ソリューションを求める大企業双方にとって透明で実行可能なプロセスへと変革します。

本文

AI 知能指数 Ver.4.3.2

「AI Analysis」が提供する**「AI 知能指数」(Ver.4.3.2)は、以下の10 つの評価指標**を統合した包括的な評価体系です。詳細な内訳および実装方法は、「AI 知能指数の手法」 をご参照ください。

  • AA-Briefcase v1.1
  • GDPval-AA v2.1
  • AutomationBench-AA
  • Terminal-Bench 4.0
  • SciCode
  • Humanity's Last Exam
  • GDP.pdf
  • CritPt
  • AA-Omniscience
  • AA-LCR v1.1

1. AI 知能評価概要

この指標は、モデルが特定の能力や業界におけるパフォーマンスを発揮する度合いを測定します。

  • 評価方法: すべての評価は**人工分析(Artificial Analysis)**によって独立して行われます。
  • スコアの意味: スコアが高いほど、優れたパフォーマンスを示すことを意味します。

重要な注意点: モデルの知能は一般的にあらゆるユースケースで通用しますが、特定の評価指標は特定の利用シーンにおいてより関連性が深い場合があります。


2. 主要な評価指標

エージェント機能

  • エージェント型知識作業(Elo-500/2000)
    • エージェント型知識作業のパフォーマンスを測定します。
  • エージェント型実世界タスク(Elo-500/2000)
    • エージェント型の実世界タスクのパフォーマンスを測定します。
  • エージェント型コーディングおよびターミナル利用
    • プロフェッショナルドキュメントにおける**推論能力(全問正答)**を測定します。
  • ターミナル上でのエージェント型科学研究ワークフロー
    • 医療分野の**ロングコンテキスト推論(MLCR-AA)**を測定します。

個別ベンチマーク詳細

AA-Briefcase v1.1

  • 概要: エージェント型知識作業向けに開発されたベンチマークです。
  • 指標(AA-Briefcase Elo)の構成:
    • Rubric のパス率、分析品質の Elo、プレゼンテーションの Eloを統合した複合指標。
    • スコアが高いほど優れています。
    • Rubric パフォーマンスは合成による対戦マッチを介して Elo スコアに変換されます。
    • 計算範囲: Elo と 95% 信頼区間の上下限は**0 にクリップ(固定)**されています。

AA-Omniscience インデックス

  • 概要: 知識の信頼性と**ハルシネーション(幻覚)**を測定します(スコアが高いほど優れています)。
    • 正解には加点され、ハルシネーションには減点されます。
    • 回答拒否に対するペナルティはありません。
  • 得点範囲:
    -100
    から
    100
    • 0
      : 正答数と誤答数が同等。
    • 負のスコア: 誤答数が正答数を上回る状態。

3. コストおよび効率性指標

AI 知能指数タスクあたりのコスト(単位:米ドル)

人工分析の AI 知能指数タスク 1 つあたりの加重平均コストです。

  • 算出ロジック: 各評価のコストは、入力トークン、キャッシュヒット、キャッシュ書き込み、推論、出力トークンの単価を合計し、タスク数で割った値に、「AI 知能指数における加重」を乗じて算出されます。
  • セグメント別コスト: 低値が望ましいです。

全体実行コスト

「人工分析 AI 知能指数」全体を実行するための総コスト(米ドル)です。

  • 指数的に包含されているすべての評価を実行するために必要なコスト。
  • 各評価におけるトークン単価と使用量を基に算出されます(繰り返し分は除く)。

トークン使用量

AI 知能指数を動かす際の、1 タスクあたりの出力トークンの加重平均数です。

  • 算出ロジック: 各評価ごとの出力トークン数にそれぞれのベンチマークの相対的加重を乗じて合計し、タスク数(繰り返し分を除く)で割ることで算出されます。

4. モデル仕様

仕様項目説明
コンテキストウィンドウトークン制限数であり、値が高いほど優れています。大規模なデータ量の推論および検索を伴う**RAG(文脈強化生成)**ワークフローにおいて重要です。
※ 最大結合入出力トークン数として計算されます。ただし、出力トークンの制限はモデルによって大幅に異なる場合があります。
利用可否モデルの重みが入手可能かどうかを示します。
* 商用利用が制限されている場合:Commercial Use Restricted(商用利用制限付き)
* ライセンスがそれを禁止する場合:Non-commercial(非商用)

5. 料金詳細

トークン単価(米ドル)

  • キャッシュヒット:
    • 以前処理済みのプロンプトをキャッシュから読み込んだ際の価格です。
    • 通常の入力料に比べて大幅な割引が適用されます。
    • ※ 記載されている値はキャッシュヒット価格です。キャッシュ書き込みとストレージ料金は別途請求されます。
  • 入力:
    • 新規の入力トークンに対する標準単価です。
  • 出力:
    • 生成された出力トークンに対する価格です。

詳細情報: より詳細なバリエーションについては、**「プロバイダー別キャッシュ料金」**をご参照ください。

同じ日のほかのニュース

一覧に戻る →

2026/10/01 5:04

ジェミニ 4 アルゴン

## Japanese Translation: Google は、ソフトウェアエンジニアリング、企業向け知識業務(法務および財務を含む)、およびサイバーセキュリティ防衛における複雑で長期にわたるワークフローを扱うための深い推論に特化された AI モデル「Gemini 4 "Argon"」を発表しました。Argon は産業標準を超える出力トークン制限 100 万トークン(従来の 64K から向上)をサポートし、単一のトリアジェクト内での複雑な問題に対する深い推論を可能にします。そのアーキテクチャには、最適化された量子コンピューティングサブルーチンが組み込まれており、 prior システムと比較して約 40% の高速化を実現するとともにメモリ使用量を大幅に削減しています。内部テストの結果では、Google データセンター全体で 300 TiB を超えるメモリが解放され(推定節約額は 500 TiB〜1 PiB)、効果が確認されました。 Argon は現在、Fairwind プログラムを通じて信頼されたサイバー防衛者に対してのみ展開されており、米国政府による任意のプレリリースアクセスレビューを経ています。一般公開は安全なガードレールのさらなる精錬を待って行われ、まず有料 API 顧客および Google AI Ultra 契約者のみから開始されます。安全対策には、CBRN 攻撃への拒否メカニズム、Gray Swan IPI ベンチマークにおける間接プロンプトインジェクションに対する堅牢性、思考の連鎖分析を通じた非整合性のモニタリングなどが含まれます。 ベンチマーク結果は Argon の能力を浮き彫りにしています:ソフトウェアエンジニアリングタスクにおいて DeepSWE v1.1 で 77.9% のスコアを達成し、AutomationBench では 51.3% のスコアで第 1 位にランクされ、長期間のビデオ理解における LVBench で 91.7% のスコアを獲得、CWE-bench v1 では脆弱性修復において 68% のスコアで 1 位と並んでいます。また、Wiz の Scan for Good イニシアチブにおいて、以前の実験モデルが見過ごしていた世界中で使用されている医療ソフトウェアにおける重大な脆弱性を成功裏に特定しました。 価格は入力トークン 100 万あたり 2 ドル(出力トークン 100 万あたり 10 ドル)から開始され、キャッシュされた入力トークンは標準の入力価格に対して 95% の割引で利用可能です。このコスト効率の高い構造は、大規模な計算タスク向けに高度な AI 機能を可能にすることで、長期ワークフロー自動化およびサイバーセキュリティ防衛戦略を革新することを目的としています。さらに、Argon エージェントは積極的に C/C++ コードベースを Rust へ移行しており、re2 などのコアライブラリでは数万行以上、Fuchsia Zircon カーネルでは最大 800 万行以上に達しています。libgav1 ビデオデコーダーの Rust ポートと比較して 2.7 倍の速度向上を実現するとともに、出力とメモリの安全性を維持しています。

2026/10/01 7:03

機密レベルトップの衛星「URSALA」「RAQUEL」「FARRAH」

## Japanese Translation: HEXAGON LEO の20機の衛星は、1971年から2000年代初頭にかけて、軍の重要な電子偵察(ELINT)資産として機能した。当初「プログラム11」と正式名称、俗に「 hitchhikers(ひき寄せ乗り)」と呼ばれたこれらの低軌道システムは、基本的な国集情報収集ツールから、戦術的国家能力の戦術的活用(TENCAP)プログラムの導入により、直接的な戦場支援システムへと進化を遂げた。大気抵抗によって苦悩した1960年代の使い捨てモデルとは異なり、後続の機体にはレーダーサイドローブおよび未使用周波数帯の実時分析能力を備えた搭載コンピュータを搭載し、データを戦術的な地上バン、船舶、航空機に直接伝送する機能を持たせた。この機能は、1973年の中東戦争やフォークランド紛争(RAQUELを利用)の際に極めて重要な役割を果たした。主要な衛星にはURSA LA、FARRAH、GLORIA、CARRIEが含まれ、早期モデルであるMABELIやTOP HAT IIは限られた運用寿命を有する一方、FARRAH I/IIなどの機体は30年にわたり運用された。ロッキードなどによる契約業者の継続的な機能維持と、GLORIA、CARRIEといった特定のペイロード向けのスペースシャトル打ち上げへの転換が進んだ一方で、多様な打上げ車両を維持することに伴う高コストに加え、初期のシャトル打上げの後での打上げ車輛への復帰(変換したタイタンIIICBミサイル)および1回の失敗(FARRAH IV)が原因となり、プログラムは次第に退役へと向かった。1997年9月時点で、検出率は1993年の55個からわずか18個へと急落しており、プログラムの終了前から偵察産出量が著しく低下していたことが示された。最近解秘されたこれらの衛星に関する新たな重要情報が、過去2カ月以内に発表された。

2026/10/01 4:04

驚くほど複雑な波が脳の内部の働きを明らかにする

## Japanese Translation: 脳は、複雑な情報処理における基本的なモチーフとして伝播波に依存しており、単に一般的な神経活動を反映するだけでなく、空間的ナビゲーションや感覚予測を援護しています。2024 年の『Nature Human Behavior』に掲載された研究では、往復する波動が記憶の符号化と想起を支援することが示されました。また、2026 年の『Nature Communications』に掲載された Joshua Jacobs 氏(Anup Das 氏らとの共著)主導の研究では、てんかん患者に用いられる約 100 の脳内電極を用いて、同心円状のリッチルと回転する螺旋波という追加の動的パターンを特定しました。回転する波動は、より単純な言語タスクよりも複雑な空間的ナビゲーション中により頻繁に観測されるため、高度な認知機能における役割が示唆されています。数学者および生物学者である Bard Ermentrout 氏は、以前に観測された単純な「平面」状の波動は、電極配置の制限により生じた大きな複雑なパターンの部分的な視覚に過ぎなかった可能性を提唱しました。高忠実度なデータが存在するにもかかわらず、これらのパターンの完全な普遍性を捉えることは限られており、電極を設置した治療部位のみで観測が制限されている可能性があります。これに関する議論は現在も継続しており、一部の研究者(例:Earl K. Miller)はこれらの動的層が機能的に重要であると主張する一方、他の研究者(例:György Buzsáki)はそれらが基礎となるシナプス計算を反映していると論じています。異種間での研究はこの図像をサポートしており、2026 年 6 月の『Science』に掲載された研究ではマウスの大脳皮質内で鏡像され同期化した回転する波動が確認されました。また、2026 年 9 月の『Neuron』に掲載されたレビューでは、視覚野における伝播波が次に来る感覚情報を予測するのに役立っていることが強調されています。これらのパターンの機能的役割を解明することは、単なる活動記述を超えた大脳皮質処理モデルの洗練につながります。