DeepSeek V4 Flash 0731 の知能性・性能と価格分析

2026/07/31 16:59

DeepSeek V4 Flash 0731 の知能性・性能と価格分析

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

人工分析知能指数 v4.1 は、GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR の 9 つの特定ベンチマークを通じてモデルの知能を評価します。指数内で推論能力のあるモデルは電球アイコンで示されており、さらに方法論の詳細は「人工分析知能指数の方法論」にて入手可能です。一般知能に加え、指数は専門指標にも焦点を当てています:AA-Omniscience(知識の信頼性および幻覚スコアリングを -100 から 100 の範囲で実施し、正しい回答には加点、幻覚には減点とし、拒否もペナルティなしで行うもの)と Openness(正規化された 0〜100 の尺度)。コストの透明性は、トークンタイプごとの加重平均コスト(米ドル)およびタスクあたりの加重平均出力トークン数を介して提供されます。トークンタイプとしては入力、キャッシュヒット、キャッシュライト、推論、回答トークンを区別しています。オープンウェイトモデルについては、指数は総パラメータ数と推論中のアクティブなパラメータ数を区分しており、実際のリソース要件の明確化を図っています。コンテキストウィンドウの制限も報告され、特に RAG ワークフローにおいて大きなウィンドウが重要であることが示されています。本指数は Artificial Analysis によりオープンウェイトまたはプロプライエタリオプションとして提供可能です。一般知能はタスク間で転移しますが、特定のベンチマークは個別の使用事例に対してより関連性がある場合があります。これら粒度の高い指標(幻覚率、タスクあたりのコスト、パラメータ使用量、コンテキストウィンドウ制約)を追跡することにより、本指数は組織にオープンモデルとプロプライエタリモデルとの間でデータ駆動型の意思決定を可能にし、非使用の計算リソースを支払うことなく効率性・信頼性・機能的要件のバランスが取れたデプロイメント戦略の最適化を支援します。

本文

知能指標 v4.1 の概要と詳細

1. 評価項目の統合

知能指標 v4.1 は以下の 9 つの評価項目を統合しています。

  • GDPval-AA v2
  • τ³・バンキング(Tau Cubed Banking)
  • Terminal Bench v2.1
  • SciCode
  • ヒューマニティ・ラスト・エクスアム(Humanity's Last Exam)
  • GPQA ダイヤモンド
  • CritPt
  • AA-Omniscience
  • AA-LCR

注記:

  • 推論モデルは電球のアイコンで示されます。各評価の詳細や実施方法は「知能指標の実施方法」を参照してください。
  • この指標は、**オープン・ウェイト(Open Weights)またはプロプライエタリ・モデル(Proprietary Models)**の両方で利用可能です。

2. 知能評価体系

知能評価は人工分析により個別に測定され、値が高いほど優れています。特定の用途では関連性の高い指標が異なります。

AA-Omniscience 指標

  • 概要: 知識の信頼性とハルシネーション(妄想的回答)を測定します。
  • スコア範囲 (-100 ~ 100):
    • 正解: ポジティブなスコアは正解を示し、値が高いほど優れています
    • 誤答: ネガティブなスコアは誤答が正解より多いことを意味します。
    • 中立: スコアが 0 の場合は正解数と誤答数が同等です。
  • メカニズム: 正解には加点、ハルシネーションにはペナルティを課しますが、回答拒否の場合はペナルティはかかりません。

オープンネス指標(Openness Index)

  • 概要: ノーマライズされたスケール(0 ~ 100)でモデルの「開かれた性質」を評価します。
  • 評価基準: 値が高いほどより開放的です。

3. コストとパフォーマンス比較

タスクあたりの重平均コスト(米ドル)

  • 概要: 各評価項目の「知能指標の重み」に応じて加重平均された単位タスクコストです。値が低いほど優れます
  • 計算式: 以下の要素から総コストを算出し、タスク数で割り、加重平均します。
    • 入力トークン単価
    • キャッシュヒット単価
    • キャッシュ書き込み単価
    • 推論単価
    • 回答トークン単価

タスクあたりの出力トークン数

  • 概要: 1 つのタスク実行に必要な出力トークンの重平均数です。
  • 計算式: 各ベンチマークの相対的加重係数を掛け合わせ、タスク数(重複除外)で割ります。

コストセグメンテーション

  • トークンタイプ別のコスト分類を行っており、値が低いほど望ましいです。

全評価実行時の総コスト(米ドル)

  • 概要: 指標内の全評価を実行するための総額です。
  • 計算式: 各モデルの単価 × 使用トークン数(重複除外)の合計です。

4. プライシング:キャッシュヒット・入力・出力

価格表記単位: 1 ミリオントークンあたり米ドル

項目定義と特徴
キャッシュヒット以前に処理済みのプロンプト(キャッシュ化されたもの)あたりの単価。
通常の入力量程ではなく、大幅な割引が適用されます。

注意点: 上記価格はキャッシュヒット価格のみです。キャッシュ書き込み料金およびキャッシュストレージ料金は別途課金され、プロバイダーによって異なります(詳細は「プロバイダー別のキャッシュ価格設定」を参照)。


5. モデル仕様

コンテキストウィンドウ

  • 定義: コンテキストウィンドウ内のトークン制限数。
  • 重要性: 値が高いほど優れます
    • 特に大規模データの推論や、RAG(レトリバル・オーグメンテッド・ジェネレーション)ワークフローにおいて、大きなコンテキストウィンドウは極めて重要です。

モデルサイズ(オープン・ウェイトモデルのみ)

  • 指標: トータル・パラメータ数と推論時にアクティブなパラメータ数の比較。
  • 定義:
    • トレーニング中に学習された重みおよびバイアスの総数(数十億単位:Billion)。
    • モデルがデータを処理し回答を生成する能力を決定します

同じ日のほかのニュース

一覧に戻る →

2026/08/01 4:03

Hugging Face の侵入を Tailscale が阻止しなかった

## Japanese Translation: 最近のセキュリティインシデントにより、Hugging Face の AI エージェントが永続的な Tailscale 認証キーを介して侵害され、攻撃者が悪意のあるノード 181 台を生成し、Kubernetes クラスタで root アクセスを取得し、4 日間で秘密管理ストレージにある 136 キーを含むシークレットストアにアクセスできたことが明らかになりました。Tailscale そのものには脆弱性はありませんでしたが、特権の過度に付与されたエージェントが静的認証キーを使用することで、このエスケープが可能になりました。専門家は、これらを**ワークロードアイデンティティ連邦**(署名された OIDC により短期間有効なトークンを生成)または、サポートされている場合にハードウェアバインドのキーを利用するように置き換えることを推奨しています。組織もまた、エージェントがローカルテレメトリを抑制している場合でも異常を検出するために**ネットワークフローログ**を有効にすべきであり、**Tailnet Lock**などの厳格なアドミッション制御を実装する必要があります。Tailscale は文書の改善、危険なアクションに対する UI の警告の追加、デフォルト設定の微調整による将来のインシデントの防止に取り組んでおり、同社はこの点を認識しています。 --- ### 改訂サマリー(欠落していた詳細を統合): 最近のセキュリティインシデントにより、Hugging Face の AI エージェントが永続的な Tailscale 認証キーを使用して侵害される仕組みが暴露されました。攻撃者はこれらの再利用可能な認証情報を利用し、4 日間にわたり悪意のあるノード 181 台を生成し、「秘密管理ストレージの 136 キー」へのアクセスを含むシークレットを窃取しました。これは、静的なキーが「ゼロトラスト」環境であっても深刻なリスクをもたらすことを示しています。Tailscale そのものには脆弱性はありませんでしたが、デフォルトの設定により、特権の過度に付与されたエージェントが Kubernetes クラスタの root アクセスを取得することができました。このケースは、auth keys などの標準的な認証方法の危険性を浮き彫りにしており、これらは一般的ですが、継続的な AI ワークロードには不適切で不安全です。将来のエスケープを防止するため、専門家は静的認証情報を、ワークロードアイデンティティ連邦による短期間有効なトークン(または HSM の発行が利用の妨げにならない場合にハードウェアバインドのキー)に置き換えることを推奨しています。組織はまた、異常を検出するためにネットワークフローログを有効にし、動的な識別子ベースのアクセス制御へと移行する必要があります。さらに、**Tailnet Lock**による厳格なアドミッション制御の実装や、デバイスポスチャーチェックの利用によって、不明瞭なノードをより効果的に孤立させることができます。Tailscale はゼロトラストの期待にもかかわらずインシデントを引き起こしたことを認め、文書の改善、UI のナッジの追加、デフォルト設定の微調整、類似の AI 駆動によるエスケープベクトルに対する構成強化へのエンジニアリングサポートを提供することで対応することを約束しています。

2026/08/01 0:17

エレベーター

## 日本語訳: 歴史的事象シミュレーションによるエレベーターアルゴリズムの比較により、単純な反応型戦略は動的な交通状況において複雑な最適化手法よりも優れたパフォーマンスを発揮することが示されています。SCAN(1961 年に特許出願)はロビーから最上階まで移動した後で方向を反転させ、一方 LOOK は現在の方向の要求が完了する dès à présent で反転を開始し、必ずしも最上階まで到達する必要はありません。両者はどちらも中央スケジューラーに依存し、新しい要求を最も手近な稼働中のエレベーターへ割り当てます。パフォーマンスは、30 秒以内かつ 90 秒以内の到着割合といった待機時間指標で測定されます。これらの研究では、早朝ラッシュ(ロビーから上層への移動)は、一貫して特定の方向の混雑を生じるため、夜間よりも通常より悪い待機時間を引き起こすことが示されています。奥蒂斯の RSR などの高度なプラットフォームは、遅延を処理するために継続的な再最適化(5 秒ごと)を使用し、ETA、車内負荷ペナルティ、同方向への集まる回避ボーナス、方向一致ボーナス、近接アイドルボーナスといった評価要素を活用します。しかし、ベンチマーク結果では、LOOK は高流量(>7 階/分)時や小規模なビルにおいて RSR を上回る可能性があり、そのシンプルなルールが不要な停車を減らすためです。キオスクを使用した目的地割り当てシステムは、通常よりも悪い待時間を生じることが多く、この直感に反する結果は、硬直的なキオスク割り当てと、5 秒ごとの再バランスステップがその窓期内に変化する交通状況に対応できないことに起因します。極めて高層のビルで多数のエレベーターがある場合、キオスクが提供する追加情報が有益である可能性もありますが、一般的なシミュレーション結果では、完璧な効率を追求する重機的な最適化手法よりも、適応可能なルールベースの割り当てシステムを維持することで、より優れた信頼性を確保できると示唆されています。待機時間(<30 秒、<90 秒)、階数、車両数、流量(例:18/分)などの変数を実験するためのシミュレーションツールが用意されています。

2026/08/01 3:04

qm

## Japanese Translation: Quantum(QM)は、スタートアップ向けに開発された安全なマルチプレイヤージェントハネスであり、Slack と Web チャンネルと直接連携しつつ、隔離されたワークスペース内で従業員が安全にコラボレーションすることを可能にする。该平台は、耐久性のあるサンドボックス、スコープされたメモリ、そして個々のユーザーおよび共有ルーム両方に対してファイルおよびキーチェーンビューに対する厳格な制御を提供することで、重要なデータプライバシーの問題に対処しています。オープンソースの原則(MIT ライセンス)に基づいて構築され、Node 上で TypeScript と Fastify を使用して動作するヘッドレスコア API を備えた QM は、Pi、OpenCode、Codex、Claude Code など多様な AI モデルをサポートしながら、ベンダーロックインを引き起こしません。システムは、破壊的なアクションに対して硬い拒否を実装する事前宣言されたコマンドポリシーを含む 3 つの構成可能なポーズ(Strict、Auto default、Dangerous)を通じてセキュリティを確保しています。技術的には、Postgres の永続化レイヤーを利用し、デプロイは特定のディレクトリ構造(`deploy/layers/<org>/`)を介して管理され、バイト識別可能性のあるコアを組織固有のインフラストラクチャとプラグインイメージから分離します。デプロイは `qm init` CLI を使用して開始され、スキルを具現化し、GitHub の標準的なフォーク機能ではなくローカルでリポジトリをフォークすることで、組織がコードベース全体を秘密に保つことを可能にします。さらに、QM は内部データの漏洩を厳格に防止しながらアップストリームの変更をマージする特定のスキル(`update-qm` および `upstream-pr`)を通じて継続的な更新を促進します。また、プラットフォームはカスタム内部 Web アプリ、Git リポジトリから共有可能なスキル、cron を介したバックグラウンドプロセス、および管理制御をサポートしています。ドキュメントは `docs/getting-started.md` などの主要なマークダウンファイルで利用可能です。最終的には、QM はデータの完全性やセキュリティを損なうことなく、スタートアップがプライベートプロジェクトにおける強固なコラボレーションを実現できるようにし、AI を活用する方法を変革します。

DeepSeek V4 Flash 0731 の知能性・性能と価格分析 | そっか~ニュース