Qwen3.8 27B は人工知能分析でスコア 52 を獲得

2026/08/18 2:25

Qwen3.8 27B は人工知能分析でスコア 52 を獲得

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Summary:

人工分析知能インデックス(AI Analysis Intelligence Index)v4.1.1 は、9 つの異なる性能評価を統合するよう設計された、AI モデルを評価するための統一されたフレームワークを提供します。その最も重要な特徴は、導入前にモデルの能力、費用対効果、コンテキストウィンドウ数やパラメータ数といった技術仕様を測定する標準化された指標を提供することです。オープンウェイトモデルと有料商業ライセンスが必要なモデルとの区別により、ユーザーが迅速にライセンス要件を特定できるようになっています。高度な推論機能を備えたモデルは特別な電球アイコンで強調表示され、知識の信頼性とハルシネーション(スコア:-100 から 100)を対象とした AA-Omniscience インデックスと、開示性(スコア:0 から 100)を対象とした Openness インデックスという別個のインデックスが、正規化された尺度での比較を可能にしています。さらに、このフレームワークはキャッシュヒットに対する割引を含む価格帯を含めた微妙なコスト構造の詳細を提供し、推論中に使用されるモデルパラメータの総数とアクティブパラメータを区別することにより技術アーキテクチャを明確にし、特に Mixture of Experts 設計の特徴を注記しています。結局のところ、この包括的なベンチマークツールは、Retrieval-Augmented Generation(RAG)などのワークフローのための情報に基づいた導入決定を行うことを可能にし、特定のニーズに対して最も信頼性が高く費用対効果の優れたソリューションを選択するよう保証します。

本文

AI 分析知能指数 Ver. 4.1.1

概要

AI 分析知能指数(Artificial Analysis Intelligence Index)Ver. 4.1.1 は、以下の 9 つの指標を統合してモデルの性能を評価します。

  • GDPval-AA v2
  • 𝜏³-Banking
  • Terminal-Bench v2.1
  • SciCode
  • Humanity's Last Exam
  • GPQA Diamond
  • CritPt
  • AA-Omniscience
  • AA-LCR

注釈:

  • リアゾニングモデル(推論能力に特化したモデル)は、記事内に電球アイコンで示されています。
  • 各評価の詳細および実施方法については、「知能指数手法(Intelligence Index methodology)」をご参照ください。

オープンウェイト/プロプライエタリモデル向け評価

人工分析社が独立して測定する知能評価です。数値が高いほど優れた性能を意味します。 シートおよびドキュメント向けの定量的分析において、特定の用途に適合した評価項目を選ぶことが推奨されます。

主要指標一覧

  1. GDPval-AA v2
  2. 𝜏³-Banking
  3. Terminal-Bench v2.1
  4. SciCode
  5. Humanity's Last Exam
  6. GPQA Diamond
  7. CritPt
  8. AA-Omniscience
  9. AA-LCR

個々の評価項目の詳細

AA-Omniscience(AA-全知性指数)

AI 分析知能指数 Ver. 4.1.1 に含まれる指標の一つです。

  • 定義: 数値が高いほど信頼性の高い知識を意味し、ハルシネーションが少ないことを示します。
  • 採点ルール:
    • 正解: 加点
    • ハルシネーション: 減点
    • 回答見送: 罰則なし
  • スコア範囲: $-100$ から $100$ の間。
    • $0$: 正解数と誤答数が同数
    • 負値: 誤答の方が多くなる

オープンネス指数

モデルの開放性を評価する指数です。

  • スケール: $0$ から $100$ の正規化されたスケール。
  • 解釈: 数値が高いほど開かれていることを意味します。

知能指数比較分析

1. 知能指数タスク単価との対比

人工分析知能指数・加重平均コスト(USD)

  • 計算式: 入力トークン、キャッシュヒット/ライト、推論、回答トークンの単価を合計し、タスク数で割った後、「知能指数における重み」に応じて加重平均計算。

2. トークン使用量

1 つの AI 分析知能指数タスクあたりの出力トークン数

  • 計算式: 各評価項目ごとの出力トークン数を相対的な重みで乗算し、タスク数(重複を除く)で割る。

3. コストパフォーマンス

AI 分析知能指数タスク単価別コスト(USD)

  • タイプ別区分: 入力、キャッシュヒット、キャッシュライト、推論、回答トークン。
  • 解釈: 数値が低いほど優れたコストパフォーマンスです。

4. 全評価の実行コスト

AI 分析知能指数におけるすべての評価を実行するためのコスト(USD)

  • 内容: モデルの単価(入力、キャッシュ、推論、回答)と、各評価項目で消費されたトークン数(重複を除く)を組み合わせた総コスト。

料金詳細

キャッシュヒット・入力・出力価格

価格(100 万トークンあたりの USD)

  • キャッシュヒット: 以前処理済みのプロンプトに対する単価で、通常の入力価格に比べ大幅な割引が適用されます。
    • : 表示される値はキャッシュヒット時の単価です。
  • 別途課金: キャッシュライトおよびキャッシュストレージの料金は別途発生します(プロバイダーにより異なります)。
    • [「プロバイダーごとのキャッシュ料金」を参照]

モデル仕様

コンテキストウィンドウ

コンテキストウィンドウ:トークン上限数

  • 解釈: 数値が高いほど優れた性能
  • 重要性: 大量のデータ retrieval 推論や RAG(Retrieval Augmented Generation)ワークフローにおいて特に重要です。

モデルサイズ(オープンウェイトモデルのみ対象)

モデルサイズ:総パラメータ数および推論時アクティブパラメータ数

  • 定義: モデルの全パラメータ数と、推論時に実際に活用されるパラメータ数の比較です。

総パラメータ数 (Total Parameters)

  • 概要: モデル内に存在する学習可能な重みおよびバイアスの総数(十億単位:Billion)。
  • 役割: 訓練を通じて習得され、処理能力及び回答生成能力を決定します。

アクティブパラメータ数 (Active Parameters)

  • 概要: 各推論フォワードパスで実際に実行されるパラメータの数(十億単位:Billion)。
  • モデルによる違い:
    • Mixture of Experts (MoE): ルーター機構が専門家のサブセットを選択するため、アクティブパラメータ数は総パラメータ数よりも少なくなります
    • Dense モデル: 全パラメータを使用するため、両者の値は等しくなります

同じ日のほかのニュース

一覧に戻る →

2026/08/18 2:54

Rust の GPU オフロード:ポータブルで安全かつ高速

## 日本語の翻訳: 要約: 最も重要な進歩は、Rust および LLVM に組み込まれた新しいゼロオーバーヘッド GPU コンパイルフレームワークであり、これは高実行速度とメモリー安全性という歴史的なトレードオフを成功裏に解消します。従来、開発者は効率性のために不安全な生ポインタを選択するか、NVIDIA や AMD などの単一ハードウェアプロバイダーに縛られるベンダー固有の言語に依存する别无選択でした。この解決策は、Rust の厳格な型システムと所有権規則を活用してデータ転送を安全に管理し、LLVM のオフロードインフラストラクチャおよび専門的な 2 パスコンパイルパイプラインを利用することで、複雑なメモリー移動やクロスベンダー間フェースの不整合を自動的に処理することにより、このジレンマを解消します。その結果、ユーザーは現在、危険な unsafe ブロックを使用せずに、またはプロプライエタリなドメイン固有言語に依存せずに、高パフォーマンスの GPU コードを書くことができます。RAJAPerf ベンチマークでの初期評価では、システムが GPU カーネルに対して競合する中間コードを生成しており、これによりネイティブで手動最適化された C++ ソリューションと同等かそれ以上の性能を発揮できる可能性があります。この統一アプローチにより、企業はデータ転送を最適化しながらも、セキュリティと異なるハードウェアベンダーへの移植性を維持することが可能になります。

2026/08/17 22:46

DuckDB v2.0 のプレビュー

## Japanese Translation: DuckDB v2.0、コードネーム「Cyanoptera」は、単独の分析ツールから、複雑なトランザクションワークロードを処理できる堅牢なマルチテナントサーバープラットフォームへの中道的変化を象徴しています。この大規模なアップグレードでは、`quack` エクステンションによるネイティブクライアント/サーバーアーキテクチャ、同時操作時のデータ完全性を確保するためのフル MVCC サポート、および従来のエンジンに代わるモダンな PEG ベースのパーサーを中心とした破壊的変更が導入されました。優れたパフォーマンスを実現するために、このリリースは遠隔接続を高速化するための非同期 I/O および、ファイル全体をスキャンせずともデータインデックスへの即座アクセスを可能にするストレージ v2.0 のような最適化されたストレージフォーマットを採用しています。技術的には、タイムゾーン論理をコアシステムに埋め込み、ICU などの外部ライブラリへの依存を排除し、宣言的な YAML 仕様から生成される安定した C API を導入しました。ユーザーはバッファー管理を必要とする新しいデフォルトストレージ方式への適応が求められますが、その対価は大きいです:組織は、PostgreSQL などの多様なデータベースに対してプッシュダウン最適化を適用した統合リモートクエリを実行でき、信頼できるローカルエクステンションリポジトリによる強化されたセキュリティを楽しむことができ、SQL レベルのトリガーや `VARIANT` タイプ、ベクトル検索機能など高度な機能を活用できるようになりました。

2026/08/17 23:18

生成 AI を使用した GitHub Copilot の「自動修正」機能で、Snowflake の Jira が侵害された件

## 日本語翻訳: # ルール - 元の意味を正確に保ってください(追加・省略なし)。 - 文書構造(見出し、箇条書きなど)を維持してください。 - 技術用語は正確に保ってください(API、LLM、zero-trust は自然な日本語がある場合を除いてそのまま使用)。 - トーンと確信度を維持してください。 - まとめ、説明、改変を行わないでください — 翻訳のみを実行してください。 # 出力形式 ## 日本語翻訳: (ここに日本語翻訳を記述します) ## 翻訳対象のテキスト: 改善は不要です — このサマリーは、推論や曖昧さを加えずにすべての主要点を正確かつ明確に反映しています。