Qwen3.8-2.4T

2026/08/13 0:01

Qwen3.8-2.4T

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

概要:

Qwen3.8 は、複雑なコーディング、研究、および自律エージェントタスクにおいて優れた性能を発揮する、強力かつオープンにリリースされた Qwen-Max クラスのモデルを導入します。このモデルは、Gated DeltaNet と Expert ミックスを組み合わせる高度なアーキテクチャに基づいて構築されており、全パラメータ数が 2.4T(有効活用パラメータ数 95B)、コンテキストウィンドウは最大 100 万トークンまで拡張されています。柔軟な思考制御、調整可能な推論深さ、および複雑なエージェントワークフロー用の履歴コンテキストの保持といった機能を備えています。リリースには、コーディングとエージェントタスクにおける詳細なベンチマーク検証が含まれ、最適なサンプリングパラメータおよびサービスエンジン構成(例:vLLM、SGLang)に関する具体的なガイドラインも提供されており、即時の生産環境での展開を可能にします。

本文

Qwen3.8-Max:コード生成と自律的エージェントの新たな基準

このリポジトリには、Hugging Face Transformers フォーマットでの事前学習済みモデルの重みと設定ファイルが含まれています。これらのアセットは、vLLM や SGLang、TokenSpeed などのフレームワークと互換性があります。

公式 Qwen Cloud が提供する Qwen API サービスを利用することで、インフラストラクチャの維持管理なしでマネージドかつスケーラブルな推論を実現できます。 特に、Qwen3.8-Max は以下の正式バージョンです:

  • Qwen3.8-2.4T-A95B ベース
  • 画像入力対応や思考プロセスの実行可能化などのより多くの機能を備えている
  • デフォルト 1M トークンのコンテキスト長をサポートしている
  • 公式内蔵ツールを装備している

詳細については、「Qwen3.8-Max Overview」 を参照してください。


Qwen3.8 の発表背景と概要

コミュニティにおける Qwen3.5 および Qwen3.6 シリーズの受容性を背景に、今日まで Qwen オープンモデルファミリーで最も能力の高い生成モデルである Qwen3.8が発表されました。

  • 画期的なリリース: 初めてオープンリリースで Qwen-Max クラスのモデルをもたらします。
  • 技術的基盤: Qwen3.5 のアーキテクチャを基盤としています。
  • 適用分野: コーディング、専門業務、研究、長期ホライズンのエージェントタスクなどで大幅な成果を達成します。

ハイライト:強化機能

Qwen3.8 は以下の機能を備えています:

  • コア能力: コーディング、専門業務、研究、長期ホライズンのエージェントタスク全体での包括的な向上。
  • エージェント実行: より強力な自律的な計画立案と環境フィードバックへの効果的な処理により、エンドツーエンドのタスク完了の信頼性が向上します。
  • ダウンストリーム互換性: 人気のあるフレームワークと開発ツールへの広範なサポートにより、既存のスタックへの統合を容易にします。
  • フレキシブルな思考制御:
    • reasoning_effort
      を用いて推論の深さを微調整可能。
    • preserve_thinking
      で履歴メッセージからの推論コンテキストを保持可能。

詳細については、当社のブログ投稿「Qwen3.8-Max」を参照してください。


モデル概要

項目内容
タイプ因果的言語モデル (Causal Language Model)
学習段階事前学習 & 事後学習
パラメータ数全計 2.4T、アクティブ 95B
隠れ次元8192
トークン埋め込み248,320 (パディング済み)
レイヤー数92
隠れ配置
23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))

詳細仕様

  • Gated DeltaNet:
    • リニアアテンションヘッド数: V 用 128、QK 用 16
    • ヘッド次元: 128
  • Gated Attention:
    • アテンションヘッド数: Q 用 64、KV 用 4
    • ヘッド次元: 256
    • ロタリー位置埋め込み次元: 64
  • Mixture of Experts (MoE):
    • エキスパート数: 512
    • アクティブなエキスパート数: ラウティング用 10 + シェアード用 1
    • エキスパート中間次元: 2048
  • LM Output: 248,320 (パディング済み)
  • MTP (Multi-Token Prediction): 複数ステップで学習済み
  • コンテキスト長:
    • 本来:262,144 トークン
    • 最大:1,010,000 トークンまで拡張可能

ベンチマーク結果

評価基準OpusFableGPT-5.6 SolQwen3.7-MaxQwen3.8-Max
コーディングエージェント
Terminal Bench 2.184.6 / 84.6 / 88.8 / 74.5 /86.6
SWE-bench Pro69.2 / 80.0 / 64.6 / 60.6 /67.7
DeepSWE 1.159.0 / 70.0 / 73.0 / 21.6 /56.6
NL2Repo-Bench69.4 / -- / -- / 47.2 /55.9
FrontierSWE70.0 / 88.8 / -- / 40.7 /73.5
MLS-Bench-Lite42.8 / 49.9 / 46.2 / 31.7 /41.0
PaperBench80.3 / 88.8 / 90.5 / 64.8 /93.0
AndroidBench69.8 / 84.5 / 74.0 / 56.5 /75.1
QwenSWEBench84.0 / 86.3 / 73.5 / 63.4 /80.7
QwenQoderBench62.7 / 63.1 / 53.8 / 36.8 /58.4
QwenReactBench1694 / 1770 / 1564 / 1538 /1724
QwenSVGBench1648 / 1690 / 1758 / 1499 /1713
一般エージェント
CoWorkBench72.3 / 75.9 / 71.5 / 64.6 /74.8
WorkSpaceBench66.8 / 68.7 / 65.6 / 61.4 /67.7
JobBench48.4 / 57.4 / 45.4 / 31.3 /53.4
SkillsBench65.1 / 70.9 / 73.5 / 61.2 /70.2
Agents' Last Exam27.0 / 45.1 / -- / 30.6 /27.0 / 52.4
Automation-Bench (Pass@1)27.2 / 29.1 / 29.7 / 14.2 /27.3
Toolathlon Verified (Pass@1)76.2 / 77.9 / 74.9 / 49.7 /72.5
WideSearch72.9 / 81.2 / -- / 75.2 /81.9
HLE w/ tools57.9 / 64.5 / 58.0 / 53.5 /56.2
一般能力
GPQA Diamond92.0 / 92.6 / 94.1 / 92.4 /92.6
HLE45.7 / 53.3 / 47.2 / 41.4 /43.6
IFBench62.2 / 63.5 / 72.7 / 79.1 /82.8
$OneMillion-Bench (expert)41.8 / 55.9 / 53.8 / 44.4 /52.5
HealthBench52.4 / -- / 55.3 / 54.5 /60.2
PLawBench69.6 / 70.2 / 72.3 / 58.9 /73.2
PRBench-Legal52.7 / 57.6 / 57.6 / 48.5 /57.6
PRBench-Finance51.9 / 55.8 / 55.5 / 46.8 /58.3
MRCR v2 256K (8-needle)83.2 / -- / 93.8 / 86.7 /92.9
LongBench v269.1 / -- / 67.1 / 65.3 /66.3

※ 注記:

  • Fable 5 の結果にはフォールバックが含まれる可能性があります。
  • Terminal Bench 2.1 は Claude Code (avg@10) を使用して評価され、5 時間のタイムアウトおよび
    max_tokens=131,072
    が設定されています。
  • 「--」は公式の MEAN@5 結果が該当時点(2026 年 8 月 3 日)までに利用できなかったことを示します。

クイックスタート

統合の簡素化のために、API を通じて Qwen3.8 を使用することをお勧めします

提供 (Serving)

推論効率およびスループットはフレームワークによって大きく異なります。最適なパフォーマンスと互換性を確保するために最新バージョンのフレームワークの使用をお勧めします。 プロダクションワークロードや高スループットシナリオには、専用サービングエンジンである SGLangvLLMTokenSpeed の使用が推奨されます。

Qwen3.8 は以下の人気の推論フレームワークでデプロイ可能です:

API 利用法

重要な制限事項

重要: Qwen3.8-2.4T-A95B はテキストのみモデルであり、以下の点にご注意ください:

  • すべてのインタラクションに思考モードが必要です
  • マルチモーダル入力はサポートされていません
  • 思考プロセスを無効化することはできません
  • すべての応答は、最終出力の前に
    </think>...</think>
    のように囲まれた推論で自動的に始まります。

サンプリングパラメータ

生成のための以下のサンプリングパラメータセットを使用することを推奨します:

temperature=1.0,
top_p=0.95,
top_k=20,
min_p=0.0,
presence_penalty=0.0,
repetition_penalty=1.0

注意:サンプリングパラメータのサポートは推論フレームワークによって異なります。

推論制御 (
reasoning_effort
)

Qwen3.8 は公式に

reasoning_effort
をサポートしており、これを使用して推論の深さを調整しコストを制御できます:

  • xhigh (デフォルト): 徹底的な分析が必要な複雑なタスク用
  • medium: 精度と速度のバランス
  • low: 速度とコストの最適化向け

また、すべてのワークロードで

preserve_thinking
デフォルトで有効になっています。

Chat Completions API での実装例

Chat Completions API は、多くの推論フレームワークおよび Qwen Cloud とともに使用できます。開始前に、OpenAI Python SDK がインストールされており、API キーと API ベース URL が設定されていることを確認してください(例:

pip install -U openai
)。

その後、以下の環境変数を設定します:

export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'

Python コード例:

from openai import OpenAI

# 環境変数で構成されるクライアントを作成
client = OpenAI()

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,   # デフォルト有効; 無効にしないべき
            "preserve_thinking": True, # デフォルト有効
        },
    },
    reasoning_effort="xhigh",        # デフォルト xhigh; サポートレベルは xhigh, medium, low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    # 推論コンテンツの出力処理
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    # 回答コンテンツの出力処理
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

# Qwen Cloud の API を使用する場合、以下のように設定してください:
# extra_body={"enable_thinking": True, "preserve_thinking": True}

最佳の手法 (Best Practices)

最適なパフォーマンスを実現するために以下の設定をお勧めします。

サンプリングパラメータの詳細調整

推奨セット:

temperature=1.0
,
top_p=0.95
,
top_k=20
,
min_p=0.0
,
presence_penalty=0.0
,
repetition_penalty=1.0

  • Endless Repetition の削減: サポートされているフレームワークでは、
    presence_penalty
    パラメータを 0 から 2までの範囲で調整することで可能です。
    • ただし、高い値を使用すると、言語の混在やモデルパフォーマンスのわずかな低下につながる可能性があります。

適切な出力長さの設定

エージェントタスクのパフォーマンスを最適化するために、詳細かつ包括な応答を生成できるように十分な出力長を割り当てることをお勧めします。

フレームワークが内部推論と最終出力に別々のトークン制限をサポートする場合、以下の構成(1M コンテキスト長内)を推奨します:

  • 推論コンテンツ: 最大出力長を 262,144 トークン に設定
  • 最終レスポンス: 最大出力長を 131,072 トークン に設定

これらの設定は、複雑な推論に必要な容量を提供しつつ、高品質な最終成果物のための十分なスペースを確保します。


引用

当社の仕事が有益であると感じる場合は、引用をご自由にしてください。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}

同じ日のほかのニュース

一覧に戻る →

2026/08/13 1:04

DeepSeek V4 プロ 0813

## Japanese Translation: 現時点でソーステキストが提供されていないため、コンテンツ固有のポイントに焦点を当てた 120 から 200 ワード程度の要約を作成することはできません。要約をご希望の記事、抜粋または文書をお提供ください。受け取った段階で、主要なメッセージを抽出し、技術用語を定義するとともに、最も重要な洞察を最初に提示することで明確性と関与性を確保します。元の論旨を反映しつつ外部の意見や逸話を追加することなく、簡潔な概要を提供することが目標です。素材をご共有いただくことで、すぐに作業を進めることができます。

2026/08/13 3:19

デルタ

## Japanese Translation: Delta は、今日より公開のプライベートベータ招待状付きの画期的な新世代マルチプレイヤーコーディング環境です。人間と AI エージェントの双方に対してコードと対話をリアルタイムで緊密に連携させるよう、専用設計されています。既存のワークフローを阻害する従来のツールとは異なり、Delta は Zed や Git といった現在の開発環境の隣に立ち、数百万人の毎日のユーザーのワークフローを乱さないよう、Zed に機能を追加するのではなく新規アプリケーションとして構築された専用コンパニオンです。Rust ベースの技術、WebAssembly、WebGL を活用することで、ローカルのインストールなしでどのブラウザ内でも開発者と AI エージェントが協働することを可能にしています。 本プラットフォームは、カスタムデータベース「DeltaDB」を用いて、対話とワークツリーをリアルタイムで即座に複製し、招待されたすべてのファーストクラス参加者に同期させることで、リモートコラボレーションにおける決定的なギャップを解消します。チームはワンクリックでメンバーを招待でき、プライベートスレッドは招待された者だけに共有されるため、クラウドランナーによるバックアップによりローカルデバイスが閉じられていてもコードと対話が同期して維持されます。注釈は、著者(人間またはエージェント)や時間を問わずコード行や対話ステップに正確にアンカーされ、プロジェクトが進化する過程で陳腐化することを防ぎます。Delta はフルディフ、全体トランスクリプトを表示し、モデル速度でコンテンツをレンダリングし、対話をナビゲ可能なドキュメントとして扱うことで、ユーザーは任意の場所(ディフ、プラン、思考ブロックなど)にカーソルを置けば、正確な意図をもってコメント付けられます。今後のアップデートによりさらに機能は拡張されますが、究極的には Delta は、既存の Git リポジトリと第 3 者のエージェントハネス(例:Claude Code)とのシームレスな統合を通じて、端末セッションを実時間同期して共同レビューを行うことで、プライバシーを維持しながら透明性のあるナビゲ可能な対話履歴を実現し、チーム全体の課題解決効率を大幅に向上させることを可能にします。

2026/08/12 23:22

Tailscale のトレースデータベースが、16 歳向けの SQLite WAL リセットバグに汚染されました。

## Japanese 翻訳: Tailscale は、SQLite の希少な、16 年間にわたるバグである「WAL-Reset bug」により引き起こされた深刻なデータベース腐敗の 6 ヶ月を解決することに成功しました。この問題は、標準的なオープンソースソフトウェアが Tailscale の非標準的手動チェックポイント構成下で機能不全に陥った際に発覚し、しばしば退屈とみなされる技術内に潜んでいた欠陥を露呈させました。修正には、Tailscale のエンジニアとコア SQLite 開発者の間での唯一の協力が求められ、ソースコードへのパッチ適用と同時に内部設定を調整して特定の丸め動作を排除する必要がありますでした。エンジニアらは、「tmstmpvfs shims」(シミュレートされたファイルシステム)というフォレンジックツールを用いてデータレースを分離し、初期パッチが失敗した後にタイムスタンプの精度を浮動小数点数テキストから整数秒に切り替えました。2 ヶ月のカニアリーロールアウトで安全性が確認された後、Tailscale は 4 ヶ月間インシデントフリーで稼働しています。この事例は、類似のデータベース構成に依存する他の組織に対する重要な警告であり、手動最適化機能は複雑な長期リスクを招くことがあり、深刻な問題の解決には公式アップデートを待つだけでなく、アプリケーションチームとメンテナンス担当者の共同努力が必要であることを示しています。