
2026/08/15 0:00
Qwen 3.8 27B
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Qwen3.8 は、コーディング、プロフェッショナルなワークフロー、研究、長期的なエージェントタスクにおいて大幅な性能向上をもたらす、Qwen3.5 の機能に継承する最新オープンモデルです。コンパクトな Qwen3.8-27B バリエーションは、複雑な多段階実行のためのネイティブのビジョン・ランゲージ理解を備えています:STEM 図や数時間の動画を処理し、環境からのフィードバックを取り扱い、
preserve_thinking を介して履歴メッセージにわたる思考を保持します。性能は、SWE-bench Pro で 61.7、Terminal Bench 2.1 (Terminus) で 73.0、LiveCodeBench v6 で 90.3、OSWorld-Verified で 84.3、MathVision および OmnilDocBench で 90% 超のスコアを含む強力なベンチマーク結果によって検証されています。
アーキテクチャにおいて、モデルは YaRoPE スケーリングによる拡張性を通じてネイティブに 262k トークンのコンテキストウィンドウをサポートし、最大 100 万トークンまで拡張可能です。
enable_thinking(デフォルトでオン)と reasoning_effort(xhigh/medium/low)によって制御される柔軟な推論モードを提供します。推奨サンプリングパラメータはモードごとに異なります:思考モードでは temperature=1.0、top_p=0.95、top_k=20、min_p=0.0 を使用し、指示モードでは temperature=0.7、top_p=0.80、presence_penalty=1.5 を使用し、思考を無効にするためのオプションの追加ボディ調整が可能です。
本番デプロイメントは、SGLang、vLLM、TokenSpeed、Qwen Cloud API との互換性を通じて簡素化されており、高スループットシナリオには専用サービングエンジンが推奨されます。数時間のビデオ処理については、
video_preprocessor_config.json の longest_edge を 469,762,048(224k ビデオトークン)に設定します。全体として、Qwen3.8 は深い歴史的文脈と長期間にわたる自律的な意思決定を可能にし、既存の画像/ビデオ分析パイプラインとシームレスに統合されます。本文
Qwen3.8 リリース:史上最高性能の生成モデルと FP8 量子化モデル情報
Hugging Face Transfomers フォーマットのポストトレーニング済みモデルに関する FP8 量子化モデルの重みと設定ファイルが提供されています。
アセットと互換性
- 対応フレームワーク: Hugging Face Transformers、vLLM、SGLang、TokenSpeed と互換性があります。
- 量子化手法: ブロックサイズ 128 の フィナー粒度(fine-grained)FP8 量子化を採用しています。
- パフォーマンス: オリジナルモデルにほぼ同等のパフォーマンスを維持しています。
Qwen Cloud アナウンスメント
インフラストラクチャのメンテナンスなしで、マネージドかつスケーラブルな推論機能を求めるユーザー向けに、Qwen Cloud から公式 API サービスが提供されます。
- 対象モデル: 特に Qwen3.8-27B は、より本番環境に適した以下の機能を備えたホスト済みバージョンとして利用可能です。
- デフォルトで 100 万トークンのコンテキスト長
- 公式標準搭載ツール
- ステータス: 近日公開予定です。
Qwen3.8 モデル概要
Qwen オープンモデルファミリー史上最高性能の生成モデル「Qwen3.8」をリリースいたします。Qwen3.5 のアーキテクチャ基盤に基づき、コーディング、専門業務、研究、および長期的代理タスクなどあらゆる領域において 顕著な性能向上を達成しています。
Qwen3.8-27B は、これらの進歩をコンパクトかつ展開に最適な高密度モデルへ実装した、画像や動画をネイティブに理解し、思考制御が柔軟で複雑な多段階タスクの完了まで信頼性を持って導く ナイスビジョン・ランゲージモデルです。
機能強化ハイライト
Qwen3.8-27B は以下の機能を備えています:
- コア能力: コーディング、専門業務、研究、および長期的代理タスクにわたる包括的な改良。
- エージェント実行: 自律計画能力及び環境フィードバックの処理能力が向上し、エンドツーエンドタスク完了の信頼性が飛躍的に向上しました。
- 下流互換性: 一般的なハネスや開発ツールのサポート範囲が広がり、既存のインフラへの統合が容易になりました。
- 柔軟な思考制御:
- 思考モードはデフォルトで有効であり、ご要望により無効化可能です。
- 推論深さは
で調整できます。reasoning_effort - 履歴メッセージからの推論コンテキストは
を通じて保持されます。preserve_thinking
- ビジョン・ランゲージ理解: STEM の図解や文書から時短単位動画に至るまで、画像および動画の理解をネイティブサポートしています。
モデル仕様詳細
| 特徴 | 説明 |
|---|---|
| タイプ | ビジョンエンコーダーを備えた因果言語モデル |
| トレーニング段階 | プレトレーニング & ポストトレーニング |
| パラメータ数 | 27B |
| 隠れ次元 | 5120 |
| トークン埋め込み | 248,320(パディング済み) |
| 層数 | 64 |
| 隠れレイアウト | $16 \times (3 \times (\text{Gated DeltaNet} \to \text{FFN}) \to 1 \times (\text{Gated Attention} \to \text{FFN}))$ |
| Gated DeltaNet | V 用に 48、QK 用に 16 の線形アテンションヘッド、ヘッド次元:128 |
| Gated Attention | Q 用に 24、KV 用に 4 のアテンションヘッド、ヘッド次元:256、ロータリー位置埋め込み次元:64 |
| フィードフォワードネットワーク | 中間次元:17,408 |
| LM 出力 | 248,320(パディング済み) |
| MTP (マルチトークン予測) | 複数ステップでトレーニング済み |
| コンテキスト長 | ネイティブに 262,144 トークン、最大 1,000,000 トークンへ拡張可能 |
ベンチマーク結果
テキスト性能比較
| メトリック | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
|---|---|---|---|---|---|
| コーディング | |||||
| 代理ターミナルコーディング (Terminal Bench 2.1) | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| 代理コーディング (SWE-bench Pro) | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 |
| リポジトリレベルコード生成 (NL2Repo-Bench) | 42.3 | 36.2 | 41.1 | -- | 47.6 |
| 代理コーディング (DeepSWE 1.1) | 42.2 | 13.3 | 14.2 | -- | -- |
| ソフトウェアエンジニアリング (QwenSWEBench) | 79.0 | 49.3 | 59.2 | -- | 63.8 |
| エージェント | |||||
| 長期的オフィスワーク (CoWorkBench) | 70.7 | 61.0 | 65.1 | -- | 68.2 |
| プロフェッショナル職務タスク (JobBench) | 33.4 | 21.8 | 27.6 | -- | -- |
| フロンティア代理タスク (Agents' Last Exam) | Pass@1: 20.4, Score: 42.9 | Pass@1: 10.6, Score: 27.3 | Pass@1: 13.2, Score: 33.6 | -- | -- |
| 一般 | |||||
| インストラクション遵守 (IFBench) | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| 科学的推論 (GPQA Diamond) | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
| 学際的推論 (HLE) | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 |
| コンテストコーディング (LiveCodeBench v6) | 90.3 | 83.9 | 89.6 | -- | 88.8 |
テキストベンチマーク評価条件
- SWE-bench Pro: Opus4.6 Max のみ公式報告値を使用しており、残りのモデルはすべて
,temp=1.0
, コンテキストウィンドウ 256K で Claude Code ハネスを用いて評価されました。top_p=0.95 - NL2Repo-Bench: Claude Code ハネスを用いて評価されました。
,pip download
,pip install
など特定のレポジトリにアクセスしようとする Bash コマンドは無効化されています。git clone - DeepSWE 1.1:
,temp=1.0
, コンテキストウィンドウ 256K で Claude Code ハネスを用いて評価されました。top_p=0.95 - QwenSWEBench: モデルのソフトウェアエンジニアリング能力を評価するための社内コーディングベンチマークです。Claude Code ハネスを用いて評価され、
(8 時間タイムアウト、max_tokens=32,768、temperature=1.0、コンテキストウィンドウ 256K)が報告されました。avg@3 - CoWorkBench: コンピュータサイエンス、金融法、医療など複数の生産性ドメインにおける長期的タスクを評価するための社内共働ベンチマークです。
- HLE: GPT-4o による判定モデル。
- 各行の最良の結果は太字で示されています(元ソースに基づく)。空白セル (
) は結果が未公開または該当しないことを示します。--
VL(ビジョン・ランゲージ)性能比較
| メトリック | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
|---|---|---|---|---|---|
| 代理マルチモーダル知能 | |||||
| コンピュータ使用 (OSWorld-Verified) | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
| ブラウザ使用 (WebArena-Verified) | 64.8 | 48.8 | 55.3 | -- | -- |
| モバイル使用 (AndroidWorld) | 81.9 | 70.3 | 81.0 | -- | 62.0 |
| アプリケーション再現 (RecreationBench) | 47.1 | 29.8 | 30.2 | -- | -- |
| マルチモーダルツール使用 (ClawEval-MM) | Pass@3: 57.4, Avg: 56.9 | Pass@3: 42.6, Avg: 50.4 | Pass@3: 57.4, Avg: 60.1 | -- | Pass@3: 52.5, Avg: 54.7 |
| マルチモーダルソフトウェアエンジニアリング (SWE-MM) | 38.6 | 25.7 | 30.0 | -- | 27.1 |
| 視覚ウェブ開発 (Vision2Web) | 62.9 | 45.0 | 42.1 | -- | -- |
| 一般マルチモーダル知能 | |||||
| 視覚数学問題解決 (MathVision) | Without CI: 90.0, With CI: 94.6 | Without CI: 85.1 | Without CI: 90.3 | -- | Without CI: 65.5 |
| 一般視覚推論 (BabyVision) | Without CI: 65.7, With CI: 85.6 | Without CI: 28.9, With CI: 70.4 | -- | Without CI: 12.6 | -- |
| 科学チャート分析 (CharXiv RQ) | Without CI: 83.7, With CI: 90.2 | Without CI: 78.4, With CI: 85.9 | 78.8 | Without CI: 66.0 | -- |
| ドキュメント知能 (OmniDocBench 1.5) | 91.1 | 89.4 | 91.4 | 75.8 | 86.6 |
| リアルワールド知覚 (RealWorldQA) | 85.9 | 84.1 | 86.9 | -- | 73.9 |
| 具現知能 (ERQA) | 65.5 | 62.5 | 69.8 | -- | 40.8 |
VL ベンチマーク評価条件
- MathVision, BabyVision, CharXiv (RQ): 両方の設定が利用可能な場合、セルは "Without CI" と"With CI" を別々に報告し、そうでない場合は利用可能な設定のみが表示されます。MathVision および CharXiv (RQ) における少数の誤った地面真実注釈は手動検証後に修正され、これらのベンチマーク上のすべての報告スコアは修正された注釈を使用して計算されました。
- MathVision: Qwen3.8-27B は固定プロンプト「Please reason step by step, and put your final answer within \boxed{}。」を使用して評価されました。残りのモデルについては、\boxed{} 書式要件を含むものと含まないものの両方のプロンプト変体のうち高いスコアを報告します。
- WebArena-Verified: OSWorld のスケルファットの下で公式 WebArena-Verified グラダーを使用してスコアが計算されました。
- RecreationBench: デスクトップ(Ubuntu, macOS, Windows)、モバイル(Android)、およびウェブという 5 つのプラットフォームにおけるハイブリッドエージェント能力を評価するために設計された社内長期的アプリケーション再現ベンチマークです。
- ClawEval-MM: スコアは「Pass@3 / 平均スコア」として報告されます。Pass@3 は 3 回の試行のうち少なくとも 1 回でタスクが通過した割合を、平均スコアは 3 回の試行全体のベンチマークスコアの平均値を表します。
- Vision2Web: スコアはフロントエンド、ウェブページ、ウェブサイトのカテゴリ全体で平均化されます。評価には Claude Code ハネスが使用され、判定は gpt-5.4-2026-03-05 によって行われます。
- SWE-MM: スコアは SWE-bench Multimodal の公開開発分割を使用して、Claude Opus 4.7 システムカードの附録 8.3 に記述された修正を用いて Claude Code ハネス上で評価されました。
- 空白セル (
) は結果が未公開または該当しないことを示します。--
クイックスタート
シームレスな統合のために、Qwen3.8 を API を通じて利用することをお勧めします。
Qwen3.8 の提供フレームワーク
推論効率とスループットはフレームワーク間で大きく異なります。最適なパフォーマンスと互換性を確保するためには、最新のフレームワークバージョンの使用が推奨されます。本番負荷または高スループットのシナリオでは、専用提供エンジンである SGLang、vLLM、または TokenSpeed の使用が推奨されます。
以下の人気推論フレームワークで展開できます:
- SGLang: Qwen3.8 Cookbook
- vLLM: Qwen3.8 Recipe
- TokenSpeed: Qwen3.8 Recipe
API 使用方法
Qwen3.8 モデルはデフォルトで思考モードで動作し、`