Qwen 3.8 27B

2026/08/15 0:00

Qwen 3.8 27B

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Qwen3.8 は、コーディング、プロフェッショナルなワークフロー、研究、長期的なエージェントタスクにおいて大幅な性能向上をもたらす、Qwen3.5 の機能に継承する最新オープンモデルです。コンパクトな Qwen3.8-27B バリエーションは、複雑な多段階実行のためのネイティブのビジョン・ランゲージ理解を備えています:STEM 図や数時間の動画を処理し、環境からのフィードバックを取り扱い、

preserve_thinking
を介して履歴メッセージにわたる思考を保持します。性能は、SWE-bench Pro で 61.7、Terminal Bench 2.1 (Terminus) で 73.0、LiveCodeBench v6 で 90.3、OSWorld-Verified で 84.3、MathVision および OmnilDocBench で 90% 超のスコアを含む強力なベンチマーク結果によって検証されています。

アーキテクチャにおいて、モデルは YaRoPE スケーリングによる拡張性を通じてネイティブに 262k トークンのコンテキストウィンドウをサポートし、最大 100 万トークンまで拡張可能です。

enable_thinking
(デフォルトでオン)と
reasoning_effort
(xhigh/medium/low)によって制御される柔軟な推論モードを提供します。推奨サンプリングパラメータはモードごとに異なります:思考モードでは temperature=1.0、top_p=0.95、top_k=20、min_p=0.0 を使用し、指示モードでは temperature=0.7、top_p=0.80、presence_penalty=1.5 を使用し、思考を無効にするためのオプションの追加ボディ調整が可能です。

本番デプロイメントは、SGLang、vLLM、TokenSpeed、Qwen Cloud API との互換性を通じて簡素化されており、高スループットシナリオには専用サービングエンジンが推奨されます。数時間のビデオ処理については、

video_preprocessor_config.json
longest_edge
を 469,762,048(224k ビデオトークン)に設定します。全体として、Qwen3.8 は深い歴史的文脈と長期間にわたる自律的な意思決定を可能にし、既存の画像/ビデオ分析パイプラインとシームレスに統合されます。

本文

Qwen3.8 リリース:史上最高性能の生成モデルと FP8 量子化モデル情報

Hugging Face Transfomers フォーマットのポストトレーニング済みモデルに関する FP8 量子化モデルの重みと設定ファイルが提供されています。

アセットと互換性

  • 対応フレームワーク: Hugging Face Transformers、vLLM、SGLang、TokenSpeed と互換性があります。
  • 量子化手法: ブロックサイズ 128 の フィナー粒度(fine-grained)FP8 量子化を採用しています。
  • パフォーマンス: オリジナルモデルにほぼ同等のパフォーマンスを維持しています。

Qwen Cloud アナウンスメント

インフラストラクチャのメンテナンスなしで、マネージドかつスケーラブルな推論機能を求めるユーザー向けに、Qwen Cloud から公式 API サービスが提供されます。

  • 対象モデル: 特に Qwen3.8-27B は、より本番環境に適した以下の機能を備えたホスト済みバージョンとして利用可能です。
    • デフォルトで 100 万トークンのコンテキスト長
    • 公式標準搭載ツール
  • ステータス: 近日公開予定です。

Qwen3.8 モデル概要

Qwen オープンモデルファミリー史上最高性能の生成モデル「Qwen3.8」をリリースいたします。Qwen3.5 のアーキテクチャ基盤に基づき、コーディング、専門業務、研究、および長期的代理タスクなどあらゆる領域において 顕著な性能向上を達成しています。

Qwen3.8-27B は、これらの進歩をコンパクトかつ展開に最適な高密度モデルへ実装した、画像や動画をネイティブに理解し、思考制御が柔軟で複雑な多段階タスクの完了まで信頼性を持って導く ナイスビジョン・ランゲージモデルです。

機能強化ハイライト

Qwen3.8-27B は以下の機能を備えています:

  • コア能力: コーディング、専門業務、研究、および長期的代理タスクにわたる包括的な改良。
  • エージェント実行: 自律計画能力及び環境フィードバックの処理能力が向上し、エンドツーエンドタスク完了の信頼性が飛躍的に向上しました。
  • 下流互換性: 一般的なハネスや開発ツールのサポート範囲が広がり、既存のインフラへの統合が容易になりました。
  • 柔軟な思考制御:
    • 思考モードはデフォルトで有効であり、ご要望により無効化可能です。
    • 推論深さは
      reasoning_effort
      で調整できます。
    • 履歴メッセージからの推論コンテキストは
      preserve_thinking
      を通じて保持されます。
  • ビジョン・ランゲージ理解: STEM の図解や文書から時短単位動画に至るまで、画像および動画の理解をネイティブサポートしています。

モデル仕様詳細

特徴説明
タイプビジョンエンコーダーを備えた因果言語モデル
トレーニング段階プレトレーニング & ポストトレーニング
パラメータ数27B
隠れ次元5120
トークン埋め込み248,320(パディング済み)
層数64
隠れレイアウト$16 \times (3 \times (\text{Gated DeltaNet} \to \text{FFN}) \to 1 \times (\text{Gated Attention} \to \text{FFN}))$
Gated DeltaNetV 用に 48、QK 用に 16 の線形アテンションヘッド、ヘッド次元:128
Gated AttentionQ 用に 24、KV 用に 4 のアテンションヘッド、ヘッド次元:256、ロータリー位置埋め込み次元:64
フィードフォワードネットワーク中間次元:17,408
LM 出力248,320(パディング済み)
MTP (マルチトークン予測)複数ステップでトレーニング済み
コンテキスト長ネイティブに 262,144 トークン、最大 1,000,000 トークンへ拡張可能

ベンチマーク結果

テキスト性能比較

メトリックQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
コーディング
代理ターミナルコーディング (Terminal Bench 2.1)73.063.464.051.778.2
代理コーディング (SWE-bench Pro)61.753.557.651.253.4
リポジトリレベルコード生成 (NL2Repo-Bench)42.336.241.1--47.6
代理コーディング (DeepSWE 1.1)42.213.314.2----
ソフトウェアエンジニアリング (QwenSWEBench)79.049.359.2--63.8
エージェント
長期的オフィスワーク (CoWorkBench)70.761.065.1--68.2
プロフェッショナル職務タスク (JobBench)33.421.827.6----
フロンティア代理タスク (Agents' Last Exam)Pass@1: 20.4, Score: 42.9Pass@1: 10.6, Score: 27.3Pass@1: 13.2, Score: 33.6----
一般
インストラクション遵守 (IFBench)79.569.179.177.062.5
科学的推論 (GPQA Diamond)89.287.890.383.591.3
学際的推論 (HLE)30.824.034.722.040.0
コンテストコーディング (LiveCodeBench v6)90.383.989.6--88.8

テキストベンチマーク評価条件

  • SWE-bench Pro: Opus4.6 Max のみ公式報告値を使用しており、残りのモデルはすべて
    temp=1.0
    ,
    top_p=0.95
    , コンテキストウィンドウ 256K で Claude Code ハネスを用いて評価されました。
  • NL2Repo-Bench: Claude Code ハネスを用いて評価されました。
    pip download
    ,
    pip install
    ,
    git clone
    など特定のレポジトリにアクセスしようとする Bash コマンドは無効化されています。
  • DeepSWE 1.1:
    temp=1.0
    ,
    top_p=0.95
    , コンテキストウィンドウ 256K で Claude Code ハネスを用いて評価されました。
  • QwenSWEBench: モデルのソフトウェアエンジニアリング能力を評価するための社内コーディングベンチマークです。Claude Code ハネスを用いて評価され、
    avg@3
    (8 時間タイムアウト、max_tokens=32,768、temperature=1.0、コンテキストウィンドウ 256K)が報告されました。
  • CoWorkBench: コンピュータサイエンス、金融法、医療など複数の生産性ドメインにおける長期的タスクを評価するための社内共働ベンチマークです。
  • HLE: GPT-4o による判定モデル。
  • 各行の最良の結果は太字で示されています(元ソースに基づく)。空白セル (
    --
    ) は結果が未公開または該当しないことを示します。

VL(ビジョン・ランゲージ)性能比較

メトリックQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
代理マルチモーダル知能
コンピュータ使用 (OSWorld-Verified)84.363.973.365.972.7
ブラウザ使用 (WebArena-Verified)64.848.855.3----
モバイル使用 (AndroidWorld)81.970.381.0--62.0
アプリケーション再現 (RecreationBench)47.129.830.2----
マルチモーダルツール使用 (ClawEval-MM)Pass@3: 57.4, Avg: 56.9Pass@3: 42.6, Avg: 50.4Pass@3: 57.4, Avg: 60.1--Pass@3: 52.5, Avg: 54.7
マルチモーダルソフトウェアエンジニアリング (SWE-MM)38.625.730.0--27.1
視覚ウェブ開発 (Vision2Web)62.945.042.1----
一般マルチモーダル知能
視覚数学問題解決 (MathVision)Without CI: 90.0, With CI: 94.6Without CI: 85.1Without CI: 90.3--Without CI: 65.5
一般視覚推論 (BabyVision)Without CI: 65.7, With CI: 85.6Without CI: 28.9, With CI: 70.4--Without CI: 12.6--
科学チャート分析 (CharXiv RQ)Without CI: 83.7, With CI: 90.2Without CI: 78.4, With CI: 85.978.8Without CI: 66.0--
ドキュメント知能 (OmniDocBench 1.5)91.189.491.475.886.6
リアルワールド知覚 (RealWorldQA)85.984.186.9--73.9
具現知能 (ERQA)65.562.569.8--40.8

VL ベンチマーク評価条件

  • MathVision, BabyVision, CharXiv (RQ): 両方の設定が利用可能な場合、セルは "Without CI" と"With CI" を別々に報告し、そうでない場合は利用可能な設定のみが表示されます。MathVision および CharXiv (RQ) における少数の誤った地面真実注釈は手動検証後に修正され、これらのベンチマーク上のすべての報告スコアは修正された注釈を使用して計算されました。
  • MathVision: Qwen3.8-27B は固定プロンプト「Please reason step by step, and put your final answer within \boxed{}。」を使用して評価されました。残りのモデルについては、\boxed{} 書式要件を含むものと含まないものの両方のプロンプト変体のうち高いスコアを報告します。
  • WebArena-Verified: OSWorld のスケルファットの下で公式 WebArena-Verified グラダーを使用してスコアが計算されました。
  • RecreationBench: デスクトップ(Ubuntu, macOS, Windows)、モバイル(Android)、およびウェブという 5 つのプラットフォームにおけるハイブリッドエージェント能力を評価するために設計された社内長期的アプリケーション再現ベンチマークです。
  • ClawEval-MM: スコアは「Pass@3 / 平均スコア」として報告されます。Pass@3 は 3 回の試行のうち少なくとも 1 回でタスクが通過した割合を、平均スコアは 3 回の試行全体のベンチマークスコアの平均値を表します。
  • Vision2Web: スコアはフロントエンド、ウェブページ、ウェブサイトのカテゴリ全体で平均化されます。評価には Claude Code ハネスが使用され、判定は gpt-5.4-2026-03-05 によって行われます。
  • SWE-MM: スコアは SWE-bench Multimodal の公開開発分割を使用して、Claude Opus 4.7 システムカードの附録 8.3 に記述された修正を用いて Claude Code ハネス上で評価されました。
  • 空白セル (
    --
    ) は結果が未公開または該当しないことを示します。

クイックスタート

シームレスな統合のために、Qwen3.8 を API を通じて利用することをお勧めします

Qwen3.8 の提供フレームワーク

推論効率とスループットはフレームワーク間で大きく異なります。最適なパフォーマンスと互換性を確保するためには、最新のフレームワークバージョンの使用が推奨されます。本番負荷または高スループットのシナリオでは、専用提供エンジンである SGLang、vLLM、または TokenSpeed の使用が推奨されます。

以下の人気推論フレームワークで展開できます:

API 使用方法

Qwen3.8 モデルはデフォルトで思考モードで動作し、`

同じ日のほかのニュース

一覧に戻る →

2026/08/15 5:46

研究がコーヒー摂取量と代謝健康および性ホルモンの関連性を示唆

## Japanese Translation: 大学のウェブサイトは、主要な学術および行政リソースにユーザーを接続する包括的なポータルとして機能します。構造的には、生化学・分子医学学部、教育学・心理学学部、人文科学部、医学部、情報技術電気工学部、理学部、技術学部、オウルビジネススクールなどの特定ファカルティへの直接ナビゲーションを提供するとともに、「Oula-Finna」図書館システムをはじめとする重要なサポーツサービスにアクセスすることを可能にします。この図書館システムでは、サービス、コレクション、施設、ガイド、連絡先時間などへのアクセスが提供されています。さらに、ニュース、出願、研究、協力、寄付、キャンパス、キャリア、連絡先情報、登記所、中央アーカイブなどのセクションも利用可能です。ウェブサイトはまた、大学ランキングを際立たせて表示しています。これらの多様な要素を統合することによって、ウェブサイトはステークホルダーが特定の機関データおよびサービスを見つけるために効率よく動作し、内部ナビゲーションおよび外部エンゲージメントのための重要なハブとなっています。

2026/08/15 0:03

私が大切にしている本7冊:なぜか大好きだからです。

## Japanese Translation: **改善された要約:** 本文の主な焦点は、作家の机周および棚に配置され、インスピレーションと参照のための詳細な物品リストにある。このキュレートのコレクションは古典文学や神学から数学論理、児童書、デジタルツールまで多様な分野を繋ぎ合わせている。著者は実用性やテーマ的な深さに基づいて特定の版を残しており、例えばロジェの類語辞典第 4 版は時間概念(例:優先度、同時性)の簡潔な分類のために保持されているが、サイズのため第 8 版は遠い棚に移されており使用されていない。他の注目すべき作品には、サウス・トマス・ブラウンの『Pseudodoxia Epidemica』があり、これはロジェのスペースに置かれ、蝗虫やピタゴラスのタブーなどに関する話題が論じられている;ボッカッチョの『デカメロン』(1348 年の黒死病を背景とし、ダンテと比較される);そして『フレゲからゲーデルへ』という数学論理論文集が含まれている。リストにはさらに、ヨハネス・コメニウスの挿絵入り児童書『Orbis Sensualium Pictis』(1658 年)、特定の記事に関する注釈を付した大型文字の NIV 聖書、ベリー公の中世『Belles Heures』、そして 8mm バックアップテープや韓国式麻雀カードのような個人的な文脈を持つ物品も含まれている。最後に、GNU Emacs や Blosxom ソフトウェアなどの実用的なデジタルツールに加え、ドラフト作成およびテキスト修正のために GNU grep およびその他のユーティリティのコレクションも含まれている。

2026/08/15 1:12

RustDesk が Wayland でも真正な無人リモートアクセスに対応しました

## 日本語翻訳: 元のサマリーは高品質であり、適切に書かれており、重要なポイントを整合性のある物語へと効果的に統合しています。明瞭で理解しやすく、かつ説得力があります。 **改善されたサマリー:** RustDesk は Linux Wayland における真の無人アクセスを可能にすることで大きなマイルストーンを達成しました。これにより、ユーザーはログアウト状態のまままたは追加サーバーをインストールせず、ログイン画面から直接接続を行うことができます。このアップデートは、以前の問題点を解決し、複数モニターの設定を完全にサポートするとともに、以前のシステムで一般的だった Xorg の回避策の必要性を排除します。競合製品である AnyDesk は依然としてincoming セッションを Xorg に制限(Wayland を非対応扱い)しており、TeamViewer もそのサポートを「実験的」として列挙していますが、RustDesk は現在、x86_64 Debian および Ubuntu ベースのディストリビューション向けに、別々のプレビュービルドとして堅牢でネイティブな互換性を提供しています。この機能は、ユーザーがアクティブにログインしていなくても、再起動後に自動的にリモートセッションを開始します。開発計画によれば、実世界でのテストを通じて安定性が確認され次第、この機能はプレビュービルドから標準リリースへ移行し、Fedora および Arch Linux にも展開される予定です。その結果、組織は今や、信頼性の高い現代的なデスクトップ環境サポートを備えたソリューションを採用することで、競合ツールからの移行が可能になり、実験的な設定の摩擦や永続的なログイン要件なしにシームレスなリモート管理を確保できるようになりました。