Qwen3.8Flash Next(125B)を消費者向けハードウェア(RTX4090)上で100T/sで動作させます

2026/10/04 21:51

Qwen3.8Flash Next(125B)を消費者向けハードウェア(RTX4090)上で100T/sで動作させます

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

Strata は、ISTA-DASLab、UkisAI、Unsloth によって開発されたオープンソースで MIT ライセンス付与のプラットフォームであり、Windows または Linux PC に NVIDIA または AMD GPU(VRAM 12GB 以上)を搭載している場合、完全にオフラインで強力な Qwen3.8-Flash-Next AI モデルを実行することを可能にします。必要最低限のリソースとしては、RAM 32GB と空きディスク領域約 80GB が求められます。このローカル実行は、情報をデバイス外に出さないことによりデータプライバシーを確保します。RTX 5070 でのベンチマークでは、プロンプト読み取り速度が 2,600 トークン/秒を超え(Q2_0 では書き込み速度最大 94 トークン/秒)、モデルサイズや圧縮レベルにより異なります。この効率は、GPU、RAM、CPU にわたってタスクを知的に分配するユニークな「共有メモリー」アーキテクチャによって達成されており、これにより数千個の専用プロセッサを効果的にシミュレートしています。ユーザーは自動インストーラーを通じて Strata をインストールでき、ハードウェアチェックを行い、モデルを選択(Q2_0、IQ2_XS、Coder および Unsloth/OrcaRouter からの実験的バリエーションなど)、約 70GB のダウンロードを行い、特定の GPU に合わせてエンジンを設定します。「Coder」バリエーションはコード生成に最適化されており(SWE-bench Verified スコアの 91% を達成)、プログラミング文脈外の一般的な CJK テキストタスクでは性能が劣ります。画像処理は NVIDIA カードでサポートされており、AMD カードは Linux ではソフトウェアレンダリングを通じて画像処理が可能ですが、Windows ではまだ対応していません。そのため、セットアップ時に画像サポートを「はい」に選択する必要があります。Strata は Cursor、GitHub Copilot、Claude Code などのコーディングアシスタントと統合でき、

http://127.0.0.1:8080/v1
で OpenAI 互換プロバイダーとして動作します。一般的なインストールに関する注意点には、初期のフリーズは正常であり、低速は空き RAM の不足を示す可能性があること、ポート 8080 の競合は他のインスタンスが実行中の場合に起こり得ることが含まれます。本プロジェクトではマルチ GPU セットアップもサポートしており、設定、アップデート、トラブルシューティングについては
docs/TROUBLESHOOTING.md
などのドキュメントリンクを通じて管理できます。

本文

Strata: ローカル環境で動作する高機能 AI モデル

Windows または Linux 環境に対応し、無料でオープンソースな AI モデル「Strata」をご紹介します。VRAM 12GB 以上を搭載したゲーミング PC 上で、パラメータ数 1250 億の大型モデルを独自に動作させることができます。 通常はサーバーが必要となる大容量で賢い AI(Qwen3.8-Flash-Next)を実行可能にし、対話・コード作成・画像読み取り・エージェント連携などが可能です。一切のデータはあなたの PC 内に留まります。


🎬 動作確認と例

  • 例: voxel パゴダ庭園の生成(1-shot プロンプト)。
  • 環境: RTX 5070 × Strata (IQ3_S, 128K コンテキスト)。
  • 成果: 49 秒のフルビデオ生成が可能。

⚡ パフォーマンス結果

通常のゲーミング PC 2 台にて測定。

注釈: 「トークン」は文字数の約 3/4 に相当します。

1. NVIDIA (RTX 5070) 環境

サイズ回答生成速度 (トークン/秒)プロンプト読み込み速度 (トークン/秒)
Q2_0942,650
IQ2_XS792,090
IQ3_XXS621,750
IQ3_S531,620
Coder552,180

2. AMD (RX 9070 XT) 環境

サイズ回答生成速度 (トークン/秒)プロンプト読み込み速度 (トークン/秒)
Q2_0601,160
IQ2_XS521,110
Coder441,420

💡 スピードアップのヒント

  • VRAM の多いボードを搭載すると速度は向上します。
    • 例: RTX 3090 (24 GB) の場合は、約 100〜140 トークン/秒 の生成が期待できます。
  • 長時間対話や詳細なデータについては
    docs/INSTALL.md
    を参照してください。

速度の目安:

  • 回答生成: 短チャットにおいて、1 秒あたり 60 トークン。これは人間の読み取り速度を凌駕します。
  • プロンプト読み込み: 送信した内容(文書・コード・履歴)の受け入れ速度。

🖥️ 必要な環境条件

ハードウェア要件

  • グラフィックボード (GPU):
    • NVIDIA: RTX 20/30/40/50 シリーズ(推奨 VRAM: 12 GB 以上)。
    • AMD: Radeon RX 7900 XT / XTX, 7800 XT / 7700 XT, 9060 XT, 9070 / 9070 XT, AI PRO R9700, RX 6800 / 6900 シリーズ。
  • RAM: 32 GB 以上推奨。容量がモデルのサイズ選択を決定づけます(64 GB で全てのサイズ対応可能)。
  • ディスク領域: 約 80 GB の空き領域。SSD を使用することを推奨します(起動が大幅に早まります)。
  • OS & ドライバ: Windows 10/11 または Linux。最新 NVIDIA および AMD グラフィックドライバーが必要。

インストール自動化

インストールプログラムは残りの設定を自動で行います。マルチ GPUのサポートも対応しています。

AI アシスタントによるセットアップ

AI コーディングアシスタント(Claude Code, Cursor, Codex, GitHub Copilot など)をご利用の場合は、以下の指示を貼り付けてください:

「この PC に Strata をセットアップしてください: https://github.com/Niko1221/Strata - リポジトリ内の docs/AI_SETUP.md を参照してください。」

これにより、環境確認・モデル自動選択・インストール・起動・接続案内まで完了します。

手動によるセットアップ

以下の手順に従ってください(Windows と Linux の両方で共通)。

1. 準備 Strata をダウンロードし展開するか、以下を実行します。

# Git リポジトリを取得する
git clone https://github.com/Niko1221/Strata.git
cd Strata

2. インストール実行

  • Windows:
    START-HERE.bat
    をダブルクリックしてください。
  • Linux: Strata フォルダ内から
    ./setup.sh
    を実行してください。

インストール中の設定項目:

  1. モデルの種類とサイズを選択。
  2. コンテキスト量(モデルが記憶するテキスト量)を決定。
  3. 画像読み込みを行うか選択。

推奨: 指示に合わせて毎回

Enter
キーを押し続けます。

  • モデルダウンロード開始(約 70 GB)。
  • ダウンロード中断時も、再度実行すれば中断箇所から再開されます。
  • ブラウザに Strata アプリが自動で開きます:
    http://127.0.0.1:8080

重要: 起動中は PC が 1〜3 分(初回は特に長い)遅延することがあります。これは正常な動作です。Strata は 35〜55 GB のデータを RAM に読み込み、一部を GPU にロックします。待機してウィンドウを閉じないでください。


📈 モデル選択ガイド

インストールプログラムは RAM 容量に最適なモデルを推奨します。同じモデルには圧縮度の異なる複数のサイズがあります。小さいほど速く、大きいほど賢いです。

RAM とモデルの相性表

RAM 容量推奨モデル理由・備考
32 GBCoder32 GB に収まるコーディング特化版。24 GB GPU でも動作(Q2_0, IQ2_XS)。
48 GBIQ2_XS (または Q2_0)より大きなサイズは搭載できません。
64 GBIQ2_XS (推奨)
または IQ3_XXS / IQ3_S
全サイズ対応。IQ3_S が高性能だが低速です。
96 GB+IQ3_S
または Unsloth UD-IQ4_XS
最大級モデルに対応。同時進行作業も可能です。

モデル種別解説

  • Coder: エキスパートを半減させたコーディング特化版。SWE-bench Verified スコアで 91% を達成。コード以外では能力が低下する場合があります(中国語など CJK テキストを含む場合は Q2_0/IQ2_XS/IQ3_S を推奨)。
  • Swift 1.5: 思考時間を短縮したファインチューニング版。同等品質でより早い回答を生成します。
  • Unsloth UD-IQ4_XS: Unsloth の〜4 ビット版。IQ3_S と UD-Q4_K_XL の間の品質。ダウンロード量約 94 GB。RAM が 80 GB 未満の場合、SSD 参照により低速化しますが NVMe SSD で改善されます。
  • Unsloth UD-Q4_K_XL(実験的): 完全版モデルに最も近い品質。64 GB PC では生成速度が約 7〜8.5 トークン/秒 に留まります。
  • OrcaRouter の Uncensored IQ3_XXS: インストールメニューには含まれません。マニュアルでの手動設定が必要です。

詳細情報: サイズ・ダウンロード量・適合状況については

docs/MODELS.md
を参照。追加モデルは
SETUP.bat
または
./setup.sh --setup
で設定変更可能。


🛠️ 使用方法

アクセスポイント

ブラウザから

http://127.0.0.1:8080
を開いてください。

  • チャット機能
  • モデル・GPU/CPU/RAM のライブモニター
  • 設定ページ (About)

アプリ連携と API

Strata は「OpenAI 互換」プロバイダーとして動作します。

  • API ベース URL:
    http://127.0.0.1:8080/v1
    • 任意の API キーとモデル名を使用可能です。
  • Anthropic API を使うアプリ (Claude Code 等):
    • Endpoint:
      http://127.0.0.1:8080/v1/messages
    • Env 変数設定例 (
      ANTHROPIC_BASE_URL=http://127.0.0.1:8080
      )。
  • Codex CLI / OpenAI Responses API:
    • Endpoint:
      /v1/responses

高度な設定オプション

  • 思考プロセス (Reasoning Effort): 「reasoning effort」で [オフ] / [低] / [中] / [高] を選択。
    • オフ
      : 最も速い処理速度。
    • 高
      : 難しい質問に対して最適。
  • 画像処理: セットアップ時に「Images?」に
    Yes
    を選択。チャット内から Picture ボタンを押すか、アプリで添付できます。
    • 注意: AMD GPU は Linux 上でプロセッサ経由で読み込めますが、Windows では現時点では非対応です。
  • スマホ・他 PC からの接続:
    START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>
    
    • API キーの必須設定が必要です。

パフォーマンスチューニング

  • 並列処理: デフォルトは 1 リクエストのみ対応。複数回答させるには「parallel」を
    2
    に設定(
    BATCHING.md
    )。ただし 12 GB GPU では速度低下の原因になります。
  • 長いプロンプト対応: 最初のメッセージ(約 30,000 トークン)が読み込まれるまで約 1 分かかります。フォローアップは数秒以内です。

❌ トラブルシューティング

シミュレーション原因と解決策
初回起動時 PC がフリーズモデル読み込み中の正常な現象。待機してください。10 分経過しても続く場合は PC を再起動し、他のプログラム(特にブラウザ)を閉じてから再試行するか、小さいモデルを選択してください。
ダウンロード/インストール停止
START-HERE.bat
(Linux:
./setup.sh
) を再度実行すれば、中断箇所で再開されます。
非常に遅く、ディスクランプが点滅 / 「エンジン予期せず停止」PC の空き RAM が不足しています。
1. ブラウザなどのリソースを消費するアプリを閉じる。
2. 小さいサイズ(Q2_0 または IQ2_XS)を選択してください。
「ポート 8080 が既に使用中」Strata がすでに稼働しています。該当ウィンドウを探してください。

詳細: 他の問題については

docs/TROUBLESHOOTING.md
を参照。
解決しない場合は、
strata-<model>.log
と一緒に GitHub Issues を作成してください(セキュリティ問題の場合は非公開報告を推奨:
SECURITY.md
)。


⚙️ 仕組みについて

通常、数百 GB の VRAM を持つサーバーで動作するこのモデルは、あなたの PC(VRAM 12〜24 GB)でも稼働します。Strata は以下のように資源を最適化しています。

台所の比喩

  • カウンター (GPU): よく使う数千人の「専門家」を保持。
  • パントリー (RAM): 全員を保持し、必要に応じて呼び出す。
  • 倉庫 (SSD): 大きな検索テーブルを保存。
  • プロセッサ (CPU): GPU と RAM では処理できない残りの計算を担当。

具体的な技術

  • 推測と検証:
    • 小さなヘルパー(GPU/RAM)が次に来る単語を推測。
    • 大規模モデルが一括して検証。
    • これにより、通常の回答に必要な時間を 1.6〜1.8 倍短縮できます。
  • 長文テキスト対応:
    • 一度に最大 8,192 トークンのスライスを処理。
    • 読み込み速度:1 秒あたり 1,000 トークン以上。

詳細ドキュメント:

docs/HOW_IT_WORKS.md
および関連論文。


📜 クレジットとライセンス

  • ベースモデル: Qwen チームによる Qwen3.8-Flash-Next。
  • 圧縮処理: ISTA-DASLab, UkisAI (Swift 1.5), Unsloth が担当。
  • 技術基盤:
    llama.cpp
    /
    ggml
    の一部を利用。
  • ライセンス: Strata は MIT ライセンス(オープンソース)。一部のモデルには独自のライセンスが適用されます。

🤝 Strata を支援する

Strata は無料かつオープンソースです。開発を支援したい場合は、以下の方法があります:

  • ⭐ スター (Star) してリポジトリをフォローする。
  • 💬 Issue でバグや改善案を報告する。
  • 📢 SNS やブログで情報を拡散する。

同じ日のほかのニュース

一覧に戻る →

2026/10/05 4:42

macOS 27 で Apple Intelligence をオフにするとディスク容量を取り戻せる

## Japanese Translation: RemoveMacAI の主たる目的は、マクロシステムファイルを変更せず、かつ深い技術的介入を必要とせずに macOS 27(以降)で Apple Intelligence の機能を安全に無効化することにあります。構成プロファイルを適用し、ダウンロードされたモデルを削除することで、このツールは Siri、Writing Tools、Genmoji、Image Playground、および予測機能など特定の AI 機能を効果的に無効化します。ただし、別々の音声モデルを使用する標準的なディクテーション機能は維持されます。さらに重要なのは、システム設定内でユーザーの承認を義務付けることにより、オペレーティングシステムがこれらのモデルを自動的に再ダウンロードすることを防止することです。このプロセスはシステムインテグリティプロテクションを維持し、ネットワークリクエストを生成しないため、Apple Silicon ハードウェア上のユーザーに堅牢なプライバシーとセキュリティを保証します。MIT ライセンスの下で 4evy が開発した本ユーティリティは、macOS のアップデート後も存続する永続的なソリューションを提供します。ストレージ設定では一時的に AI 機能がリスト表示される場合がありますが、マクロシステムにより後から削除されるため、コア機能は引き続き無効化された状態となります。完全な機能を復元したい場合や特定の機能を管理したい場合は、各種コマンド(例:`removemacai off --keep <features>`)を使用でき、必要に応じて Homebrew を経由してツールをアンインストール (`brew uninstall removemacai`) することで変更を元に戻すことも可能です。インストールは、curl スクリプトを直接実行することと、Homebrew を通じての両方がサポートされています。

2026/10/05 4:37

不適切な編集により、Google データセンターの水道・電力使用量が露見した

## Japanese 訳: ネブラスカ州のデータセンターは、ジム・ピレン知事の 7 月 20 日付実行命令に従い、現在、年間にわたる水、電力、インフラの影響について環境水エネルギー省(DWEE)に報告することを義務付けられています。グーグルなどの事業者は当初、その使用量データが州の営業秘密法(§§81-1527; 84-712.05; NAC TITLE 115, CH. 2)で保護されると主張しましたが、DWEE は透明性の確保のため、報告書を公表しています。9 月 30 日までの時点で、6 つの施設が報告書を送付しており、合計約 7.65 億ガロンの水(およそ 1,160 のオリンピックサイズの水泳プール)を使用していたことが明らかになりました。アゲート LLC(グーグルのリノンキャンサイト)は約 1,330 万ガロンを使用し、ピーク需要時に 52.65 メガワットを消費しました。ファイヤーボールグループ LLC(パピリオン)は 2025 サイクルで年間使用量 547.88 メガガロンの最も高い使用量を報告しました。この開示には財政的インセンティブも含まれています:ネブラスカ・アドバンテージ法の下、施設は期待される利用度に基づいて税免除を受け、アゲートは 2025 年に約 5,580 万ドルの還付を予定しており、ファイヤーボールグループは約 3920 万ドル、ウェストウッドソリューションズ(オマハ)は約 2,260 万ドルです。現在まで、「イマジネー・ネブラスカ法」の下で受給された報奨金はあります。報告書は最大規模のアゲート LLC の 288,530 平方フィート(およそ 5 つの足球场分)に及んでいます。使用量報告書は 9 月 30 日まで提出期限があり、DWEE ウェブサイトの「DEQ Program」欄に「DCR」と入力することでアクセスできます。これらの要件を監督しているのは DWEE データセンタータスクフォースであり、これはデータセンターが地域の水道・電力システムに与える環境的圧力を示すように、情報公開から赤文字の秘密性へのシフトを強調しています。

2026/10/02 22:45

すべての灯台が描かれた地図

## Japanese Translation: 提供されたテキストには、情報技術開発に関する一貫したメッセージが含まれておらず、産業トレンドについて具体的な事実やデータ、検証可能な主張が欠落しているためである。実際のアークテクノロジーについての議論ではなく、「灯台(Lighthouses)」や定義されない惑星といった曖昧な抽象概念のみを言及しており、これらの用語を実際の IT シナリオと接続する文脈を提供できていない。その結果、過去の出来事や確立された業界の事例に関する背景情報がなく、読者が状況を理解するのに役立つ情報がない。さらに、このテキストはテクノロジーランドスケープに関する将来の見通し、タイムライン、あるいは期待される変化を述べておらず、次に何が起きるか予測することができない。こうした具体的な詳細の全般的な欠如のため、特定のテクノロロジーについては議論されておらず、したがってユーザー、企業、またはより広い業界への明確な影響は見出せない。実行可能なデータや実質に基づいた論理的な主張がないため、コンテンツは中立的であり、セクターにおける実践的な技術分析や現実世界の応用とは無関係である。

Qwen3.8Flash Next(125B)を消費者向けハードウェア(RTX4090)上で100T/sで動作させます | そっか~ニュース