
2026/10/04 21:51
Qwen3.8Flash Next(125B)を消費者向けハードウェア(RTX4090)上で100T/sで動作させます
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Strata は、ISTA-DASLab、UkisAI、Unsloth によって開発されたオープンソースで MIT ライセンス付与のプラットフォームであり、Windows または Linux PC に NVIDIA または AMD GPU(VRAM 12GB 以上)を搭載している場合、完全にオフラインで強力な Qwen3.8-Flash-Next AI モデルを実行することを可能にします。必要最低限のリソースとしては、RAM 32GB と空きディスク領域約 80GB が求められます。このローカル実行は、情報をデバイス外に出さないことによりデータプライバシーを確保します。RTX 5070 でのベンチマークでは、プロンプト読み取り速度が 2,600 トークン/秒を超え(Q2_0 では書き込み速度最大 94 トークン/秒)、モデルサイズや圧縮レベルにより異なります。この効率は、GPU、RAM、CPU にわたってタスクを知的に分配するユニークな「共有メモリー」アーキテクチャによって達成されており、これにより数千個の専用プロセッサを効果的にシミュレートしています。ユーザーは自動インストーラーを通じて Strata をインストールでき、ハードウェアチェックを行い、モデルを選択(Q2_0、IQ2_XS、Coder および Unsloth/OrcaRouter からの実験的バリエーションなど)、約 70GB のダウンロードを行い、特定の GPU に合わせてエンジンを設定します。「Coder」バリエーションはコード生成に最適化されており(SWE-bench Verified スコアの 91% を達成)、プログラミング文脈外の一般的な CJK テキストタスクでは性能が劣ります。画像処理は NVIDIA カードでサポートされており、AMD カードは Linux ではソフトウェアレンダリングを通じて画像処理が可能ですが、Windows ではまだ対応していません。そのため、セットアップ時に画像サポートを「はい」に選択する必要があります。Strata は Cursor、GitHub Copilot、Claude Code などのコーディングアシスタントと統合でき、
http://127.0.0.1:8080/v1 で OpenAI 互換プロバイダーとして動作します。一般的なインストールに関する注意点には、初期のフリーズは正常であり、低速は空き RAM の不足を示す可能性があること、ポート 8080 の競合は他のインスタンスが実行中の場合に起こり得ることが含まれます。本プロジェクトではマルチ GPU セットアップもサポートしており、設定、アップデート、トラブルシューティングについては docs/TROUBLESHOOTING.md などのドキュメントリンクを通じて管理できます。本文
Strata: ローカル環境で動作する高機能 AI モデル
Windows または Linux 環境に対応し、無料でオープンソースな AI モデル「Strata」をご紹介します。VRAM 12GB 以上を搭載したゲーミング PC 上で、パラメータ数 1250 億の大型モデルを独自に動作させることができます。 通常はサーバーが必要となる大容量で賢い AI(Qwen3.8-Flash-Next)を実行可能にし、対話・コード作成・画像読み取り・エージェント連携などが可能です。一切のデータはあなたの PC 内に留まります。
🎬 動作確認と例
- 例: voxel パゴダ庭園の生成(1-shot プロンプト)。
- 環境: RTX 5070 × Strata (IQ3_S, 128K コンテキスト)。
- 成果: 49 秒のフルビデオ生成が可能。
⚡ パフォーマンス結果
通常のゲーミング PC 2 台にて測定。
注釈: 「トークン」は文字数の約 3/4 に相当します。
1. NVIDIA (RTX 5070) 環境
| サイズ | 回答生成速度 (トークン/秒) | プロンプト読み込み速度 (トークン/秒) |
|---|---|---|
| Q2_0 | 94 | 2,650 |
| IQ2_XS | 79 | 2,090 |
| IQ3_XXS | 62 | 1,750 |
| IQ3_S | 53 | 1,620 |
| Coder | 55 | 2,180 |
2. AMD (RX 9070 XT) 環境
| サイズ | 回答生成速度 (トークン/秒) | プロンプト読み込み速度 (トークン/秒) |
|---|---|---|
| Q2_0 | 60 | 1,160 |
| IQ2_XS | 52 | 1,110 |
| Coder | 44 | 1,420 |
💡 スピードアップのヒント
- VRAM の多いボードを搭載すると速度は向上します。
- 例: RTX 3090 (24 GB) の場合は、約 100〜140 トークン/秒 の生成が期待できます。
- 長時間対話や詳細なデータについては
を参照してください。docs/INSTALL.md
速度の目安:
- 回答生成: 短チャットにおいて、1 秒あたり 60 トークン。これは人間の読み取り速度を凌駕します。
- プロンプト読み込み: 送信した内容(文書・コード・履歴)の受け入れ速度。
🖥️ 必要な環境条件
ハードウェア要件
- グラフィックボード (GPU):
- NVIDIA: RTX 20/30/40/50 シリーズ(推奨 VRAM: 12 GB 以上)。
- AMD: Radeon RX 7900 XT / XTX, 7800 XT / 7700 XT, 9060 XT, 9070 / 9070 XT, AI PRO R9700, RX 6800 / 6900 シリーズ。
- RAM: 32 GB 以上推奨。容量がモデルのサイズ選択を決定づけます(64 GB で全てのサイズ対応可能)。
- ディスク領域: 約 80 GB の空き領域。SSD を使用することを推奨します(起動が大幅に早まります)。
- OS & ドライバ: Windows 10/11 または Linux。最新 NVIDIA および AMD グラフィックドライバーが必要。
インストール自動化
インストールプログラムは残りの設定を自動で行います。マルチ GPUのサポートも対応しています。
AI アシスタントによるセットアップ
AI コーディングアシスタント(Claude Code, Cursor, Codex, GitHub Copilot など)をご利用の場合は、以下の指示を貼り付けてください:
「この PC に Strata をセットアップしてください: https://github.com/Niko1221/Strata - リポジトリ内の docs/AI_SETUP.md を参照してください。」
これにより、環境確認・モデル自動選択・インストール・起動・接続案内まで完了します。
手動によるセットアップ
以下の手順に従ってください(Windows と Linux の両方で共通)。
1. 準備 Strata をダウンロードし展開するか、以下を実行します。
# Git リポジトリを取得する git clone https://github.com/Niko1221/Strata.git cd Strata
2. インストール実行
- Windows:
をダブルクリックしてください。START-HERE.bat - Linux: Strata フォルダ内から
を実行してください。./setup.sh
インストール中の設定項目:
- モデルの種類とサイズを選択。
- コンテキスト量(モデルが記憶するテキスト量)を決定。
- 画像読み込みを行うか選択。
推奨: 指示に合わせて毎回
Enter キーを押し続けます。
- モデルダウンロード開始(約 70 GB)。
- ダウンロード中断時も、再度実行すれば中断箇所から再開されます。
- ブラウザに Strata アプリが自動で開きます:
http://127.0.0.1:8080
重要: 起動中は PC が 1〜3 分(初回は特に長い)遅延することがあります。これは正常な動作です。Strata は 35〜55 GB のデータを RAM に読み込み、一部を GPU にロックします。待機してウィンドウを閉じないでください。
📈 モデル選択ガイド
インストールプログラムは RAM 容量に最適なモデルを推奨します。同じモデルには圧縮度の異なる複数のサイズがあります。小さいほど速く、大きいほど賢いです。
RAM とモデルの相性表
| RAM 容量 | 推奨モデル | 理由・備考 |
|---|---|---|
| 32 GB | Coder | 32 GB に収まるコーディング特化版。24 GB GPU でも動作(Q2_0, IQ2_XS)。 |
| 48 GB | IQ2_XS (または Q2_0) | より大きなサイズは搭載できません。 |
| 64 GB | IQ2_XS (推奨) または IQ3_XXS / IQ3_S | 全サイズ対応。IQ3_S が高性能だが低速です。 |
| 96 GB+ | IQ3_S または Unsloth UD-IQ4_XS | 最大級モデルに対応。同時進行作業も可能です。 |
モデル種別解説
- Coder: エキスパートを半減させたコーディング特化版。SWE-bench Verified スコアで 91% を達成。コード以外では能力が低下する場合があります(中国語など CJK テキストを含む場合は Q2_0/IQ2_XS/IQ3_S を推奨)。
- Swift 1.5: 思考時間を短縮したファインチューニング版。同等品質でより早い回答を生成します。
- Unsloth UD-IQ4_XS: Unsloth の〜4 ビット版。IQ3_S と UD-Q4_K_XL の間の品質。ダウンロード量約 94 GB。RAM が 80 GB 未満の場合、SSD 参照により低速化しますが NVMe SSD で改善されます。
- Unsloth UD-Q4_K_XL(実験的): 完全版モデルに最も近い品質。64 GB PC では生成速度が約 7〜8.5 トークン/秒 に留まります。
- OrcaRouter の Uncensored IQ3_XXS: インストールメニューには含まれません。マニュアルでの手動設定が必要です。
詳細情報: サイズ・ダウンロード量・適合状況については
を参照。追加モデルはdocs/MODELS.mdまたはSETUP.batで設定変更可能。./setup.sh --setup
🛠️ 使用方法
アクセスポイント
ブラウザから
を開いてください。http://127.0.0.1:8080
- チャット機能
- モデル・GPU/CPU/RAM のライブモニター
- 設定ページ (About)
アプリ連携と API
Strata は「OpenAI 互換」プロバイダーとして動作します。
- API ベース URL:
http://127.0.0.1:8080/v1- 任意の API キーとモデル名を使用可能です。
- Anthropic API を使うアプリ (Claude Code 等):
- Endpoint:
http://127.0.0.1:8080/v1/messages - Env 変数設定例 (
)。ANTHROPIC_BASE_URL=http://127.0.0.1:8080
- Endpoint:
- Codex CLI / OpenAI Responses API:
- Endpoint:
/v1/responses
- Endpoint:
高度な設定オプション
- 思考プロセス (Reasoning Effort): 「reasoning effort」で [オフ] / [低] / [中] / [高] を選択。
: 最も速い処理速度。オフ
: 難しい質問に対して最適。高
- 画像処理: セットアップ時に「Images?」に
を選択。チャット内から Picture ボタンを押すか、アプリで添付できます。Yes- 注意: AMD GPU は Linux 上でプロセッサ経由で読み込めますが、Windows では現時点では非対応です。
- スマホ・他 PC からの接続:
START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>- API キーの必須設定が必要です。
パフォーマンスチューニング
- 並列処理: デフォルトは 1 リクエストのみ対応。複数回答させるには「parallel」を
に設定(2
)。ただし 12 GB GPU では速度低下の原因になります。BATCHING.md - 長いプロンプト対応: 最初のメッセージ(約 30,000 トークン)が読み込まれるまで約 1 分かかります。フォローアップは数秒以内です。
❌ トラブルシューティング
| シミュレーション | 原因と解決策 |
|---|---|
| 初回起動時 PC がフリーズ | モデル読み込み中の正常な現象。待機してください。10 分経過しても続く場合は PC を再起動し、他のプログラム(特にブラウザ)を閉じてから再試行するか、小さいモデルを選択してください。 |
| ダウンロード/インストール停止 | (Linux: ) を再度実行すれば、中断箇所で再開されます。 |
| 非常に遅く、ディスクランプが点滅 / 「エンジン予期せず停止」 | PC の空き RAM が不足しています。 1. ブラウザなどのリソースを消費するアプリを閉じる。 2. 小さいサイズ(Q2_0 または IQ2_XS)を選択してください。 |
| 「ポート 8080 が既に使用中」 | Strata がすでに稼働しています。該当ウィンドウを探してください。 |
詳細: 他の問題については
を参照。docs/TROUBLESHOOTING.md
解決しない場合は、と一緒に GitHub Issues を作成してください(セキュリティ問題の場合は非公開報告を推奨:strata-<model>.log)。SECURITY.md
⚙️ 仕組みについて
通常、数百 GB の VRAM を持つサーバーで動作するこのモデルは、あなたの PC(VRAM 12〜24 GB)でも稼働します。Strata は以下のように資源を最適化しています。
台所の比喩
- カウンター (GPU): よく使う数千人の「専門家」を保持。
- パントリー (RAM): 全員を保持し、必要に応じて呼び出す。
- 倉庫 (SSD): 大きな検索テーブルを保存。
- プロセッサ (CPU): GPU と RAM では処理できない残りの計算を担当。
具体的な技術
- 推測と検証:
- 小さなヘルパー(GPU/RAM)が次に来る単語を推測。
- 大規模モデルが一括して検証。
- これにより、通常の回答に必要な時間を 1.6〜1.8 倍短縮できます。
- 長文テキスト対応:
- 一度に最大 8,192 トークンのスライスを処理。
- 読み込み速度:1 秒あたり 1,000 トークン以上。
詳細ドキュメント:
および関連論文。docs/HOW_IT_WORKS.md
📜 クレジットとライセンス
- ベースモデル: Qwen チームによる Qwen3.8-Flash-Next。
- 圧縮処理: ISTA-DASLab, UkisAI (Swift 1.5), Unsloth が担当。
- 技術基盤:
/llama.cpp
の一部を利用。ggml - ライセンス: Strata は MIT ライセンス(オープンソース)。一部のモデルには独自のライセンスが適用されます。
🤝 Strata を支援する
Strata は無料かつオープンソースです。開発を支援したい場合は、以下の方法があります:
- ⭐ スター (Star) してリポジトリをフォローする。
- 💬 Issue でバグや改善案を報告する。
- 📢 SNS やブログで情報を拡散する。