Show HN:48GB の Mac で約 12 トークン/秒の速度で、104GB の Qwen3.8-Flash-Next を実行しています。

2026/09/02 1:42

Show HN:48GB の Mac で約 12 トークン/秒の速度で、104GB の Qwen3.8-Flash-Next を実行しています。

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

概要:

このテキストでは、Apple シリコン上で大規模 AI モデルを実行する画期的な成果について詳述されています。独立した Swift バイナリ(

qwen3.8-flash-next:4bit
)は、約 110 GB のディスク容量のみを用いて、125B パラメータを持つ Qwen3.8-Flash-Next モデルを実行します。
slotstream
を活用することで、モデルの重みを SSD から直接ストリーミングし、Python の依存関係を排除するとともに、ポート 11434 で Ollama と OpenAI チャット API を実装しています。M5 Pro(48 GB RAM)では、テキスト生成で約 12 tokens/秒の実績があり、より小型の Mac ではウォームアップ後のデコード速度が~3–9 tok/s に低下します。このバイナリは
curl
スクリプトによるインストールで
~/.slotstream/bin
に配置するか、Command Line Tools を用いてソースからビルドすることも可能です(Xcode の必要はありません)。

主な技術的な特徴として、v0.2.0 では推測的デコーディング(

--mtp
、精度 86%)が実装されていますが、キャッシュ制約によりターゲットメモリが 26 GB を下回ると無効化されます。システムは自動でメモリサイズを拡張し、最大 33 GB の上限まで拡大することで未使用の RAM を回収しつつ、バイト単位で同一な出力を保証します。ただし、依然として大きな制限が存在します:サポートされていない機能には、ツール、画像入力、JSON スキーマ出力、logprobs、および Ollama CLI(厳密な検証により 400 エラーが返されるため)が含まれます。性能はアルゴリズム効率ではなく、ハードウェアのメモリ可用性に厳しく縛られています。将来のアップデートでは互換性の問題を解決し、JSON スキーマサポートなどの機能を追加する予定で、ドキュメントは
docs/API.md
にあり、検証は
Tools/verify.sh
で処理されます。

本文

Qwen3.8-Flash-Next の Mac 向け実行環境:容量不足でも動作可能化

Qwen3.8-Flash-Next(1250 億パラメータの Mixture-of-Experts モデル)を、ディスク容量が十分でないように見えても動作させることができます。このモデルは通常、4 ビット量化で 104 GB のディスク領域を必要としますが、Slotstream を使うことで SSD からデータをストリーミングして読み込み、与えられたメモリ制限内で実行可能です。

主な特徴

  • 単一 Swift バイナリ:Python は不要です。
  • 既存ツールの互換性:Ollama および OpenAI チャット API を実装しており、既存のクライアントは変更なしで動作します。
  • 自動メモリ調整:マシンの RAM 量に応じて自動的に最適化されます。

パフォーマンスとシステム要件(48 GB M5 Pro の場合)

48 GB のメモリを搭載した Mac(M5 Pro チップ)での实测値です。

  • ウォームデコード速度: 約 12 トークン/秒
  • エンジン起動時間: 約 2 秒(3.8 GB の主干部分のみ読み込みます)
  • ピークメモリ使用量: 32 GB(自動調整、上限を指定も可)
  • ディスク上の全量ファイル: 104 GB

Mac での動作条件確認

チェック項目要件内容
CPUApple Silicon チップ搭載必須
OSmacOS 14 以降
ディスク容量110 GB の空き容量が必要です(SSD 512 GB が実用的な下限)

⚠️ 重要: メモリ容量だけでなく、SSD の空き容量がボトルネックになります。メモリ不足でも 512 GB SSD を持っていれば動作しますが、ディスク領域が不足している場合は起動しません。

各メモリティアでの推定性能

slotstream doctor --sim-ram N
コマンドで以下のようなシミュレーションが可能です(48 GB 行のみ実測、他は推定)。

RAM (GB)使用メモリウォームデコード速度備考
88.1 GB約 3 トークン/秒ページング警告あり(Doctor 推奨)
1610 GB約 4 トークン/秒
2416 GB約 8 トークン/秒
3222 GB約 9 トークン/秒
48+33 GB約 12 トークン/秒さらにメモリを増やしても性能は向上しません

💡 自動サイズ調整: システム全体を使い尽くすことはなく、安全に動作します。小型 Mac は SSD の読み込み速度が遅いため、理論値よりも低速になる可能性があります。インストール前に必ず

slotstream doctor
を実行して推奨プランを確認してください。


インストール方法

1. リリース版のインストール

最新のリリースを

.~/.slotstream/bin/
に配置し、PATH に追加します。アップグレードには再度同じコマンドを実行します。アンインストール時は
.~/.slotstream
を削除し、システムに追加されたラッパーまたは PATH 設定を元に戻してください。

2. セキュアな検証(重要)

ビルドは CI(継続的インテグレーション)で署名され、元データの出所証明(Provenance)が付けられています。 blindly に信じるのではなく、以下のように検証してダウンロードします:

gh attestation verify slotstream-arm64.tar.gz --repo carloslfu/slotstream

3. ソースコードからのビルド

Xcode は不要で、コマンドラインツールのみで動作します:

git clone https://github.com/carloslfu/slotstream && cd slotstream
make build

104 GB のファイルダウンロードについて

バイナリ自体は軽量ですが、モデルの重み(Weights)が 103.8 GB(24 ファイル分)と大きいです。

slotstream pull
または
serve/run
を実行するとダウンロードが始まります。転送前にはサイズや空き容量を確認し承諾を求める仕組みになっています。

ダウンロードにかかる時間

Hugging Face の制限速度(約 36–57 MB/s)のため、インターネット回線によって以下のように変化します。

  • 100 Mbps: 約 2 時間 20 分
  • 25 Mbps: 約 9 時間

中断しても安全です(再開機能)

  • 途中からの再開:
    pull
    コマンドは以前から進捗を保存し、読み込まれたチャンクのみ再処理します。
  • 完全な整合性保証: 全 24 ファイルについて SHA-256 ハッシュ値との照合が行われ、破損したファイルはエンジンに到達しません。
  • フォールバック: 固定コミットのミラーとオリジナルリポジトリの両方がハッシュチェックで検証可能です。
  • 再ハッシュ化: 既存コピーを再確認するには
    pull --verify
    を実行します(本稿では 8 秒)。

使用方法

クイックテスト(サーバー起動なし)

コマンドラインからすぐに質問できます:

slotstream run --prompt "why is the sky blue?"

API サーバーとしての起動

ポート 11434 でリスニングし、Ollama クライアントや OpenAI SDK が利用可能なチャットエンドポイントを提供します。

curl localhost:11434/api/chat -d '{
  "model": "qwen3.8-flash-next:4bit",
  "messages": [{"role": "user", "content": "hello"}]
}'

互換性と制限事項

  • 対応: Open WebUI、OpenAI SDK、Ollama CLI(一部)、ストリーミング、CORS、標準サンプリングオプションは正常に動作します。
  • 未対応機能: ツール呼び出し、画像入力、JSON スキーマ出力、ログプロブなどは明確な HTTP 400 エラー を返します(静かに無視するのではなく)。
  • 詳細仕様とエラーリストは
    docs/API.md
    を参照してください。

速度に関する特性

  • 推論(デコード): 比較的容易です(約 12 トークン/秒)。
  • プロンプト処理がボトルネック: プロンプト全体を最初のトークン生成前に処理するため、待機時間が発生します。
    • 48 GB Mac: 8,000 トークンのプロンプトで約 1 分
    • 16 GB Mac: 同サイズで約 3 分弱
  • コンテキスト制限: プログンプトと生成の合計 32,768 トークン に制限されます(
    --max-context
    フラグ)。

コスト削減効果(対話時の速度向上)

会話中に発生する「最初のトークン生成までの待機時間」は、初回のみに限られます。フォローアップターンでは新規部分のみの事前計算を行うため、後続のターンでは待機時間が劇的に短縮されます。

: 16 GB 環境で 8 ターン以上重ねた場合、最後ターンの待機時間は 25.8 秒 → 6.0 秒 に短縮されます。 ※完全な再現性を求める場合は

--no-prefix-cache
フラグを使用してください。


メモリ管理について

デフォルト設定(フラグなし)では、マシン環境に合わせ自動調整します(例:48 GB Mac での出力)。

slotstream memory plan (auto)
  device: 52 GB RAM (36.0 GB reclaimable now), 40.2 GB Metal working set
  target: 33.0 GB total for this process   (override: --memory-gb N | --max-ram-percent P)
  cache:  ~152 of 512 experts per layer  (7280 global slots = 20.1 GB pool)
  expect: ~32.0 GB peak, ~12 tok/s warm decode (est. from M5 Pro anchors)
  prefill: 4096 tokens per pass (~125 tok/s here; costs ~5.3 GB of the target)
  reuse:  up to 32768 tokens across 4 conversations (~1.2 GB), so a follow-up turn re-prefills only what is new

自動調整の仕組み

  • 戦略: 設定可能な 3 つの制限の中で最も小さい値を採用し、他のアプリがメモリを使っている間も縮小します。
  • 上限: 33 GB(測定曲線の膝部分。128 GB マシンでもこのプランを使用します)。
  • 動的調整: 実行中は 15 秒ごと に再チェックを行い、リクエスト間のキャッシュ容量を調整(圧力が高いときは縮小、低ければ拡張)します。

上限を自分で設定する方法

以下のフラグを使用してください:

  • --memory-gb G
    : プロセス全体の総メモリ容量指定(最低 8.1 GB)。実験目的なら 33 GB 以上も可能です。
  • --max-ram-percent P
    : メモリ使用率の上限変更(例:70%)。
  • --experts-per-layer / --pool-gb
    : キャッシュ容量の直接指定。

slotstream doctor
コマンドでこれらの設定が生成するプランを確認できます。


動作原理

モデルデータは主に以下の場所から読み込まれます(SSD ストリーミング方式):

  1. 経路化された専門家(Routed Experts):68 GB(各レイヤーに 512 個、アクティブはトークンあたり 10 個)。
  2. N-gram テーブル:32 GB。

これらは

pread
を使用して読み込まれ、48 レイヤーすべてで共有される固定されたスロットプールに書き込まれます。ホットなレイヤーはコールドなレイヤーからスロットを借用できます。

なぜ mmap のみではダメなのか?

Apple の ML フレームワークである MLX は、メモリマップされたテンソルの一部を現実化(Materialize)できません。Top-10 専門家の集計演算にはそのレイヤー全体の専門家が必要となるため、単純な

mmap
での読み込みは失敗します。従来の
mlx_lm.load()
は 48 GB スワップ領域へマシンを追い込む結果となりましたが、Slotstream はこれを回避しています。

注意点: キャッシュサイズは速度に影響しますが、出力内容(バイト単位)には影響しません。4 GB と 24 GB のキャッシュ間で結果は同一です。


ステータスと制限事項

現状の動作環境は M5 Pro (48 GB) を中心に測定されており、小型マシンについては推定値となります。

  • モデル制限: v0 版は
    qwen3.8-flash-next:4bit
    のみを動作させます(ロック付き、1 つのプロセスのみ)。
  • OS 対応: macOS 14, 15 インストーラーで動作確認済みですが、ランタイム検証は未完了です。
  • Ollama CLI の接続: 現状非対応です。厳格なバリデーターにより
    /api/show
    が拒否され、最初のメッセージに到達する前に停止します(修正版の提供待ち)。

v0.2.0 新機能:推論(Speculative Decode)

詳細は

CHANGELOG.md
を参照してください。
--mtp auto|on|off
フラグにより、モデル内の「予測頭(Draft Head)」を用いて次トークンを予測し、バッチ検証を行います。

  • 精度: 最初の草案が 86% の確率で正しいことが確認されています。
  • 速度向上: キャッシュ容量が大きい場合(目標メモリ > 26 GB)、1.5–1.9 倍の速度向上が期待されます。逆に小さい場合は低下します。
  • 有効化条件: 「auto」モードでは、公式リリースから 4.9 GB をダウンロードし、
    mtp.safetensors
    (1.5 GB) を生成する必要があります(
    Tools/mtp_convert.py
    で作成)。ファイルがない場合は機能しません。

ドキュメント一覧

  • docs/API.md: エンドポイント、フィールド、サンプリングデフォルト、エラーリスト。
  • docs/TROUBLESHOOTING.md: ポート競合、ページング、重量ファイルの移動/検証方法。
  • docs/CLI.md: コマンド・フラグ一覧、メモリパラメータ優先順位、環境変数、保存場所。
    slotstream <command> --help
    で詳細確認可能。
  • CHANGELOG.md: リリースごとの変更履歴。
  • PLAN.md: アーキテクチャ設計とマイルストーン。
  • MEASUREMENTS.md: 測定値の詳細な説明(失敗した実験含む)。
  • llms.txt: AI エージェント向けの全体マップ。

テスト・検証スイート

Tools/verify.sh
は受入テストのバッチとして機能します:

  • 重量ファイルのプロヴェネンスとバージョン照合。
  • キャッシュサイズおよびライブリサイズ間の一貫性チェック。
  • サーバークラッシュを招く入力に対する堅牢性テスト。

また、

Tools/e2e_release.sh
は実際のインストールフロー(curl/sh)のテストを行います。重量ファイルのみのビルドも CI で動作確認されています。


ライセンス

全体は MIT です。

  • Sources/SlotstreamCore/Vendored/GatedDelta.swift
    :
    mlx-swift-lm
    (MIT) からの移植。
  • Tools/reference/qwen4_exp.py
    : コミュニティのテストオラクルとしてベンダー提供。
  • 重量ファイル (
    pipenetwork/Qwen3.8-Flash-Next-MLX-4bit
    ) は Qwen Community License で配布されています。

同じ日のほかのニュース

一覧に戻る →

2026/09/02 2:53

Claude Fable 5.1 と Claude Mythos 5.1

## Japanese Translation: Anthropic は、一般利用のための Claude Fable 5.1 と、サイバーセキュリティおよび生命科学分野の信頼できる政府プログラムを通じた制限されたアクセス用の Claude Mythos 5.1 を公式にリリースしました。特に、これらは異なる安全対策レベルを持つ同一の基盤モデルの変種です。主要なアップデートとして、コストが削減されおり、典型的なワークロードでは価格低下率が 25%、複雑な自動化タスクでは 45% まで低下すると推定されています(キャッシュ要件の減少により、100 万トークンあたり 0.25 ドルへ)。エンタープライズ顧客は、秋以降に「Frontier Safeguards」を採用する予定で、顧客管理下のインフラストラクチャ上でのデータ保持ゼロを提供します。Mythos 5.1 は、分子結合体設計のヒットレートが 10〜15% からほぼ 50% に向上し、カスタムキャッシュにより深層学習のトレーニングを最大 2.5 倍加速させるなど、安全性と能力の向上を示しています。また、エクスプロイトコードの生成を防ぎつつ高忠実度の研究を支援するため、米国政府のプロトコルに厳格に準拠しています。8 月 2 日(2026 年)以降にリリースされる次期モデルには、EU AI 法への適合のために出力ウォーターマークの導入が義務付けられ、規制当局や企業向けのプライベートプレビュー検出 API が用意されます。

2026/09/02 3:35

Ed ゼイトロンの AI 懐疑論者の予言はどれほど正確だったのか?

## 日本語翻訳: 本テキストの核心的なメッセージは、技術懐疑主義者である Ed Zitron の産業崩壊が迫っているという予言が事実に反し、データによって裏付けられていない点にあります。彼の予測は、Meta、Alphabet、Microsoft といった大手企業が「死んでいる」と宣言し、生成 AI がピークに達したと主張していますが、これらは 2023 年から 2026 年の計画期間にかけて業界全体で見られた堅調な財務成長により直接反証されています。例えば、OpenAI は収益目標を上回り、CoreWeave は資金調達後に IPO 価格を倍額まで引き上げました。また、Cursor は 600 億ドルの評価額での exit を実現しており、これらは Zitron の敗北または低評価という悲惨な警告を直接的に否定しています。さらに具体的な指標に関するエラーも彼の信用力を損なっています:Meta の利用者数は不正確な Similarweb データを用いて誤算され、Gemini は 5 億ユーザーという目標を超えて 7.5 億ユーザーに達し、Google Search の問題は単にリーダーシップのせいであると単純化されており、エンジニア側はこれに反対しています。Zitron の経済分析は「絶対的なゴミ」と批判され、反駁されない点で批評家を圧倒するために「ギッシュ・ガロップ(gish gallop)」という戦術を用いる傾向があり、不正確なデータ源に依存しています。加えて、彼の文章スタイルは怒りと悪口を多用し、人々の心を改心させるのではなくエンゲージメントを高めることを目的としており、過去の過ちを認めなかった Paul Ehrlich などの破綻した未来学者と同じスタンスです。したがって、投資家や執行役員は、彼の自信に満ちた警告を企業の健全さを示す有効な指標ではなく、市場は彼のリズミカルなノイズにもかかわらず継続的に革新しているため、信頼性の低い distraction( distractions )として扱うべきです。

2026/09/02 7:06

Show HN: Weedout – YouTube のAI 評価動画を表示しないSafari拡張機能

## Japanese Translation: 新しい Mac 用アプリケーションは、フィード、検索結果、関連動画、および Shorts シェルフに表示される「AI で作成された」とラベル付けされた YouTube 動画を自動的にフィルタリングするプライバシーを最優先としたソリューションを提供します。このツールは完全にローカルで動作し、ユーザーアカウントやデータ収集を必要とせず、視聴習慣が秘密に保たれます。検出方法は YouTube の公式に提示されたバッジのみを使用するため、プラットフォーム自身によって明示的にマークされていない動画に対する誤った非難は回避され、そのコンテンツのみを隠します。パフォーマンステストの結果、アプリケーションはリアルタイムのストリームを約半秒で処理し、キャッシュ済みコンテンツは瞬時に処理します。現在、このツールは一般的な低品質な素材ではなく AI 生成物の公開情報のみに焦点を当てており、Shorts の自動スキップ機能や、動画がビューから削除される前に特定の動画を検証できるダークモードなどの有用な機能を備えています。将来のアップデートではロジックの拡張が行われる可能性がありますが、現在のバージョンは厳密に公式ラベルに従います。質問、バグレポート、あるいは検出漏れについては、masteranza@gmail.com 宛てにメールでサポートが可能です(偽陰性レポートには動画のリンクが必要です)。このアプローチにより、視聴者は手動操作や侵襲的な広告なしに直ちに人間が作成したコンテンツにアクセスでき、画面に表示される AI 生成物の雑多なものを単に我慢する対抗としての効果的な代替手段を提供します。

Show HN:48GB の Mac で約 12 トークン/秒の速度で、104GB の Qwen3.8-Flash-Next を実行しています。 | そっか~ニュース