
2026/09/04 3:32
Cerebras に Qwen 3.8 27B が登場、1500 トokens/秒で提供中
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Cerebras の公開エンドポイントは、無料トライアルおよび従量課金プランの両方で、オープンソースモデルの元の未トリミングバージョンを独占的にホストし、最高の品質と透明性を保証します。多くのサービスがデータを静かに圧縮するのに対し、Cerebras はストレージ効率とアーキテクチャの完全性の厳格な分離を行います。ウェイトは 4 ビットや 8 ビットの低位精度形式で保存してスペースを節約しますが、機密性が高い層はフルプレシジョンで保存され、オンザフライでのデクアンタ化が行われるため、演算は高精度で行われます。重要なのは、処理中에도活性化、注意機構、および kv キャッシュが精度低下やクアンタ化を行わずにフルプレシジョンのまま保たれ、数値誤差を防ぐことです。プラットフォームは、「クアンタ化」を単にストレージのためにデータの精度を下げずアーキテクチャを変更しないものと、「トリミング」をモデルのアーキテクチャの一部を永続的に削除するものとして区別します。REAP テクニクスを使用するようなトリミングされたモデルは、Cerebras REAP Collection という名前の Hugging Face などのプラットフォーム上で研究用としてのみ提供され、生产サービスとは決して混在させられません。Cerebras が将来の圧縮手法を検討する場合、既存のエンドポイントを改変するのではなく、明確な命名規則を持つ別々のエンドポイントとして展開します。したがって、この API を利用する開発者は、背後にあるモデル構造に対する隠れた妥協や予期せぬ変化なしに一貫した高忠実度のパフォーマンスを受け取り、品質が実験的な目標のために決して犠牲にされないことを保証されます。
本文
Cerebras 公開エンドポイントのモデル概要と技術詳細
利用プランとリソース
Cerebras の公開エンドポイントは、以下の条件でご利用可能です。
- 料金体系: 無料トライアルプランおよび従量課金プランの両方に対応。
- 前提条件: レート制限および料金の適用条件があります。
- 詳細情報: 専用エンドポイントでは、より多くのモデルファミリー、予約制リソース容量、高い処理能力、および本番環境向け SLA の詳細をご確認いただけます。
提供中のモデルと圧縮状態
利用可能なモデルの性質
- オープンソース対応: コミュニティ由来の多様なオープンソースモデルをホストしています。
- 現在の制限: 公開エンドポイント上では、トリミング済み(pruned)モデルは提供されていません。
- 提供バージョン: 全ての公開モデルは、元々のトリミング未適用バージョンです。
リサーチと共有 API の違い
- 研究推進: REAP(Router-weighted Expert Activation Pruning)といったトリミング手法に関する研究を推進しています。
- 共有先: トリミング済みモデルは Hugging Face を通じて研究コミュニティへ共有されています。
- 提供不可: しかし、当社の共有 API を介してはトリミング済みモデルを提供しておりません。
- REAP の詳細は 当社リサーチブログ(※リンク例)をご覧ください。
量子化(Quantization)と品質維持策
Cerebras は最大品質を維持するために、以下の手法を採用しています。
- アプローチ: 記憶媒体上でのみ選択的な重みを量子化する手法です。
- 精度仕様: 業界標準に従い、重みは以下のように格納されます。
- 16 ビット/8 ビット/4 ビットの精度
- 品質確保の仕組み:
- 感受性の高い層: フルプレシジョンで保持します。
- 演算実行: 必要に応じて**オンザフライでデクアンタ化(dequantization)**を行い、高精度な演算を実行します。
- 維持対象: アクティベーション、アテンションおよび KV キャッシュは、常にフルプレシジョンかつ非量子化された状態を維持します。
よくある質問 (FAQ)
モデルアーキテクチャの変更に関する保証は?
- 回答: いいえ、変更の保証はありませんが、以下のポリシーで対応します。
- 既存のエンドポイントにおけるオリジナルモデルの提供にコミットしており、何ら改変を加えません。
- ホストポートフォリオでは、トリミングによるアーキテクチャの変更を行っておりません。
- 将来の見通し:
- 追加の圧縮技術(例:トリミング)への検討があっても、それらは別個のエンドポイントとして提供されます。
- トリミング固有の命名により明確に区分され、完全な透明性を確保します。
- お客様はご自身の要件に最も適合するバージョンを選択いただけます。
REAP トリミング済みモデルの入手方法
- 入手先: 研究・実験目的のため、Hugging Face(Cerebras REAP Collection)で提供されています。
- 利用制限: これらのモデルは研究成果を証しますが、本番環境向け API を通じては提供されていません。
圧縮、量子化、トリミングの違い
「圧縮」はモデルサイズまたは計算要件を削減する技術の総称です。主な違いは以下の通りです。
- 量子化 (Quantization)
- 定義: モデル重みを表す数値の精度を低下させる技術(例:FP16 から FP8 へ)。
- 効果: モデルアーキテクチャを変えずにメモリの使用量を削減します。
- トリミング (Pruning)
- 定義: モデルの一部(層またはエキスパート)を恒久的に削除する手法。
- 効果: モデルサイズを削減しますが、モデルアーキテクチャが変更され、異なるモデルへと変質します。