サムスンのプロセッシング・イン・メモリ(PIM)

2026/08/29 15:06

サムスンのプロセッシング・イン・メモリ(PIM)

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Hot Chips 2026 でサムスン電気は、LPDDR5X チップに統合されたメモリ内処理(PIM)テクノロジーを発表しました。この技術は、AI 計算能力をメモリアン内部のバンク内で直接向上させることを目的としています。PIM ブロックには MAC 演算ユニットおよび制御論理が含まれ、チップの全 16 バンクに分散配置されており、DRAM プロトコルを変更せずに内部帯域幅を 76.8 GB/s から 614 GB/s に増加させます。このシステムは、特別な行アドレスを利用して標準アクセスモードと「PIM レジスタ有効化」モード間で切り替えることで、INT8、FP8、および 4 ビットの入力形式をサポートし、チップあたり最大 2.4 TOPS のスループットを実現します。

しかし、このテクノロジーの採用には重要なトレードオフが伴います。計算がメモリアル内で実施されるため、推測実行、プリフェッチ、命令並列実行といった標準的な CPU の最適化は干渉を防止するために無効にされなければなりません。ソフトウェアは PIM リージョンを分離し、メモリーをキャッシュ非対応としてマッピングする必要があります。8 つの 16 GB チップを使用したシステム実装は、Intel の Meteor Lake NPU の計算性能と同等ですが、コスト増の代わりに大きな 128 GB のメモリアドレススペースが必要となります。将来的なソフトウェア適応を簡素化するため、サムスンは計算コマンド用の DRAM インターフェースの拡張や、メモリコントローラを対等な CPU コアとして機能させるように再設計するためのハードウェアアップグレードを推奨しています。究極的には、このイノベーションは既存の標準を用いて高パフォーマンスな AI を実現しますが、アーキテクチャ的な制限と費用増という課題も抱えています。

本文

サムスの LPDDR5X-PIM:インメモリコンピューティングの挑戦と展望

1. 技術的背景とサムスのアプローチ

インメモリコンピューティングは、チップ内部の高い帯域幅の利用や DRAM から計算コアへの長距離遅延パスの回避により、長年にわたり魅力的な提案として注目されてきました。Hot Chips 2026 で、サムスは PIM(Processing-in-Memory)による取り組みを継続することを表明しました。

  • 基本コンセプト: LPDDR5X チップ内に MAC(乗加算)ユニットを実装しつつ、標準的なメモリコントローラーとのインターフェース能力を維持するアプローチを採用。
  • 目的: 従来の「計算と記憶」の分離を打破し、メモリー内処理を実現すること。

2. アーキテクチャと性能特性

バンク構造と帯域幅の活用

  • 通常の DRAM は内部でバンクに分割され、外部バスからは特定バンクへのアクセスが制限されます(通常最大 2 バンク並列)。
  • サムスの LPDDR5X-PIM は、16 バンク搭載の LPDDR5X-9600 チップをベースにしつつ、各バンクにPIM ブロックを配置しています。
  • PIM ブロックは外部バスに依存せず、直結した DRAM バンクを直接アクセス可能。
    • 通常 DRAM アクセス: 最大 2 バンク並列 → 約 76.8 GB/s
    • PIM アクセス: 16 バンク総動員(チップ内部帯域幅全体) → 614 GB/s

MAC アレイと計算能力

  • PIM ブロック内部には、周辺レジスタファイルと制御ロジックを有するMAC ツリーが実装されています。
    • インストラクションレジスタファイル: 1024 ビット(最大 64 つの 16 ビット命令格納可能)。
    • ソースレジスタファイル: 4 kbit(活性化ベクトル用)。
    • スケールレジスタ: 2 kbit(モデル重みのスケーリング係数用)。
  • 計算フォーマット対応: INT8、FP8 などの低精度フォーマットに対応。
    • データクロックあたり 4 つの INT8/FP8 MAC 動作可能(DDR を考慮せず)。
    • 入力重みが 4 ビットの場合はさらにスループットが 2 倍。
  • パッケージ全体の性能:
    • 単一チップ: 2.4 TOPS
    • 8 チップ構成 (128 GB メモリ): 9.6 TOPS(Intel Meteor Lake の NPU とほぼ同等)。
    • 高価な構成となる点には留意が必要。

3. コントローラーとプロトコルの拡張

標準プロトコル内での計算機能開放

  • 標準的な LPDDR5X プロトコルを維持しつつ、計算機能を**外部へ開放(Exposed)**しています。
  • MMIO アドレスのような特別な行アドレスを確保し、モード制御を実現。
    • 単一バンクモード: レギュラー DRAM アクセス。
    • マルチバンクモード: 全 16 バンクにコマンドを適用し、チップ内部帯域幅を活用。

PIM レジスタ有効化モード

  • 特定のバンク用行を有効化することで、読み書きコマンドが PIM レジスタにアクセスするようになります(PIM レジスタ有効化モード)。
  • 想定される ML ユースケースのフロー:
    1. 単一バンクモードでモデル重みを DRAM にロード。
    2. マルチバンクモードへ切り替え。
    3. PIM レジスタ有効化モードへ移行。
    4. ソフトウェアが活性化値、スケーリング係数、操作命令をそれぞれ対応するレジスタに記述。

アドレス同期モード (Address Align Mode, AAM)

  • PIM は SIMD 方式のため、通常は全バンクで同一の操作内容・係数が必要です。
  • メモリコントローラーによるアクセス順序変更時に破綻しないよう、AAMを導入しています。
    • 各命令がアクセスするカラムアドレスからソースレジスタのインデックスを推測させる仕組み。

データフローと初期化

  • 書き込み (PIM レジスタへのデータ注入):
    • マルチバンクモード時、PIM レジスタへの書き込みは全 16 バンクにブロードキャストされます。
    • DRAM パケットサイズは 256 ビット(BL=16)のため、データ充填には 16 コマンド必要。16 バンク分順次行うと合計 256 回の書き込みコマンドが発生(ホスト帯域がボトルネック)。
    • 初期化(Priming)後、マルチバンクモードに戻り読み取りを開始。
  • 読み取り (計算結果の取得):
    • 通常のデータ読み込みではなく、計算開始と PIM ベクトルレジスタファイルへの蓄積
  • 書き戻し:
    • PIM ブロックから VRF(ベクトルレジスタファイル)の内容を DRAM バンクへ書き戻すコマンド発行。

4. システム整合性とパフォーマンス上の課題

メモリ管理とキャッシュの問題

  • 領域の隔離: サムスはホストに PIM 領域をメモリ空間から隔離しています。
    • インターリーブ廃止により、特定のチャンネルを PIM 専用と指定する必要があります。
    • 結果、非 PIM アプリは予約チャンネルから帯域を失い、PIM コードも外部チャネルの計算能力享受できません。
  • キャッシュ不可能 (Uncacheable) マッピング推奨:
    • PIM は DRAM の遅延を緩和するためにキャッシュに依存しない設計です。
    • キャッシュをスキップすることは単独の問題ではなく、PIM の読み取り動作がMMIO 同様副作用(計算)を持ち、不要なデータロードも計算を引き起こすため危険です。
    • CPU/GPU はプリフェッチや順序外実行に依存しているため、これらを無効化すると性能が著しく低下します。

マルチタスク・並列性の壁

  • スレッド間の干渉:
    • PIM モードは DRAM アクセスコマンドの意味を変えます。PIM を利用しながら通常のメモリアクセスを行うことはできません。
    • スレッド間でメモリ領域が共有されると、意図しない計算や誤った結果格納が発生します。
  • ロックと同期の必要性:
    • PIM 領域へのアクセスにはロックが必要ですが、OS 側でこれを実装するのは困難です。
    • 理想的には OS が PIM 計算コード実行時に他のスレッドをブロックし、割り込みを無効にする必要がありますが、これによりシステム応答性が悪化します。
  • コンテキストスイッチング:
    • スレッド切り替え時には、PIM の状態(各種レジスタの内容)を保存・復元する必要があり、オーバーヘッドが発生します。

5. ソフトウェア実装の難しさと将来への提言

ソフトウェアレベルでのハードル

  • パラダイムシフト: 既存の CPU/GPU パラダイムでは直感的に利用できません。
  • データ移動のコスト: PIM ブロック間は直接通信できず、結果の利用には通常の DRAM リード・ライトが必要になります。
  • 透明性の欠如: ハードウェア固有の実行バイナリを送信するため、移植性が低いです。

理想的なインメモリコンピューティング実現に向けた機能提案

ソフトウェアの導入を簡素化し、システム負荷を軽減するためのハードウェア機能の追加が望まれます。

  • モードスイッチングの簡素化: DRAM インターフェース拡張により、計算コマンドを追加しモード切り替えの複雑さを排除。
  • メモリコントローラーのキャッシュ一貫性確保:
    • CPU コアと同様の対等な存在として振る舞わせる。
    • 影響を受けるキャッシュラインに対し
      read-for-ownership
      (RFO) リクエストを発行し、変更データを DRAM に書き戻す。
    • インメモリ計算完了まで所有権を維持させ、CPU がキャッシュバイパスなしで結果を安全に観測可能にする。
  • 新しい CPU 命令セットの導入:
    • 例:「
      rep macb
      」のような命令を追加。
    • 固定乗数を用いたメモリーブロック全体に対する乗加算操作を実行(数値的特性は未定義)。
    • ハードウェアが自動的に最適場所(DRAM 内計算かキャッシュ内計算か)を選択できる判断を可能にする。

結論

サムスの LPDDR5X-PIM は、標準コントローラーとの互換性を保ちながら劇的な性能向上を試みました。しかし、マルチタスク OS の整合性やキャッシュ戦略など、ソフトウェア実装における高い挑戦が残されています。ハードウェアのさらなる拡張(一貫性維持、透明な命令セット)なしには、PIM を広く利用するには至らないでしょう。

同じ日のほかのニュース

一覧に戻る →

2026/08/30 4:33

騰訊發布並開源騰訊Hy4預覽版

## Japanese Translation: 以下の改良版は、完全性を保ちながら読みやすさを維持するため、不足していた技術仕様と性能指標を組み込んでいます。 ## 改善された要約 Tencent は次世代の 770B パラメータを持つ大規模言語モデル(アクティブパラメータ:49B)「Hy4 preview」をローンチしました。このモデルは高生産性タスクに特化して最適化されており、1M トークンを超える広大なコンテキストウィンドウを備えています。Hy4 はシリーズ初となる自主的なトレーニングおよび推論システムの最適化を実現し、オペレーターフュージョンによりエンドツーエンドのスループットを 31.8% 向上させました。内部での盲目評価において、203 のエンジニアリングタスクにわたる 163 名の専門家によって行われ、GLM-5.3(2.92)および Kimi K3(2.94)に対してそれぞれ 2.99/4.00 と高いスコアを記録し、主要競合他社を上回りました。 ソフトウェアエンジニアリング、ゲーム、金融、科学の分野で Tencent の専門家によって共同作成された高品質なデータを用いてトレーニングされた Hy4 は、長文脈開発、単一のプロンプトからのゲームプロトタイピング、分子動力学や物理学などの科学研究分野において明確な優位性を発揮します。現在、Hy4 は Tencent Cloud TokenHub および OpenRouter を介して世界中で利用可能であり、競合的 API 料率(入力トークンあたり 83.4 米セント)で提供されています。同モデルは WorkBuddy および CodeBuddy の Tencent プラットフォーム上で 2 週間無料利用が可能ですが、前世代の Hy3 は引き続き 9 月 30 日までの間アクセス可能です。

2026/08/24 14:09

Tether:Linux での iMessage や SMS の利用

## Japanese Translation: テザー(Tether)は、iPhone とペアリングされた際の macOS の「Continuity」機能——iMessage、SMS、コンタクト同期、通知、ファイル共有、クリップボード同期、ワンタイムパスワード(OTP)の自動入力——を Linux へ統合し、KDE Connect など既存ソリューションが補えていないギャップを埋めています。セキュリティは当初から最優先事項であり、iOS と Linux の通信には mTLS 暗号化を採用し、定期的に Opus および Fable のセキュリティスキャンを実施することで実現しました。他のメールクライアントへの広範なサポートはまだ利用できません。開発者はバックエンド開発を優先し、拡張子の移植には集中しないためです。OTP の自動入力は、Zen Browser(Firefox)と Betterbird(Thunderbird)向けのブラウザおよびメール拡張機能を通じて行われ、メールからコードを拡張機能へ送ってログインフォームの自動埋め込みを実現します。 直接の iMessage/SMS アクセスのための Bluetooth 統合は、GPL ベースのプロジェクト(例:ancs4linux や BlueFerry)とのライセンス衝突を避けるために、独自のカスタム C++「クリーンルーム」手法を用いて実装されています。テザーは引き続き MIT ライセンスを採用しています。現在の Linux ベースのデーモンは、Tailscale などの earlier プロキシ方式と比べてより優れた直接的な接続体験を提供しており、ユーザーからは不快であると評価されていました。iOS アプリが先に登場し、当初は基本的なクリップボード同期のみを処理し、その後に広範な Continuity スタックが構築されました。 ファイル共有およびプッシュ通知は直ちに利用可能ですが、ハードウェア制約や Bluetooth 切断の問題など、将来のアップデートにおける課題依然存在しています。特に Bluetooth の実装は 2026 年においてもエッジケースが多いため困難です。本プロジェクトは金銭的利益よりも真なる価値と満足感を提供することを目指しており、シームレスなクロスプラットフォーム接続を求める技術愛好家にとってユニークなツールとなっています。バグレポート、機能要望、翻訳、ドキュメントなどの貢献をコミュニティから歓迎します。

2026/08/30 3:22

vLLM 0.28.0

## Japanese Translation: このリリースは、主要なアーキテクチャ変更と拡張ハードウェアサポートにより AI 推論を加速することに焦点を当てた決定的なアップグレードです。主なパフォーマンス向上としては、ファインズドカーネルによって大きなモデル(特に MegaMoE)で最大 1.5〜3 倍の高速化、推論の最適化(DFlash2/DSpark)、GPU ごとに約 17 GiB のメモリ節約を実現する共有エキスパートシャッディングなどがあります。この更新はハードウェア互換性を大幅に拡大し、NVIDIA アーキテクチャ(Blackwell SM90/B12X を含む、ネイティブな DSA/FlashInfer パスを備えたもの)および AMD ROCm プラットフォーム(gfx950/gfx120x)、MLA および FP8 推論向けの特定の最適化を可能にします。 機能面では、Weight Offloading、マルチレイヤー MTP KV キャッシュ、アテンション不要なモデルサポートといった機能を備えた Model Runner V2 が導入されました。また、バッチトークン上限値を 16384 に倍増させたり、Mamba モデルにデフォルトでプレフィックスキャッシュを有効化したりするなどの推論デフォルトも標準化されています。エコシステムの主要な更新としては、PyTorch 2.12 と Transformers 5.15.0 への移行が必須となり、ディスクオフローディングをサポートする階層型 KV キャッシュシステムが追加されました。さらに、gRPC を通じたネイティブ Rust フロントエンドサポートが追加され、Muse Glimmer、Ling 3.0 Flash、Qwen3.8 など多数の新しいモデルへの対応も開始(AMD 向け)。組織は、これらの高度な機能を利用するために、非推奨化された関数や特定の依存関係に関する破壊的な変更に対応する必要があります。