AMD が推論性能向上のためにモデルをシリコンに刻むことでタラアスを取得

2026/08/07 5:23

AMD が推論性能向上のためにモデルをシリコンに刻むことでタラアスを取得

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

AMD がトロントに本社を置くスタートアップであるタラス(Taalas)を買収したことは、AI ハードウェアの景観において大きな転換点を意味し、従来の「メモリ内計算」アーキテクチャを通じて NVIDIA の支配的地位に挑戦することを目的としています。標準的な高帯域幅メモリとは異なり、タラスのチップはマスキング ROM ファブリックを使用して静的な重み値をシリコン上に直接刻み込み、動的な KV キャッシュのために SRAM 呼出ファブリックを使用するモデル専用集積回路(MSIC)として動作します。このアプローチにより、AMD は既存の Instinct GPU アーキテクチャ内で、GPU がプロンプト処理を担いながらタラスのチップがトークン生成を担当するという disaggregated な形でこれらの専門的なアクセラレーターを展開できます。初期のベンチマークでは、HC1 チップは Meta の Llama 3.1 を処理する速度において、現在の NVIDIA GPU よりも 48 倍、Cerebras のアクセラレーターよりも 8.5 倍高速であることが示されています。さらに、重み値をシリコン上に刻むことにより、この技術は従来の方法に比べてトレーニングコストを 100 分の 1 に削減すると推定されます。しかし、この効率性には代償があります:顧客はモデルロックインに直面しており、これらのチップを導入するには、大規模なモデル更新に対して単なる LoRA アダプターではなく、コストのかかる「再スピン」(金属層の変更)を必要とします。規制上の承認が必須であるにもかかわらず、本取引は第 4 四半期に完了する見込みであり、夏には 200 億パラメータ向けに設計された次世代 HC2 チップの登場へと道を開きます。OpenAI、Anthropic、Meta など主要な AI プレイヤーは既に Instinct の顧客であり、AMD はこれらの柔軟で高性能なソリューションを通じて業界のワークロードを再構築する位置づけにあります。

本文

AMD、推論性能 10 倍超を実現するタアラス社の買収で NVIDIA に挑戦へ

AMD は AI ハードウェア市場における NVIDIA の支配地位を揺さぶる最新戦略の一環として、AI チップ企業である タアラス社(Taalas)の買収を発表しました。 本提携は木曜日の市場終値時に発表されましたが、詳細な開示はありませんでした。

  • 本質: 事実上の完全買収であり、単なる人材獲得(アクイザション)とは異なります。
  • 技術的特徴: モデルの重みをシリコンに直接「焼き付ける」ことで、推論性能を 10 倍からさらに高い水準へ引き上げる可能性があります。
  • 文脈: NVIDIA の Groq とのライセンス契約(200 億ドル)に基づく「高品位・高速化・低コスト」な推論サービスという潮流と一致しています。

革新的なアーキテクチャ:モデル特定統合回路(MSIC)

2023 年にトロントに設立されたタアラス社は、従来の GPU や Groq の LPU、Cerebras の WaferScale Accelerator とは著しく異なるアプローチを採用しています。

チップの構造と性能

  • 基本コンセプト: モデル重みを HBM で記憶させるのではなく、シリコンに直接エッチングして記録します。これを「モデル特定統合回路(MSIC)」と呼びます。
  • 実証結果(HC1 チップ):
    • 今年 2 月、TSMC の 6nm プロセスで製造されたテストチップ「HC1」が公表されました。
    • ベンチマーク性能: Meta の Llama 3.1 8B モデルを毎秒 16,960 トークンの速度で処理可能でした。
    • 比較優位性:
      • NVIDIA GPU:約 48 倍の高速化
      • Cerebras アクセラレータ:約 8.5 倍の高速化
    • 注記: この検証は概念確認を目的としており、Llama 3.1 は既に旧モデルと見なされます。
  • 実作動原理: 秘密に包まれているものの、以下の 2 つの領域から構成されています。
    1. マスク・ROM リコールファブリック: モデル重みをエッチングするための領域。
    2. SRAM リコールファブリック: KV キャッシュや微調整アダプタを格納する領域。

第 2 世代 HC2 チップとインフラ効率

今年夏に登場予定の次期チップ「HC2」では、パラメータ数を 200 億まで拡大させる計画です。

  • スケーリング手法: GPU と同様、パイプライン並列化を用いて複数のアクセラレータへ重みを分散させます。
    • 例:1 チップあたり 200 億パラメータの場合、1 トリリオンプARAM モデルには 50 基のアクセラレータで十分です。
  • AMD の強み: レックスケール(巨大規模)の計算プラットフォームと社内システム設計チームを既に保有しています。
  • 効率性の比較:
    • NVIDIA LPX システム:数十基の GPU + 少なくとも 2,000 基の Groq LPU を必要とします。
    • タアラス社方案例: はるかに高いスペース効率と電力効率を実現できます。

展開シナリオの推測

AMD は以下のような戦略を採ると予想されます。

  1. ** disaggregated(分離型)アーキテクチャ**:
    • Instinct ベースの Helios レックと組み合わせて展開。
    • GPU で計算集約的なプロンプト処理を行い、トークン生成部分はタアラス社製アクセラレータへオフロード。
  2. 段階的移行戦略(tick-tock サイクル):
    • 顧客が初期段階で Instinct でモデル導入・検証を行ってから、徐々にタアラス社製へ移行させる手法。

AMD AI 担当 SVP バムシ・ボッパナ氏は:

「AMD は、あらゆる AI ワークロードに最適な計算ソリューションをデプロイできるフルスタック AI プラットフォームを構築しています」

重大な課題と制約

技術が高効率である一方、運用上には決定的な欠点があります。

  • モデル固定化: チップが配備されると、そのチップにモデルが固定されてしまいます。
  • 変更のハードル: LoRA アダプター程度の軽微な変更を除き、モデルの変更にはチップを再製造(リスピン)する必要があり、莫大な費用と時間がかかります。
  • 採用条件: 新しいモデルはほぼ月次でリリースされるため、AMD の顧客側がモデル選定に際し、非常に確固たる決断を下す必要があります。

リスピンの現実

  • タアラス社側は悲観的ではなく、ゼロからやり直すわけではありません。
  • 金属層の変更が 2 層だけであるため、費用面でも時間面でも大幅に軽減可能です。

シナリオ:開発・インフラへの影響

この技術は主に AI モデル開発者、インフラプロバイダー、推論プロバイダーによって展開されると見られます。

インフラプロバイダー向け

  • コスト劇的削減: フロンティアモデルのトレーニングコストを従来の1/100 に抑えることが可能になる(ザ・ネクスト・プラットフォームインタビューより)。
  • 主要顧客の獲得: OpenAI、Anthropic、Meta は Instinct の主要顧客であり、AMD が強い交渉力を持っています。
  • ハイブリッド運用: GPT や Claude がタアラス社製アクセラレータと Instinct を組み合わせて稼働するのは自然な流れです。

モデル開発者向け

  • テストタイムスケーリングの進化:
    • 現状:ハルシネーション削減のため、精度向上に時間を割く(コスト高・待ち時間長)。
    • 展望:トークン単価が下がり、出力速度が 10〜20 倍になることで、論理推論時間をさらに延長する選択が可能になります。

今後の見通し

  • 位置づけ: タアラス社が AMD の全体ビジョンにどう統合されるかは確認中ですが、買収は確実です。
  • 完了時期: 規制当局からの承認を得られれば、今年第 4 四半期に取引完了と見込まれています。

同じ日のほかのニュース

一覧に戻る →

2026/08/06 0:33

NSFインウイェー太陽望遠鏡が隠された太陽過程の重大な発見をもたらす

## Japanese Translation: 2026 年 8 月 5 日、NSF NSO、NSF NCAR HAO、および MPS に所属する研究機関を含む国際チームは、「Nature」誌に重大なブレークスルーを掲載し、太陽表面におけるケルビン=ヘルムホルツ不安定性(KHI)の初の実験的確認を発表した。NSF デイヴィッド・K・イノーイ太陽望遠鏡—which はその 4 メートルの主鏡によって匹敵する解像力を提供した—を使用して観測者は、渦距離が 50–65 km の渦状の極細な旋回パターンを捉えた。このパターンは 416 nm の波長において、モルアイに見られるような構造を示していた。これらの観測は磁気要素の変形された境界線と縞構造を明らかにし、物理ベースのシミュレーション(MURaM コード)および解析理論と完全に一致した。この発見は、KHI が磁場線をねじり、プラズマの混合を駆動し効率的な拡散を行う自然なエンジンとして機能することを確認している。この機構は、太陽の 11 年周期の磁気サイクルの説明、ならびに磁気エネルギーがどのように蓄積し日食爆発を燃料とするかを詳述することで「コロナ加熱ミステリー」の解決に不可欠である。将来の自動解析ではエネルギー転送量および宇宙天気への影響を定量化し、地球基盤技術を混乱させる爆発的な太陽嵐に対する予測を大幅に向上させるだろう。 ## Text to translate: "On August 5, 2026, an international team including researchers from NSF NSO, NSF NCAR HAO, and MPS announced a major breakthrough in *Nature*: the first experimental confirmation of Kelvin-Helmholtz Instability (KHI) on the Sun's surface. Using the NSF Daniel K. Inouye Solar Telescope—which delivered unmatched resolving power via its four-meter mirror—observers captured ultra-fine swirling patterns resembling whirlpools with vortex distances of 50–65 km at a wavelength of 416 nm. These observations, which revealed deformed boundaries of magnetic elements and striped structures, matched perfectly with physics-based simulations (MURaM code) and analytical theory. The discovery confirms that KHI acts as a natural engine, twisting magnetic field lines to drive plasma mixing and efficient diffusion. This mechanism is vital for explaining the Sun's 11-year magnetic cycle and resolving the 'coronal heating mystery' by detailing how magnetic energy accumulates and fuels solar flares. Future automated analysis will quantify energy transfer and impacts on space weather, significantly improving predictions for explosive solar storms that disrupt Earth-based technology."

2026/08/07 6:49

Show HN: ポケットモンスターエメラルドをRaspberry Pi Pico 2 に移植しました

## Japanese Translation: 報告される最も大きな成果は、252 MHz で動作し、1 秒間に 60 フレームの画率を実現することで、Pokémon Emerald が WeAct Studio Core2350B マイクロコントローラー (RP2350B) にてネイティブに正常に動作することに成功した点である。本システムは、オンボードフラッシュストレージから直接フルゲームプレイ、電源サイクルを超えた持続的なセーブデータの保存、ハイクオリティな HD 対応 HDMI 出力を提供し、従来のエミュレーションオーバーヘッドを排除している。本プロジェクトでは、元のアーム v4T コードを現代的な Cortex-M33 コアに書き直し、コア 1 上でソフトウェア的にゲームボーイアドバンスのビデオハードウェアを実装し、コア 0 でゲームロジックを担当させることでこの成果を実現した。また、既存のオープンソースエコシステムを活用し、pokeemerald-wasm のハードウェア抽象化層と参照ラスタライザーを用いてバイト単位正確な PPU 検証を確保している。 しかし、ハードウェアおよび実装上の制約により、高度な機能は未完了の状態である。オンライン取引、対戦、ミステリーギフト、リンクケーブルサポート、RFU は利用できない。これは、Emerald が要求する特定の RTC ビットバンギング機能が不足している(カートリッジ GPIO の読み取り値がゼロ)ためである。音響システムは m4a エンジンを使って音楽を再生するが、DPCM および逆再生楽器については無音のスタブが含まれており、フレームレート連動型のミキシングにより 60 fps 未満でアンダーランが発生する可能性もある。さらに、シネマティックなイントロは最適化された高速パスの欠如によりメインループよりも若干遅く実行される。ビルドプロセスには、標準形式からアセットを生成し、ソースコードを単一のイメージにコンパイルして 16 MB の QSPI フラッシュから実行し、読み込み用の `.uf2` ファイルを作成することを含んでいる。このマイルストーンにより、複雑なゲームボーイアドバンスタイトルが極めて低コストのマイクロコントローラー上で効率的に実行できることが証明され、レトロゲーミング愛好家向けに新たな予算フレンドリーなプラットフォームを提供するとともに、コアとなる作業は MIT ライセンスの下で公開される(上流のアセットおよび ROM は除く)。

2026/08/06 20:24

マリオがパレートの法則と出会う

## Japanese Translation: 最適な「マリオカート」のドライバーを見つけるには、単一の指標に依存するのではなく、スピードと加速度の両方の統計量をバランスさせる必要があります。少なくとも他のいずれかの候補よりも両カテゴリで劣るドライバーは「支配されている」とみなされ、破棄できます。例えば、カオパはキャットピーチ(同じ加速度で低速)やトードレット(低速)に支配されており、トードレット自体もより高い加速を持つ別の選択肢に支配されます。他のどのオプションにも支配されないドライバーの集合が**パレト前線**(または境界)を形成し、不適切な選択肢を除外するための客観的なフィルターを提供します。しかし、この前線上にあるすべてのドライバーが同等に望ましいわけではありません。プレイヤーは、バランスの取れた両方の統計量を維持するために、境界その端にあるものを避ける傾向があります。結局のところ、パレト効率は選択肢を絞り込むのに役立ちますが、最終的な選択を決定づけるものではありません。最適なドライバーは、あなたの特定のプレイスタイル、個人のスキルセット、スピードと加速度のどちらを重視するかによって異なります。このフレームワークは、競技プレイヤーが非効率なビルドを素早く排除しつつ、独自の嗜好に対する柔軟性を維持するよう支援します。