Show HN: LLM のアテンション可視化

2026/09/09 1:59

Show HN: LLM のアテンション可視化

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

大規模な改善は必要なく、用語を元のリストと整合させるためのわずかな調整だけで精度を向上させることができます。以下に若干改訂したバージョンを示します。

この可視化ツールは、大規模言語モデル(LLM)が新しいテキストを生成する際に過去の情報をどのように選択的に取り出すかを示し、確率的な性質にもかかわらず誤りを最小化するため特定のデータをコピーに大きく依存していることを解き明かします。すべての層を通じて値ベクトルの大きさをスケーリングした注意重みを取り、すべてのヘッドで集約することで、インターフェースは現在の出力に影響を与えた過去のトークンを正確に強調表示します。例えば、ユーザーは「remain」といった生成された単語をタップするか、カーソルを移動させることで、「work」や「stay the same」といったソースフレーズがどのように組み合わさっているかを見たり、ある例ではJavaScript関数がそのまま書き換えられて再生产されている様子を観察したりできます。これらの知見はAIの意思決定における「ブラックボックス」を解明し、開発者に対して内部メカニズムへの透明なウィンドウを提供することで、より良いデバッグや信頼構築を可能にします。本ツールはTransformers.jsをカスタムReactアプリケーション内に構築しており、内部モデル値へのアクセスのために生成ループのカスタム実装が必要となります。標準的なWASM経由のONNXファイルでは定義されていない出力を容易に露出できないため、この目的のためにスクリプトを使ってONNXファイルが改修されました。将来の開発には、長手のベースモデルダウンロードなしにブラウザ内で生成を実行するためのHugging Faceリポジトリにアップロードされた計装済みモデルが含まれる一方で、すべてのコードおよび実装の詳細は関連するGitHubリポジトリで利用可能です。

本文

Transformer 系大規模言語モデルの可視化と選択的メカニズム

背景:選択的な注意力機構

Transformer 系の大規模言語モデルには、興味深い特性が存在します。特に生成フェーズにおいて以下の点が重要です。

  • 情報の非均等性: その時点で既に生じているトークンから情報を抽出可能ですが、すべてのトークンが均等に影響を与えるわけではありません。
  • 選択的メカニズムの必要性: 効果的な動作のためには、前のトークンが次のトークンにどの程度影響するかを決定する機構が必要です。

可視化の仕組みと手法

この「選択的メカニズム」は、実際に見え隠れする現象として確認できます。

  • 操作方法: 生成されたトークンのいずれか上でタップしたりマウスカーソルを動かしたりすると、その生成に影響を与えた過去のトークンが視覚的に表示されます。
  • 表示ロジック(簡略化への注釈):
    • 「Affected(影響を受けた)」という表現は厳密ではありません。
    • 可視化には、すべてのレイヤーと注意力ヘッドを横断して計算された注意ウェイトと、値ベクトルの絶対値を掛け合わせた総和値が使用されます。
    • この値に基づいて過去のトークンの不透明度を制御しています(最大値を持つトークンのみ不透明度 1 に固定され、他は補間表示)。

留意点: 各過去トークンに単一の数値を割り当てることで多くの情報は失われていますが、直感的ではない懸念とは裏腹に、面白いパターンが見えてくるのが実情です。

具体的な観察例

1. Office Move Summary プロンプト

デフォルトのプロンプトにおける「住所」や「日付」といった文字通りのコピー行為について。

  • 現象: 元データをコピーされたテキスト部分(例:住所や日付)にカーソルを移動させると、元データが際立って表示されます。
  • 理由: 生成トークンが源データを多く取り入れているためです。

2. 「Debugging an Average Function」の例

小型モデル(約 6 億パラメータ)による関数再構成実験の結果です。

  • 成果: 意図的な変更を除けば、JavaScript の関数全体を容易に再生产出せることが確認できました。
  • 限界: 問題箇所そのものを特定する能力はなく、ヒントを与える必要がありました。

3. 「Office Move Summary」内の文脈統合

フレーズ "Existing access cards and phone numbers remain" における "remain" へのカーソル合わせで確認された現象です。

  • 抽出される単語:
    1. "Existing employee access cards will work""work"
    2. "company phone numbers will stay the same""stay the same"
  • 洞察: 2 つの異なるフレーズから、単語レベルで情報を組み合わせている点が非常に魅力的です。

実装の詳細と技術的課題

この可視化を実現するためのアプローチと技術的制約について解説します。

アプリケーション構成

  • ベース技術:
    Transformers.js
    を用いた、テキスト生成のための React アプリケーション。
  • 開発手法: より多くのデータを抽出・表示する必要があるため、通常の生成ループでは対応できず、**即興コーディング(vibe coding)**でアプローチしました。

データ処理とモデル読み込み

  • 容量問題: 小型モデルを使用していますが、それでも数百メガバイトに達するため、ダウンロードを待たせる現実的ではありません。
  • 対策: アプリ起動時に多数のプロンプトを事前に読み込んで表示できるように準備しています。

ONNX と Transformers.js の制約

  • 現状の限界:
    Transformers.js
    は ONNX ファイル(全計算グラフを含む)を使用しており、モデルロジックは WebAssembly (WAS) で実装されています。これにより、定義されていない出力情報へのアクセスは困難です。
  • 解決策: 通常の ONNX モデルでは不可能な可視化を実現するため、ONNX ファイルをわずかに改修して内部値を外部化するスクリプトを作成しました。
  • 動作フロー: ブラウザ上で生成機能を維持しつつ、アプリから別の「計装済みモデル(instrumented model)」をアップロードし指すように設定します(詳細は Hugging Face リポジトリ参照)。

コードの入手方法

実装コードは GitHub リポジトリより入手可能です。

[GitHub リポジトリへのリンク] (※本文に記載なし)

同じ日のほかのニュース

一覧に戻る →

2026/09/08 23:55

Google DeepMind、AlphaGenome アトラスをリリース

## Japanese Translation: ## サマリー: Google DeepMind は、ヒトゲノムにおけるあらゆる可能な単一ヌクレオチド変異の影響を予測することを目的とした画期的なツール「AlphaGenome Atlas」を導入しました。この 1 ペタバイト規模の巨大データセットは、全ての 90 億個の可能性のある変化について事前に影響を計算しており、「AVI スコア」というスコアを用いてどの遺伝的変異が最も重要かを瞬時に優先順位付けします。この革新は、稀少疾患の原因特定という重要な課題に対処しており、例えば広域研究所(Broad Institute)で同定された *DNM1* 遺伝子の特定の突然変異によって誤ったスプライスサイトが作成される問題に対処しています。さらに、54,000 人以上の UK Biobank 参加者のデータに適用した際、アトラスは非コード領域と身体質量指数(BMI)との新しい関連性を発見しました。予測された分子効果に基づいて変異をグループ化することで、従来の手法よりも 22% も多くの関連性を明らかにし、BMI に関連する 19 の遺伝的領域を同定しました。複雑で高度なプログラミングスキルを必要とする以前の手法とは対照的に、このツールは直感的なウェブサイトポータルを通じてアクセス可能となり、世界の臨床研究者へのアクセスを民主化しています。結局のところ、アトラスは科学者が膨大な技術的専門知識を必要とせずに最も有望な遺伝的なリードにリソースを集中させることを可能にし、発見のスピードを加速させています。

2026/09/09 5:07

MacBook Pro で 4 つの SSD からストリーミングし、トークン速度が 1 トークン/秒の Kimi K3(2.8T)

## 日本語翻訳: 元のサマリーは読みやすいですが、Key Points List に含まれる数量的な深みに欠け、欠落している指標なしでは具体的なパフォーマンスに関する主張を評価することが困難です。以下の改良版は、重要なデータポイントを取り入れつつ文脈の流れを維持したものです: ## サマリー このプロジェクトは、ARGODRIVE の Deltafin フォークを使用して、アップストリーム仕様に従い(専門家プリューニングやウェイトの減少など、品質を犠牲にするショートカットを導入しない)、Apple M5 Max MacBook Pro(128 GB RAM)上で 2.8T パラメータの Kimi K3 MoE モデルをフルスケールで展開することを実証しています。**パフォーマンス分析**によると、デコードスループットはプロンプト長に応じて約 0.96〜1.13 tokens/s(アップストリームの約 0.68 tokens/s)と安定しています。しかし、このセットアップには 512 トークンのプロンプトに対する「最初のトークンまでの時間」(Time to First Token)の遅延が約 375 秒と大きく、これはプリフィル中に特定のメモリ専門家を読み直す効率が悪い(具体的には各レイヤーの専門家を 8 倍読み返す)ことが原因です。SSD スケールは対数曲線に従い、最も低速なレイヤーがペースを規定します。ドライブを追加しても収益性が低下し、1 ドライブがベースラインである 4 ドライブの約 52%、2 つのミラーリングが約 73%、3 ドライブが約 90% を提供します。このプロジェクトは、精度を犠牲にして(例えば専門家のウェイトを約 3 bit に減少させるなど)人工的に速度を上げる他のイニシアチブと区別されます。ユーザーは `--full` モード(1.7 TB のローカルダウンロード)または `--stream`(オンデマンドキャッシング)のいずれかを選択できます。デフォルトでは Inferact の Kimi-K3-DSpark が含まれており、生テキストタスク用にはオプションの Qwen アクセラレーラーが用意されています(チャット速度ではありません)。コードは MIT ライセンスで公開され、Moonshot AI と何らの関係もありません。アップグレードには `cargo build` を通じた手動メンテナンスが必要であり、アップストリームのライセンス条項に従っています。将来の計画は、プリフィルの読み直し問題を解決して起動遅延を排除することに焦点が当てられています。

2026/09/09 6:47

大規模言語モデルが適応的探索によって新たな社会的バイアスを発明する

## Japanese Translation: OpenReview にアクセスする前に、新規ユーザーは作業を続行するには強制のセキュリティ検証手順を完了する必要があります。既存のアカウント保有者は直接ログインすることでこの要件を回避でき、これにより自動的にメインインターフェースに遅延なくリダイレクトされます。その結果、新規ユーザーはチェックを完了させるまでワークフローを一時的に停止する必要があり、登録済みアカウント向けの免除を利用しない限りです。組織が新しい人材オンボーディングを行う場合、これらの個人が認証を完了する間、一時的な摩擦が発生する可能性があります。したがって、このプラットフォームは新規参入者に対して厳格な入場を強制し、一方で検証済みのユーザーにはシームレスなアクセスを維持します。

Show HN: LLM のアテンション可視化 | そっか~ニュース