
2026/09/30 4:20
Show HN:TurboGPT。22KiB の変換器を13秒で学習
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
MIT 開発の「Tiny byte-level GPT」プロジェクトは、CUDA C++ を用いて生のバイト列に対して直接 GPT モデルを訓練することを示しており、hn1g モデルが 15 ビリオン以上のトークンを処理した後、2.53 bits per byte (BPB) の低い損失値に到達したという効率性を実現しています。
turbogpt.exe 実行ファイルを成功裏に動作させるには、特定のビルド環境が必要です:Linux または NixOS、あるいは Windows で Visual Studio 2022 C++ ツールおよび CUDA 13.4 を使用すること。システムは .pt ファイル(モデル、optimizer、scheduler、trainer の状態を含む)に保存されたチェックポイントを使用して --load フラグにより中断された訓練セッションを再開することをサポートしています。開発者は OS と互換性のあるコンパイラと CUDA バージョンを確保することで失敗を防ぐ必要があります。--data フラグで入力ファイル(例:hn1g.txt)の初期化後、ツールは指定されたディレクトリ(例:runs/ctx4)に TensorBoard 互換のロギングを行い、各バッチについて上限 8Mi のレポートを生成します。追加の構成には、GPU の計算能力用の CudaArch を設定し、長期的な実験の安定性とデータ損失を防ぐことを含みます。本文
CUDA C++ で実装した微小 GPT トレーニング成果報告
ライセンス
- 本コードは MIT ライセンス を採用しています。
ビルド方法
各環境に対応するビルドコマンドを以下に示します。
-
Linux / NixOS
nix-build -o build/nix-result -
Windows (Visual Studio 2022 + CUDA 13.4)
は、NVIDIA 公式の GPU リスト に記載されている計算能力(Compute Capability)に対応する必要があります。CudaArch
実行方法
トレーニングを実行するには以下のコマンドを使用します。
build\turbogpt.exe --data hn1g.txt --log-to runs/ctx4
サブディレクトリと出力ファイル
- チェックポイント保存先:
runs/ctx4/ctx4.pt- モデル、最適化器、スケジューラ、およびトレーナーの状態が含まれます。
- 再開方法:
オプションを指定することで以前のセッションを継続できます。--load CHECKPOINT.pt
- ログファイル:
runs/ctx4/report.json- ログディレクトリから自動生成されたレポートです。
ログ機能の概要
- 互換性: テンソルボード(TensorBoard)と完全な互換性があります。
- 出力粒度: バッチごとのレポートを出力します。
- 容量制限: 最大 8 MiB のレポートサイズに制限されています。
- 書き込みタイミング: チェックポイントの保存時(定期的または最終的に)にファイルを書き換えます。
トレーニング結果
15 億トークン分トレーニングを行った
hn1g モデルの評価結果です。
| メトリック | 値 |
|---|---|
| BPB (Bits Per Byte) | 2.5295 |