GigaToken:言語モデルのトークナイゼーション速度が約1,000倍高速化

2026/07/23 2:20

GigaToken:言語モデルのトークナイゼーション速度が約1,000倍高速化

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Gigatoken は、HuggingFace および tiktoken などの標準的なトークナイザーの超高速で即座に置き換え可能なものとして機能し、ネイティブ API を通じてデータ処理を革命化します。これは、マルチスレッド Rust プログラミング、SIMD 最適化、キャッシュ階層の改良、分岐の最小化といった高度なエンジニアリング技術によって達成された画期的成果です。ベンチマーク結果では、EPYC 9565 などの高エンド AMD プロセッサ上において、HuggingFace のトークナイザーよりもほぼ 989 倍、tiktoken よりも 681 倍以上の高速化が確認されています。

本ソフトウェアは、Llama 3/4、Qwen、Gemma、Phi-4、DeepSeek、GLM、Nemotron、Kimi K2、Mistral、CodeLlama などの主要な AI モデルをサポートします。スタンドアローン API(最も高速)および HuggingFace または Tiktoken を既存のワークフローで使用するための互換モード(わずかに低速)を備えています。本ツールは現在、Linux ベースのシステム上で AMD EPYC、Apple M シリーズ、または AMD Ryzen チップを使用する際に最適化されたバイト対ペア符号化を用いて最も効果的に動作し、Windows でのサポートは限られています。ユーザーには WSL の使用を推奨します。

今後の計画としては、Python インテグレーションの改良(現在は ABI3 を使用しており、これは内部 API よりもわずかに低速)およびさらなる最適化によるハードウェア互換性の拡大が含まれます。現在知られている制限事項には、API におけるファイルシンクの欠如と SentencePiece 最適化の制限があります。最終的に、Gigatoken は精度を損なうことなく、モデルトレーニングと推論を大幅に高速化するトークナイゼーション時間を劇的に削減することを約束します。研究用途については、@software{roed2026gigatoken...} として引用されるべきです。

本文

Gigatoken:HuggingFace トークナイザ 1,000 倍高速化の代替品

Gigatoken は、言語モデル向けの最も高速なトークナイザーです。テキストデータを GB/s の速度でトークナイゼーション(文字分割)することを可能にします。

  • 性能向上: HuggingFace トークナイザーと比較して約 1,000 倍高速
  • 互換性: ほぼすべての一般的なトークナイザーをカバー。
  • 実用性: 即座に取り替え可能な代替品。

注釈: HuggingFace トークナイザーと

tiktoken
は既にマルチスレッド Rust で動作していますが、Gigatoken はそれ以上の性能を発揮します。


特徴とベンチマーク

  • 広範な対応: 幅広い CPU ハードウェアに対応。
  • カバー範囲: ほぼすべての一般的なトークナイザーの形式をサポート。
  • 詳細数値: スループットの具体的な数字は公式ベンチマーク結果を参照してください。

インストールと使用方法

1. 互換モード(最も簡単)

既存の HuggingFace トークナイザーや

tiktoken
のコードからの変更を最小限に抑える方法です。

基本動作例 (HuggingFace)

import gigatoken as gt

# HF トークナイザーを初期化 (例:...)
hf_tokenizer = ... 

# Gigatoken ウラッパーに変換
tokenizer = gt.Tokenizer(hf_tokenizer).as_hf()

# 既存の API で使用可能
tokens = tokenizer.encode_batch(["これはテスト文字列です", "そしてここがもう一つ"])

基本動作例 (tiktoken)

import gigatoken as gt

# Tiktoken トークナイザーを初期化 (例:...)
tiktokenizer = ...

# Gigatoken ウラッパーに変換
tokenizer = gt.Tokenizer(tiktokenizer).as_tiktoken()

# 既存の API で使用可能
tokens = tokenizer.encode_batch(["これはテスト文字列です", "そしてここがもう一つ"])

重要な注意点:

  • 互換モードでは、HuggingFace トークナイザーの出力結果を完全に再現するように多大な努力が払われています。
  • ただし、この互換性確保には一定のパフォーマンスコストがかかります。
  • 1,000 倍という極限的な高速化は達成できませんが、全体的な速度向上は期待できます。

2. Gigatoken API(最高性能)

最大パフォーマンスを発揮する設定方法です。モデル名を直接指定したり、ファイルから読み込むことも可能です。

モデル名を指定して初期化する際

import gigatoken as gt

# HF モデル名を受け入れます
tokenizer = gt.Tokenizer("Qwen/Qwen3-8B") 

テキストファイルを直接読み込む場合 (
TextFileSource
)

import gigatoken as gt

file_source = gt.TextFileSource(["owt_train.txt"], separator=b"

同じ日のほかのニュース

一覧に戻る →

2026/07/23 2:30

ターレンス・オのチャートプとの対話:ヤコビアン仮定に対する反例について

## Japanese Translation: 该平台主要通过安全的登录提供个性化体验。经过身份验证后,用户将获得量身定制的响应而非通用回答,并可访问由其保存的聊天历史所告知的答案。关键功能包括直接在界面中创建自定义图像,以及上传外部文件以实现与工作流的无缝集成。通过将创意工具与基于记忆的个性化相结合,该平台将标准效用转化为自适应环境,从而简化任务,并在无需重复设置的情况下利用之前的互动。

2026/07/23 6:15

Malleable コンピューティング、Emacs、そしてあなた

## Japanese Translation: 著者は、大量導入向けのスケーラビリティよりも速度と簡潔さを優先する軽量のツール `fj` を使用し、Emacs 内で GitHub の Issue 管理を自動化することに成功した。このソリューションは複雑なローカルサーバーを避けるために既存の `gh` コマンドラインユーティリティを利用して認証を行い、UI 操作には Elisp パッケージ `Transient`、フォーマット変換には `ox-gfm` を統合することで、ユーザーがエディタから直接 Issue のメタデータをコピーし、Org モードでコメントを作成し、ブラウザウィンドウを開くことを可能にしている。これらすべての機能は JSON 解析ロジックで約 20 行以内で実装されている。「可変計算(malleable computing)」の原則に従い、Emacs を再起動することなしに迅速なプロトタイピングを可能にしている。2 時間半という初期開発フェーズとコードのリファクタリングを経て、最終製品は個人の利用に最適化された約 400 行の Lisp から構成されている。このアプローチは、伝統的な大衆向けソフトウェア("N")とは対照的に、最小限の計画で堅牢なツールを個人ニーズのために構築することは非常に実現可能であることを示している("1")。 ## Summary: 著者は、大量導入向けのスケーラビリティよりも速度と簡潔さを優先する軽量のツール `fj` を使用し、Emacs 内で GitHub の Issue 管理を自動化することに成功した。このソリューションは複雑なローカルサーバーを避けるために既存の `gh` コマンドラインユーティリティを利用して認証を行い、UI 操作には Elisp パッケージ `Transient`、フォーマット変換には `ox-gfm` を統合することで、ユーザーがエディタから直接 Issue のメタデータをコピーし、Org モードでコメントを作成し、ブラウザウィンドウを開くことを可能にしている。これらすべての機能は JSON 解析ロジックで約 20 行以内で実装されている。「可変計算(malleable computing)」の原則に従い、Emacs を再起動することなしに迅速なプロトタイピングを可能にしている。2 時間半という初期開発フェーズとコードのリファクタリングを経て、最終製品は個人の利用に最適化された約 400 行の Lisp から構成されている。このアプローチは、伝統的な大衆向けソフトウェア("N")とは対照的に、最小限の計画で堅牢なツールを個人ニーズのために構築することは非常に実現可能であることを示している("1")。

2026/07/23 6:00

Safari テクノロジー プレビュー 248 のリリース

## Japanese Translation: Safari Technology Preview リリース 248 が、macOS Golden Gate および macOS Tahoe 向けに公開されており、システム設定 → 一般 → ソフトウェアアップデートから直接更新可能です。本リリースでは、リビジョン 315567@main と 316817@main の間に含まれる WebKit の変更を取り入れており、大幅なパフォーマンス向上と共に重要なアクセシビリティおよび機能強化を達成しました。 主な新機能には、TC39 プロポーザルに基づく JavaScript BigInt Math 機能(`BigInt.pow` および `BigInt.sqrt`)の追加、ES2022 クラスプライベートフィールド/メソッド/アクセッサに対する Web Inspector のサポート拡大が含まれます。アクセシビリティについては、VoiceOver ナビゲーションを大幅に改善し、特に disclosure widgets(hidden="until-found")および古くなった aria-labelledby 値に関する問題を解消しました。メディア再生面では、旋回したコントロールの不具合、iPhone での字幕表示欠落、ストリーム失敗、デバイス方向のバグに対する修正により安定性が向上しています。 ストレージおよび Web API の安定性も改善されました:IndexedDB トランザクションは現在停止されたバックグラウンドトランザクションによってブロックされなくなり、Async Clipboard API の非同期リクエストおよび FileReader の charset 処理が正しく動作するようになりました。セキュリティの回帰問題である Content Security Policy エラーおよび同一ページ内ナビゲーションチェックに関する不具合も解決済みです。また、Digital Credentials エラーコードおよび AbortError の処理に対する修正も含まれています。さらに、開発者は Digital Credentials API を利用し、Web Inspector 文脈内でウォレットペイロードのシミュレーションを行うことができます。

GigaToken:言語モデルのトークナイゼーション速度が約1,000倍高速化 | そっか~ニュース