
2026/10/03 18:36
コリブリー:主権のあるオープン・ウェイトモデル
RSS: https://news.ycombinator.com/rss
要約▶
日本語訳:
Aleph Alpha は、公共行政、自動車産業、法律業界、航空宇宙産業といった規制のある欧州産業で、ミッションクリティカルなタスクに適用するための主権保有型の英語・ドイツ語双言語 AI モデルKolibriをリリースしました。2026 年 10 月 3 日に公開された Kolibri は、完全なインフラストラクチャの独立性を保ちながら EU の AI アクティブ法(EU AI Act)およびドイツ法律に完全に準拠することを目的として構築されています。トレーニングはドイツおよびフィンランドに所在するサーバー上で行われました。
アーキテクチャ面では、Kolibri は780 億パラメータの総パラメータ数を有するエクスパート混合(Mixture-of-Experts)設計を採用しており、アクティブなパラメータ数は30 億に過ぎません。これにより、その 4 倍サイズのモデル(例えば Nemotron 3 Super など)と同等の数学およびコーディング能力を達成しつつ、品質とサービスコストのパレート Frontier を最適化しています。コンテキスト長は1M トークンまでをサポートします。本モデルは約24 兆トークン(うちユニークなドイツ語トークンが約 4.3T)を用いてトレーニングされており、重訳ではなく厳選されたデータと双言語トークナイザを採用しました。また、中断を自動的に処理する耐性のある 21 日間のパイプライン上で 768 B200 GPU を超えるリソースを活用してトレーニングが行われました。
Kolibri はMerlin-Arthur プロトコルによる高度なグラウンディング機構を搭載し、根拠のない回答が認められる場合のハルシネーションを前身モデル(Kolibri Origin)の 15% からわずか 44% にまで削減しています。速度と精度のトレードオフを最適化するために、ない・低・中・高という 4 つの柔軟な推論努力レベルを提供します。Apache 2.0 ライセンスの下で Hugging Face で即時利用可能であるこのローカルホストソリューションは、業界に対し、国外モデルが機能しない場合でも競争力のある結果を届けつつ、サービス費用を削減する信頼性の高い代替手段を提供します。
本文
Aleph Alpha「Kolibri」研究レポート(2026 年 10 月 3 日)
ドイツ統一記念日に、当社の新モデル**「Kolibri」**を正式に公開いたします。
1. モデル概要と基本特性
Kolibri は、英語とドイツ語に対応する Mix-of-Experts(MoE)型 Transformer です。
- 総パラメータ数: 780 億
- アクティブなパラメータ数: 30 億
- コンテキスト長: 最大 100 万トークン対応
- ライセンス: Apache License 2.0(Hugging Face でウェイトをダウンロード可能)
本モデルは、前モデル「Kolibri Origin」のトレーニングパイプラインを踏襲し、さらに高度化したものです。データ選別からアブレーション実験、事前学習(Pre-training)、事後学習(Post-training)までの一連のプロセスにより、ハードウェア障害や接続断が起きても人的介入なしに安定して学習を進める体制を整えました。
本モデルは、公共行政、産業、宇宙航空など規制対象領域における主権を持つミッションクリティカルな業務に特化しています。ドイツ語の推論能力、数学演算、エージェント型振る舞いを強化し、顧客固有の使用ケースでの性能最適化を実現します。これにより、経済的インパクトを監視可能な投資対効果(ROI)の向上が期待できます。
2. 開発プロセスと「高速開発」の実現
当社の**「モデルファクトリー」**と呼ばれるシステムにより、開発から実装までのスピードアップを図っています。Kolibri Origin から Kolibri への進化は、このパイプラインの有効性を証明しています。
比較:Kolibri Origin vs. Kolibri
以下の改善が成し遂げられました。
- 事前学習完了: 2026 年 6 月 11 日 → 2026 年 9 月 11 日
- リリース: 非公開 → 2026 年 10 月 3 日
- 推論モード: Yes(1 モードのみ) → Yes(なし・低・中・高の 4 レベル対応)
- 総パラメータ: 306 億 → 781 億
- トークンあたりのアクティブパラメータ: 32.7 億 → 34.6 億
- 事前学習トークン数: 7.51T → 20T
- レイヤー構成: 50(Dense+MoE 混合) → 50(すべて MoE)
- コンテキスト長対応: 8k / 64k → 16k / 256k(最大 262,144 トークン)
- トークナイザー語彙数: 96,000 → 128,000
- モデル次元: 2,048 → 2,560
- アテンションヘッダー: 32/4 → 48/4
トレーニングパイプラインの自動化:
- チェックポイントは約毎時生成され、英語・ドイツ語の知識、数学、コード、安全性など多岐にわたって自動評価されます。
- ハードウェア障害や接続タイムアウトによる中断が 38 回発生しましたが、パイプラインが自動的にノードセットを変更して学習を再開しました。
- GitHub Actions ワークフローを採用し、すべてのコード変更に対して短時間でトレーニングと評価を行い、障害のチェックも自動化しています。
アーキテクチャと効率化
- スケーリング戦略: 実験によりモデルサイズ増加は常に性能向上をもたらしましたが、コスト増を考慮して総パラメータ 780 億(アクティブ 30 億)で最適なバランスを見出しました。
- メモリ効率: 50 レイヤーのうち 10 レイヤーがフルコンテキストを処理し、残りの 40 レイヤーは 512 トークンのウィンドウに限定することで、計算量とメモリ使用量を抑制しています。
- Muon アルゴリズム: 学習コストとサービスコストのトレードオフを最適化します。
- 正確な分位数バランス: Kimi K3 で導入された手法を採用し、通信コストを抑えつつ厳密な負荷均衡を実現しました。
トレーニングステップ(B200 GPU 768 基使用)
- 事前学習: 21 日間 / 16k シーケンス長 / 20T トークン
- 中間学習: 64k / 3.44T トークン(推論・問題解決・コード・エージェントデータに特化)
- 長文コンテキスト適応: 256k / 200B トークン
ドイツ語事前学習データの確保:
- 総トークン数 20T のうち約 4.3T(21.3%)をドイツ語が占めます。
- Open German データセットだけでは不十分なため、以下の手法でデータを確保・強化しました。
- 独自の選別: Common Crawl から独自にフィルタリング(行政文書向けパラメータ再調整により 1.3T ユニークトークン)。
- 既存ドキュメントの言い換え: LLM が百科事典エントリや Q&A ダイアログへ書き換えることで、事実を異なる形式で学習可能にし(約 1T)、文化的文脈を保ちました。
- 翻訳: 英語からドイツ語への慎重な翻訳(機械翻訳の弱点である文化差を回避)。
二言語トークナイザー:
- データ内の 21% のドイツ語比率に対応する「UniBPE」手法を採用し、ドイツ語を効率的に圧縮します。
- 競合モデルが形態素境界を横断して単語を分割するのに対し、Kolibri は**"Bundesozialgerichtes"や"silkworm"**などを意味のある単位として保持し、推論効率を向上させました。
事後学習(Fine-tuning & RL)
- SFT: 174B トークンの合成データと高品質なオープンソースデータ(268B トークン)を使用して、対話能力を習得。
- RL: コード・数学推論・エージェントタスクなど 120 万ものキュレーション済みタスクで学習。
- 推論レベル制御: 「努力なし」「低」「中」「高」の 4 レベルを教えることで、ユーザーはコストと品質のトレードオフを自由に設定できます。
3. 機能特性とベンチマーク結果
Kolibri は、パレートフロンティア上に位置する高い性能対サービスコスト比を実現しています。
企業・政府向け基礎的機能
平均ベンチマークスコア(アクティブパラメータ数 4 倍以上のモデルと同程度):
- 数学・コーディング: AIME 2025 で英語版 96.9%、GPQA および AA-Omniscience ベンチマークで最高位を達成。
- エージェント型機能: バンキング、小売、航空会社、通信など多岐にわたり最上位またはトップクラスの実績。
- 知識ベース: 広範なドメイン知識を有します。
実世界アプリケーション向けの文脈化された性能
公的ベンチマークでは測れない特殊なセクターニーズ(自動車、半導体、公共行政など)に対応するため、独自の内製評価スイートを開発しました。
内部顧客代理ベンチマークにおけるスコア向上:
- 自動車サプライヤー: 0.72 → 0.99
- 半導体: 0.35 → 0.80
- ドイツ公共セクター: 0.54 → 0.75
- 産業用ドライブ技術: 0.31 → 0.60
- 宇宙航空: 0.14 → 0.59
Grounding(文書に基づく回答)とハルシネーション防止
Kolibri は答えないデータ(Abstention)をトレーニングに含め、Merlin-Arthur プロトコルを用いて学習しました。コンテキストに含まれていない情報に対しては**「知らません」と答えるように設計**されています。
ハルシネーション削減実績:
- AA-Omniscience ハルシネーション非発生率: Kolibri 44.0%(他モデルとの比較で突出)。
- M/A Grounding スコア: 0.23 を達成(Origin や他モデルは 0.00)。
主権性(Sovereignty)とコンプライアンス
Kolibri は EU AI 法、GDPR、著作権法などを念頭に設計されています。
- 開発プロセスの透明性: データ入力から学習、評価までの全決定に対し、サプライチェーン全体の整合性と説明責任を提供します。
- デプロイの完全な自由: 顧客はモデルを完全に所有し、知的財産の安全性が保証されます。
- 欧州内での開発: ドイツとフィンランドのインフラ上で学習を行い、外国からの統制を受けずに開発されました。
4. 導入方法とサポート
スタート方法
Kolibri は Hugging Face で Apache License 2.0 ライセンスの下で提供されています。
必要なパッケージ
aleph-alpha-inference をインストールしてください:
pip install "aleph-alpha-inference>=1.0"
実行コマンド例:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \ --reasoning-parser kolibri1 \ --tool-call-parser kolibri1 \ --enable-auto-tool-choice
- 長文コンテキスト対応(1M トークン以上):
--max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}' - 推奨サンプリングパラメータ:
,temperature=1.0
,top_p=0.97top_k=128
お問い合わせ
エンタープライズデプロイおよび特化オプションについてのお問い合わせは、以下の窓口へご連絡ください。
営業担当へのご連絡