Andy Pavlo がクリックハウスに加入し、ClickHouse Labs を設立

2026/08/03 23:09

Andy Pavlo がクリックハウスに加入し、ClickHouse Labs を設立

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

元カーネギーメロン大学教授が、先進的な学術概念を実用者のための現実世界の解決策に変換することを目的とした新しい研究チームである ClickHouse Labs を率いる。ClickHouse が高速パフォーマンスの C++ データベースであり、ベクトライズされた実行と SIMD 命令を活用するというこれまでの実績を基に、本イニシアチブは理論的な革新と運用効率性の間のギャップを架橋することを目指す。チームは、未完了の工学最適化を検証することに重点を置きつつ、データベースが創出中の人工知能および自律エージェント技術とどう統合されるかを探索する方針である。単独で動作するのではなく、ClickHouse Labs はエンジニア、顧客、パートナーとの緊密な協力を促進し、PostgreSQL との戦略的アライアンスを通じて、スピード性と信頼性を兼ね備えた優れたマネージドサービスを開発する。技術出版およびコミュニティへの関与における強固な歴史を維持しつつ、本プロジェクトは IBM や Microsoft Research などのトップティアの研究機関と匹敵する研究影響力を持ち上げることを目指しており、結果としてより広範なデータエンジニアリングエコシステムに直接利益をもたらすインパクトのあるツールを提供することになる。

Text to translate:

Summary: Former Carnegie Mellon professor will lead ClickHouse Labs, a new research team dedicated to converting advanced academic concepts into practical engineering solutions for real-world users. Building on ClickHouse's legacy as a high-performance C++ database utilizing vectorized execution and SIMD instructions, this initiative seeks to bridge the gap between theoretical innovation and operational efficiency. The team plans to prioritize validating pending engineering optimizations and exploring how databases integrate with emerging artificial intelligence and autonomous agent technologies. Rather than working in isolation, ClickHouse Labs will foster close collaboration with engineers, customers, and partners, including strategic alliances with PostgreSQL to develop superior managed services that combine speed with reliability. By maintaining a strong history of technical publication and community engagement, the project aims to elevate its research influence to match top-tier institutions like IBM or Microsoft Research, ultimately delivering impactful tools that directly benefit the broader data engineering ecosystem.

本文

ClickHouse Labs の設立と研究ビジョンについて

私は ClickHouse に参画し、新たな研究チーム**「ClickHouse Labs」**の設立ならびにリーダーシップを引き受けること、光栄に存じます。本稿では、プロジェクトの経緯および今後の目標をご紹介します。

1. 研究者としての歩み

  • カルネゲメロン大学(CMU)コンピュータサイエンス学科にて、2013 年以来教員として活動してまいりました。
  • 現代のデータベース管理システム(DBMS)の内部機構に関する科学的研究を継続的に行うことが最優先事項です。
  • 産業界や学界から新しいシステムが登場するたびに、その実装を追跡・理解し続けています。

2. ClickHouse とのかかわり

  • 2016 年 6 月にオープンソースとして公開された当初から注目を集めておりました。
  • 当初は「あまりに素晴らしく、蒸発した製品(vaporware)である」という懐疑的見方が主流でしたが、業界標準ではなかったにもかかわらず、以下のような先進的な機能を有しておりました。
    • C++ による実装と、SIMD を活用したベクトル化されたクエリ実行のサポート(当時は主要な OSS 分析 DBMS の多くが JVM ベースで SIMD に対応していなかった)。
  • 開発には一貫して注目を集め、常に学術研究プロジェクトとの関連性の高いリーダーシップシステムとして存続しました。
    • 2020 年のパンデミックによるオンライン授業移行の際に最初に着用したオリジナルの ClickHouse シャツまで、愛用し続けています。

3. ClickHouse Labs の設立と目標

ClickHouse の共同創始者より、新たな研究グループの設立を招かれ、この機会を栄誉あるものとして受け止めました。

基本理念

  • 孤立した研究機関にならず、強力なエンジニアリングチームや顧客・協力者との緊密な連携を目指します。
  • ClickHouse が常に最先端を維持できるよう、新たなアイデアを開発・普及させることを所存としています。
  • PostgreSQL チームとも協働し、管理サービスにおけるパフォーマンスと信頼性を高め、市場リーダーとしての地位の確立を支援します。
    • PostgreSQL と ClickHouse の組み合わせは、トランザクション処理および分析データベースに関する問題を検証するための広範な基盤を提供します。

目指す到達点

  • 極めて野心的な目標を持ちつつも、明確な方向性で進めます。
    • 科学的価値を持つ研究を実施し、優れたアイデアを実際のユーザーにとって重要な技術へと変換すること。
    • IBM Research や Microsoft Research などの先駆的機関と同レベルのインパクトを達成したいです。
    • 産業研究室としての役割を通じて基礎的な CS の進展に貢献し、商用製品に影響を与えつつ、数世代にわたる研究者を育成する伝統を継承します。

4. 技術資料とバックログの加速化

ClickHouse チームはすでに卓越した技術資料出版の記録を持っています。

  • **設立以来(2021 年~)**に多数発表された詳細な記事
    • DBMS の実装解説や、2024 年の VLDB コングレスでのコアアーキテクチャ記述など。
    • これらの著作物は非常に詳実であり、CMU の学生向け講義の読物としても指定されています。
  • バックログの存在
    • エンジニアリングチームが検討した興味深いアイデアや最適化については、完全な検証を経て本番導入までの時間不足があり、蓄積されております。
  • 私の直後の優先事項
    • このプロセスを加速させ、その成果を基盤に ClickHouse をさらに進める新たなアイデアを探求します。

5. AI・エージェント技術との適合性について

調査すべき大きな問いの一つは、DBMS が新興の AI およびエージェント技術とどのように適合するかという問題です。

課題の二つの側面

  1. エージェントをより効果的にサポートするために DBMS の姿を決定すること。
  2. エージェント自身が DBMS の開発を改善・自動化する方法を決定すること。
  • 現時点では、新しいハードウェア、アルゴリズム、データ構造、実行戦略など、すべてが議論の余地があります。
  • ただし、確実なのは、ClickHouse の堅牢な関係モデルの基盤が、こうしたデータ集約型のワークロードと共進化するのに絶好の位置にあるということです。

6. 結び

  • 数据库システム(DBMS)の構築方法について学び続ける生涯を送りつつ、それを構築する人々をトレーニングすることも通じてまいりました。
  • ClickHouse Labs を通じて、両者を推進する組織を創造する機会を得たことを心から喜ばしく存じます。

同じ日のほかのニュース

一覧に戻る →

2026/08/04 6:13

LLM は専門性を報酬とする

## 日本語翻訳: 大規模言語モデル(LLM)は、CSS など基本的なデジタルタスクへの参入障壁を下げていますが、深いドメイン知識の必要性を排除するものではありません。一般的に応用提示技術(generalist prompting techniques)を習得すれば真の価値を引き出せるという一般的な誤解がありますが、複雑な問題解決には特定の分野の知識が不可欠であり、それによって AI を効果的に導く必要があります。数学者のテレンス・ tao の LLM に関する研究に示されるように、専門的な成果は簡潔であるといったスタイル上のヒントではなく、真の理解から生じます。分野に対する親和性がない場合、ユーザーは出力を検証したり、モデルを高度な解決策へと導いたりすることができず、質問の工夫がいくら手巧くてもその限りではありません。著者は、トークンが無限にあっても、非専門家は Tao 氏のような複雑な数学問題においては彼のレベルには達できないと指摘しており、分野知識こそが決定的な要因であることを強調しています。したがって、モデルがさらに強くなるにつれて、人間が正確な要件を伝達し結果を検証するという役割がボトルネックとなります。そのためには、組織は平均的な成果を超えようとする場合、特別な訓練への投資や専門家を採用することが必要であり、AI 統合の未来は汎用的なインターネット検索スキルよりも、制約を定義し高品質な結果を確保するために特定分野での卓越した知識を育成することによって支えられるでしょう。

2026/08/03 23:15

デベロッパーツールのオープンソース化が必須です。

## 日本語翻訳: 人工知能(AI)エージェントは、大規模なユーザーコミュニティや複雑な設定ファイルに依存せずに個々の作成者がパーソナライズされたアプリケーションを構築することを可能にするため、ソフトウェア開発を変革しています。VS Code の拡張機能や vimdiff といった従来の API はリアルタイムでのファイル変更やバックグラウンド処理で苦戦するのに対し、Shelley とような AI エージェントは、上流リリースとの nightly スインジングや人間のレビュー前のコードのプリプロセスなどの複雑なタスクを自動的に処理します。これは、過去 5 年の間にエンジニアが高い維持コストと疑わしい投資対効果のためにカスタムツールを廃棄することが多かった時代から、現在、かつて高価なプラグインシステムを必要としたか多くのユーザーにアモルタイズされた機能が単一ユーザーのために瞬時に組み立てられることへの大きなシフトを示しています。著者は "meat.dev" というツールを作成することでこれを例示しました。このツールは大規模言語モデル(LLM)を使用して、差分からインポートやボイラープレートなど重要なコードを取り除き、開発者がコアアーキテクチャとエッジケース(「the meat」)に集中できるようにします。Shelley 内の発見可能なスキルとして構築されたこのエージェントは、単一のプロンプトでバックグラウンドスインジングなどの複雑なロジックを統合することを可能にし、手動のコマンドライン実行の必要性を排除します。さらに、エージェントによるパーソナライゼーションは学習曲線を劇的に削減し、ソリューションが「機能しているように見える」場合、大規模なレビューなしに小規模チームや個人開発者向けのカスタムソフトウェア(例:セルフホストされたブログ)を可能にします。Claude Code などのクローズドソースツールはソースコードへのアクセスを欠いているのに対し、オープンソースのエージェントはハードコーディングされた値の直接修正や Monobit を通じたビットマップフォントのようなカスタムアセットの統合、またはオンデマンドでの固有リソースの生成を可能にします。このシフトは、開発をレガシーなプラグインエコシステムと設定中心のワークフローから遠ざけ、自動化が効率的に日常運用を管理する一方で人間がコアアーキテクチャに完全に集中する未来へと導きます。

2026/08/04 2:08

より小さく、高速で、安全に:Kim i と G L M を大規模に展開するための実行方法

## Japanese Translation: Workers AI は、Cloudflare のインフラストラクチャ上で大規模な AI モデルの提供を進めており、NVIDIA Blackwell GPU と SGLang フレームワークを活用することでコストを大幅に削減するとともに速度を向上させながら精度を維持しています。本ソリューションは、モデル重みの圧縮、KV キャッシュメモリへの量子化、共有メモリの保護を実現するための整合性チェックという 3 つの中核技術を採用しています。 モデル重みについては、Workers AI がハイブリッド戦略を採用しており、応答のデコードには低精度の INT4 形式を使用します(GLM モデルでは約 60% のメモリ使用量削減を実現しながら、全精度重みから機能的不可能区別性 を維持)。一方、初期処理には高精度な形式を留保しています。KV キャッシュについては、BF16 から 8 ビット FP8 への量子化によりメモリサイズが半分になり、コンテキスト容量が倍増します(例えば、約 137 万トークンの対応が可能になり、従来の約 686 千トークンから)。MMLU や GSM8K などの主要なベンチマークにおける精度劣化はありません。 莫大な同時接続下での安定性を確保するため、Workers AI は共有 KV キャッシュに対して汎用整合性チェックを実装しており、数百件のリクエストが物理メモリページを共有する際のエラーを防いでいます。これにより、スループットおよびレイテンシに対するオーバーヘッドは 1% も未満です。これらの最適化により、同時接続制限が倍増し(例えば、64 つの同時リクエストへの対応が可能になり、従来の 32 から)、運用コストを約 30% 削減するとともに、モデルの信頼性を損なうことなくデコード速度を大幅に向上させることが可能になりました。技術が進化するにつれ、Workers AI は効率的なグローバル展開を実現するために新たな精度形式の検証を継続しています。

Andy Pavlo がクリックハウスに加入し、ClickHouse Labs を設立 | そっか~ニュース