AI に適した生体データ:18 億ドルのグローバルコミットメント

2026/10/09 5:46

AI に適した生体データ:18 億ドルのグローバルコミットメント

RSS: https://news.ycombinator.com/rss

要約▶

Japanese Translation:

2026 年 10 月 7 日、カリフォルニア州レッドウッドシティにおいて、Biohub は米国エネルギー省(DOE)、国立衛生研究所(NIH)および新たな資金出資パートナーと共同で、生物学に関する予測 AI モデル向けのオープンデータの生成とアクセス可能性を高めるため、18 億ドル規模の拡張を発表した。DOE は、Exascale スーパコンピュータと先進的なイメージング技術を用いた実験室での測定、モデリング、計算および基礎的な細胞研究を行うためのジェネシスミッション(Genesis Mission)を通じて、5 カ年計画で 5 億ドルを超える投資を行う。NIH は、Bio Genesis ミッションを通じた前もって行われた連邦政府からの 5 億ドル以上の投資に基づく関連するデータセットとリポジトリの調整を行い、これらを AI モデルの訓練に標準化する。民間パートナーである Google DeepMind、Isomorphic Labs、Meta は合計で 3 億ドルをバイオジェネシスイニシアチブ(Virtual Biology Initiative)への出資として提供し、生命に関する予測モデルに必要な技術とマルチモーダルデータセットの開発を行う。Biohub の創設コミットメントには、クライオ電子トモグラフィ、高出力顕微鏡、分子工学ツールなどの新たな測定技術向けの 4 億ドル、ならびに Biohub 外部の研究向けの 1 億ドルが含まれ、さらにレンサンスフィルソロピー(Renaissance Philanthropy)もデータ生成のための資金拡大を支援している。本イニシアチブは、研究員が生物学的質問に対してデジタル上で問いかけ、予測し、答えを得ることで疾病の予防と治療の加速を実現するオープンな「仮想細胞」リソースの構築を目指している。それはヒトゲノムプロジェクトの基盤を継承し、ヒト細胞アトラス、ヒトタンパク質アトラス、ウェルカムサンガー研究所といった既存のコミュニティリソースと統合する。主要なパートナー機関には Allen Institute、Broad Institute、Gladstone Institutes、NVIDIA(アクセラレーテッドコンピューティングインフラストラクチャを提供)が含まれる。Biohub は CELLxGENE、CryoET Data Portal、Tabula Sapiens、OpenCell、Zebrahub などの既存インフラストラクチャを活用し、共有標準、共通識別子、単一アクセスポイントを特徴とする統合レイヤーを構築する。全体として、この協調的な拡張はマルチモーダルデータを中心とした新たな産業を生み出し、学界と業界にわたる革新的な国際協力を促進し、生物学的システムの理解の根本的な進歩をもたらすものである。

本文

国際的「AI 向け生物学的データ」創出プロジェクトが大幅に拡大へ:18 億ドルの投資と新たな連携

2026 年 10 月 7 日、ロドウッド・シティ(カリフォルニア州)で発表された通り、バイオハブ、米国エネルギー省(DOE)、国立衛生研究所(NIH)、および新たな出資パートナーらは、生物学的予測人工知能モデルの生成とデータへのアクセスを可能にする国際的な取り組みを大幅に拡大することを公表しました。

各機関は合計で 18 億ドル規模の資金、データ、計算資源ならびに新たな測定技術への投資を行い、これまでになく大規模かつ協調的な「AI のための生物学的データ」創出に向けたコミットメントを実現します。この成果は、人類の疾患に関する理解を深め、最終的には治療法の確立へと繋がる研究コミュニティ向けのオープン・リソースとなり、新たな基盤を提供することを目指しています。

主要なパートナーシップと資金投入

今回の発表に伴い、以下の組織間で重要な連携が結ばれています。

1. 米国エネルギー省(DOE)

  • 国際的な AI 対応オープン・データ・リソース構築を目指す共同事業として、実験測定、モデリングおよび計算分野に 5 か年で 5 億ドル以上を投資します。
  • 「ジェネシスミッション」において、基礎的な細胞研究分野に対し 5 年間で 5 億ドル以上を貢献し、以下に配分されます:
    • データ収集
    • AI アナリティクス
    • 測定・イメージング
    • モデリング
    • 計算

2. 国立衛生研究所(NIH)

  • 過去 5 億ドル以上の連邦投資を通じて開発された関連データセット、リポジトリ、および知識基盤の貢献調整を担当します。
  • NIH は既存の医生物学データセット、国家レベルのデータインフラストラクチャ、ならびに研究プログラムを集約し、より広い科学コミュニティ向けに AI 対応リソースの構築を支援します。

3. バイオハブ

  • NIH と連携し、上記データセットを AI モデル学習用の標準化フォーマットに合わせる作業を行います。
  • 創設段階での 5 億ドルコミットメントは、以下の基盤を支えるために活用されます:
    • 4 億ドル: 生物学者が測定可能な範囲を広げる新技術への支援
      • クライオ電子顕微鏡断層撮影(細胞内の近原子レベル詳細の解像)
      • マイクロスコピー技術(生きた組織内で数百万〜数十億細胞のイメージング)
      • 分子・細胞・組織・個体レベルでの生物構築・改変ためのエンジニアリングツール
    • 1 億ドル: バイオハブ外の研究活動への資金供与

4. 「仮想生物学イニシアチブ」(Virtual Biology Initiative)の共同投資

  • Google DeepMind、Isomorphic Labs、Meta の 3 社は、生命の予測モデル構築に必要な技術およびマルチモーダルデータセットの創出のために、計 3 億ドルを共同投資します。

5. その他主要パートナー

  • Allen Institute, Broad Institute, Genscape (Graceston), Human Cell Atlas Project, Human Protein Atlas Project, Wellcome Sanger Institute: これらの団体は、仮想生物学イニシアチブの一員として連携しつつ、共通の目標に向けた独立した努力も行います。
  • NVIDIA: イニシアチブを支援し、加速計算インフラ、ドメイン固有ソフトウェア、ならびに技術的専門知識を活用する手助けを行います。
  • Renaissance Philanthropy: データ生成のための資金調達拡大に貢献します。

技術的展望と科学的意義

データセット活用による革新

これらのデータセットを活用することで、世界的な科学界は AI モデルを共同で構築・活用でき、研究者たちがデジタル上で生物学的問いを立て、予測し、回答する新たな手段が可能となります。これにより、疾病の予防と治療への道筋が加速されます。

本イニシアチブでは、以下の点が強化されます:

  • モデル訓練のための基盤となる測定値の提供
  • 細胞種や条件下を超えた広範な細胞応答データ(インターベンションに関するデータ)収集範囲の拡大
  • 細胞および細胞間相互作用の研究技術の開発・検証
  • 構築と実証における規模、速度、精度の向上

関係者からのコメント

  • アレックス・ライヴズ氏(バイオハブ サイエンスヘッド)

    「生物学に対する正確な予測モデルは、科学者たちが実験をデジタル上で行うことを可能にすることで、科学的発見を飛躍的に加速させます。そこから得られる洞察は、疾病に関する理解を劇的に深化させ、治療法への道筋を完全に新しい方向へと開拓することでしょう。」

  • プシュミート・コーリー氏(Google DeepMind VP / Google Cloud チーフサイエンティスト)

    「仮想細胞の構築への挑戦は、生命科学を理解するための偉大な集合的な科学的課題の一つであり、その鍵となります。私たちは前例のない規模のオープンで実験的な生物学的データを入手しない限り、この課題を解決することはできません。」

  • マックス・ジャーデバーグ氏(Isomorphic Labs 社長)

    「予測システム生物学を解決するためのデータを生成するには、現在どの単独の機関も到達できる限界を超えたスケール化が必要です。仮想生物学イニシアチブに創設メンバーとして加わることで、巨大なマルチモーダルデータ基盤の構築に貢献します。」

  • ダリオ・ギル氏(エネルギー省科学担当副次官)

    「このパートナーシップは、人工知能を公共の利益のために活用するための決定的な前進を意味します。DOE のエクサスケール計算能力とバイオハブの AI モデルを組みめることで、医学とバイオテクノロジー両分野での発見を加速させる新しいオープン・サイエンスの基準を設定することになります。」

コミュニティ醸成と未来への展望

同等に重要なのは、これらのリソースを取り巻く科学コミュニティの醸成です。これは以下の要素を含みます:

  • 異なる機関や学問分野を超えた研究者への招集
  • 補完的な専門性と能力との接続
  • 野心的な科学的問いを共に定義・追求する機会の創出

過去 10 年間にわたり、バイオハブは Tabula Sapiens、OpenCell、Zebrahub、CELLxGENE、CryoET Data Portal といった主要プロジェクトやデータインフラストラクチャの構築実績を活かし、単一の機関では達成不可能な規模での協調努力を可能にします。

バイオハブによる「バイオ・ジェネシスミッション」を通じて、汎用的な細胞モデルの開発が加速され、研究室での実験のみによって得る結果よりも大幅に短縮した時間で医学的突破を目指せるようになります。


【バイオハブについて】 最先端の AI と生物学を組み合わせて科学の加速を図る 501(c)(3) 認定の非営利研究機関です。計算資源、AI リサーチおよびエンジニアリング、ならびに生物の測定・イメージング・プログラミングに優れた最先端技術を活用し、世界中の科学者を支援しています。究極的なミッションは、すべての疾病を治癒または予防することにあります。詳細は biohub.org をご覧ください。

【報道連絡先】 Biohubpress@biohub.org

同じ日のほかのニュース

一覧に戻る →

2026/10/09 1:59

Whistle:16.9 MB で音声からテキストへ変換

## Japanese Translation: Whistle は、スマートフォン、ウェアラブル機器、ロボット、スマートホームシステム、車載ユニット、マイクロコントローラーといったエッジデバイスに特化して設計されたオープンソースの音声認識モデルです。2026 年 10 月 2 日にリリースされ、その最大の特徴は外部依存関係なしに完全にオンデバイスで動作することであり、高いプライバシー保護と低レイテンシーを実現するとともに、Needle フレームワークと同じ C++ エンジン内にはまる単一の 16.9 MB のファイルで済み、その利点を活かしています。モデルは英語、ドイツ語、フランス語、スペイン語、イタリア語、オランダ語、ポーランド語の 7 か国語をサポートし、CPU 上で最大 30 秒間のオーディオを瞬時に処理します。 アーキテクチャ的には、Whistle は Needle と同じエンコーダーおよびデコーダ用の Simple Attention ブロックを共有しており、エンコーダーでは 18,432 スロットを持つエングラムと Monarch Hadamard MLP を採用し、デコーダではクリップごとエンコーダーを一度だけ読み取るゲート付きクロス・アテンションを備えています。Apple M4 Pro CPU におけるベンチマーク結果はその効率性を示しており、最初のトークン生成までにかかる時間は 11 ms で、デコード速度は 1,319 トークン/秒に達し、Whisper base(73.2 ms / 266/s)や Moonshine tiny v2(22.8 ms)を大幅に上回っています。この効率性により、書き起こしや単語の時間スタンプ付けから、音声埋め込み、そして音声コマンドに基づくスマートホームアクションのトリガー(「set_lights」など)に至る多様なアプリケーションに対応できます。`.cact` ファイルを用いた `needle` ツールとの統合を通じて実現します。モデルには、特定の音量閾値未満の断片ではビームサーチに入らず空の文字起こしを返す沈黙検出機能も含まれており、リソース制約のある環境向けに軽量かつ高性能なソリューションとなっています。

2026/10/09 2:51

Theranos の世界

## Japanese Translation: 午前 9 時 41 分に、システムはユーザーが「ログイン」をクリックするか、Return キーまたはスペースキーを押すことを要求します。この操作にはパスワードの入力并不需要がありません。この簡素化されたフローにより、対話完了後、ユーザーは直ちにパーソナルダッシュボードに移動できます。 ## Text to translate : At 9:41 AM, the system requires a user to click "Log In" or press the Return or Space key. The interface does not require a password for this action. This streamlined flow allows users to proceed directly to their personal dashboard once the interaction is completed.

2026/10/08 9:14

DeepSeek 4.1 Flash が業界で騒がれていないのはなぜか?

## 日本語訳: DeepSeek 4.1 Flash は、高価な「フロンティア」モデルである Opus などに対し、コーディングタスクのほとんどにおいて非常に効率的かつ費用対効果の高い代替案を提供することで、人工知能における変革的な転換を表しています。従来のバージョンと比較してメモリ使用量を約 437 倍削減する KV キャッシュ最適化を採用することにより、標準セッションではトップティアモデルとの間に性能差がほぼ生じず、高品質で無人実行に適合しています。この効率性は、ユーザーが Opus 5.5 のようなプレミアムリソースを、エッジケース検出が不可欠な重要な最終レビューだけに限定して確保することを可能にします。 核心となるメッセージは、「十分である」とされるモデルを優先することで、実用的な性能を損なうことなく運用コストと環境への影響を大幅に削減できる点にあります。例えば、月額 10 ドル未満のサブスクリプションで無制限の使用が可能であり、セッションあたりのコストが 0.003 ドルほどになる場合があり、これは主要技術企業が高额的な財務的および環境コストにもかかわらず最先端モデルへの多額の投資を続ける業界の傾向に挑戦するものです。現時点ではハードウェア費用の観点から自己ホストは経済的に実現可能ではありませんが、将来のローカルキャッシュ最適化により実用的になると考えられます。 究極的には、この戦略の採用は、財務的な障壁を下げることで高知能へのアクセスを民主化し、水や電力の使用量を削減します。企業はルーチンタスクを効率的なモデルに委ねる一方で、プレミアム容量をエッジケース検出のために留保することで、実用的な性能で「十分である」場合でも最新の前線モデルを追いかけるという罠から回避できます。著者は同様の能力が GLM その他の中国モデルにも存在する可能性を示唆し、より詳細なパフォーマンスデータについては外部ベンチマークへの参照を推奨しています。

AI に適した生体データ:18 億ドルのグローバルコミットメント | そっか~ニュース