GPT-5.6 Sol よりも検索性能で上回り、オープンソースモデルのコストは 100 分の 1 に抑える

2026/08/06 3:18

GPT-5.6 Sol よりも検索性能で上回り、オープンソースモデルのコストは 100 分の 1 に抑える

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Castform は、生の企業ドキュメントから高品質なトレーニングデータを自動生成することで、スケーラブルなエージェント運用を構築するための複雑なエンジニアリングの必要性を取り除きます。Neon のインフラストラクチャを介してオープンソースモデル上で強化学習(RL)ポストトレーニングを可能にし、Castform はこれらのモデルが高価な先端的モデルを上回る性能を発揮できるようにする一方、従来のマルチホップ検索ワークフローと比較してコストとレイテンシを大幅に削減します。该系统は、単純な RAG から遅く高価なエージェントループへの業界の転換に対応し、質問 - 回答対を自動的に生成することで文書から直接真値を推論(例:ビジネスルールを導き出す)し、報酬とツール使用に対する完全な可観測性を有する全体の RL ループを管理します。Castform は Postgres エクステンションを使用した合成データ生成のための Neon Lakebase Search に構築されており、動的コンピューティングスケーリングおよび分離された環境を通じてパルス状の並列トレーニングワークロードを処理し、大規模で連続動作するデータベースを維持する必要性を回避します。この技術は、社内ドキュメント、ウィキ、運用データベースなどの固有データを効果的にステートフルな知的 AI エージェントに教えるために企業が活用することを障壁を下げており、深い機械学習または特殊な GPU 専門知識を持たないチームにも高度な機能へのアクセスを可能にしています。

本文

Castform × Neon:自社のデータを「すぐに使えるエージェント」に変える完全な自動化ソリューション

Castform 共同創業者 Ying Hang Seah のメッセージ 「多くのチームにとって、最高のトレーニングデータはただ自社のデータベースに眠っています。問題は、生データを usable なものへと変換するのが困難であり、エージェントを安価かつ大規模に運用するには高度なインフラが必要になることです。Castform は Neon を対象とし、この二つの課題を回避します。」


エージェント構築における 2 つの必須要素

優れた AI エージェントを構築するためには、以下の 2 つの側面が不可欠です。

  • コンテキスト(Context): 適切なデータを発見するためのツールを提供できるか?
    • Neon(Lakebase Postgres)と Search 拡張機能による解決領域
  • モデル(Model): モデルが何を検索すべきかを判断できるか?
    • Castform が解決する領域

業界の変化:エンベッディングから Agentic Retrieval へ

AI エンジニアリングの潮流は、約 10 年かけて大きく変化しています。

時期トレンド特徴と課題
~2022 年頃エンベッディング検索
(pgvector など)
LLM にコンテキストを提供するため、手作業で RAG パイプラインを構築する必要がありました。類似度検索に依存し、自動化されていませんでした。
~2025 年頃エージェント型リトリバル
(Agentic Retrieval)
モデルが計画を立て、ループ内で複数回検索を行うようになります。
課題: フロンティアモデルへの追加呼び出しが必要で、コストとレイテンシが増大しました。

フロンティアモデル vs オープンソースモデルの壁

  • フロンティアモデル(例:gpt-5.6-sol)の問題
    • 典型的な多ターン検索リクエストに 10 秒以上 かかります。
    • エンドツーエンドのコストが約 $0.03 と非常に高額です。
    • 遅すぎて高価すぎます。
  • オープンウェイトモデルの現状
    • コストはフロンティアモデルの 100 倍も低い です。
    • しかし、能力が劣っており、特定のタスクでは性能不足です。

Castform のアプローチ:RL ポストトレーニングによるギャップ埋め

強化学習(RL)によるポストトレーニングは、この性能ギャップを解消する鍵となります。

  • 検索タスクにおける成果
    • ポストトレーニングされたオープンソースモデルは、フロンティアモデルと同等、あるいはそれ以上のパフォーマンスを発揮します。
    • コストは桁違いに低く抑えられます。

Castform のミッション 機械学習や GPU の内部機構を気にすることなく、開発者がモデルの RL ポストトレーニングを行うことを可能にし、ポストトレーニングを「プロンプトエンジニアリング」と同じくらい手軽にします


Castform と Neon を連携したパイプライン

Castform のワークフローはすべて Neon + Lakebase Search 上で動作します。

  1. ステージ: Neon + Lakebase Search
  2. コーパス保存: 生ドキュメントを Postgres に保存
  3. 合成データ生成:
    lakebase_text
    lakebase_vector
    を使用してトレーニングタスクを作成
  4. RL トレーニング: ロールアウト中の検索ツール呼び出しに Lakebase Search を使用
  5. 本番環境での推論: ファイナルモデルも同様の検索ツールを使用

RL ポストトレーニングの仕組み

効果的な RL は以下の 3 つの要素が必要です。これらが揃うことで、試行錯誤のループが始まります。

  • タスク: ユーザーの質問に答える
  • 環境: コーパスに対する検索ツール
  • 報酬関数: 答えは正しいか?(正解との比較)

モデルがツールを使ってタスクを試み、報酬関数が評価し、フィードバック信号を元に最適化(hill-climb)を行います。


企業が抱える 2 つの課題と Castform の解決策

多くの企業は、ポストトレーニング用のクリーンなデータセットや報酬関数を準備するのが困難です。一方で、以下のような大規模な独自データを抱えています。

  • 社内ドキュメント
  • プロダクトレコード
  • サポート記事
  • クライアントとのやり取り
  • ウィキ
  • オペレーショナルデータベース

これらを「効果的なトレーニングデータセット」に変換するには、大規模なデータエンジニアリングと手動ラベリングが必要です。そのため、多くのチームがポストトレーニングを見送っていた理由は以下の 2 点でした。

  1. 「トレーニングデータを持っていない」
  2. 「ファインチューニングは難しく、私たちはそれようなインフラを持っていない」

Castform はこれらを完全に解消します。 既存のコーパスを自動的にトレーニングタスクに変換し、オープンソースモデルがデータを効果的に使うための RL ループ全体を管理します。つまり、「貴社のナレッジベースをそのままモデルとして作成」できます

自動データセット生成の具体例(Navan × GitLab)

データタイプ内容例特徴
ドキュメント
(自社データ由来)
「Navan で予約された列車は GitLab の旅行カードで支払い。標準クラス・14 日以上前予約必須。」ルールや事実関係の記録
正解
(自社データから推論)
「列車利用の場合、座席は標準クラスで、14 日以上前の予約が必要。」質問への直接的な回答
質問
(合成生成)
「Navan で鉄道を予約する際、早めに予約する必要がある規則や、どの席を選べばよいか教えて。」ユーザー視点の疑問

Castform は、このように生成されたデータセットを用いて、以下の構造(scaffold)を提供します:

  • エージェントがアクセスできるツールの指定
  • 報酬関数の指定(モデルに何を習得させたいかを記述)
    • 例:正しいチャンクを検索し、適切なソースを引用して、正しい最終回答を提供することを目指す。

コード実装と可観測性

Castform を使用すれば、開発者は RL の詳細を気にせず実行できます。以下の Python スケレットが基本構造を示します。

def run_tool(tool, tool_args):
    """Single tool: hybrid search over Lakebase."""
    if tool == "search":
        query = tool_args["query"]
        # テキスト検索とベクトル検索をハイブリッドに実行
        bm25 = neon.lakebase_text(query, k)
        vector = neon.lakebase_vector(query, k)
        return rrf_merge(bm25, vector, k)

def reward(trace, ground_truth):
    """Grade a trace against the ground-truth answer."""
    answer = parse_trace(trace)
    
    # 各評価項目をチェック
    retrieval = ...      # 正しいソースを検索したか?
    citation = ...       # 正しいチャンクを引用したか?
    correctness = ...    # 正しい回答に至ったか?
    
    return retrieval + citation + correctness
  • 完全な可観測性: 各ステップごとの報酬上昇を監視可能。
  • デバッグの容易さ: 個々のタスクやプロンプトに飛び込み、モデルの定性パフォーマンスを観察可能。
    → ツール不具合や「報酬ハッキング」などの問題を早期発見できます。

詳細なトレーニング実行の監視方法や実例は Castform のブログ および デモページ を参照してください。


高負荷なワークロードへの耐性:Neon の強み

RL トレーニング中は、エージェントが回答までのコンテキスト確保のために Lakebase Search を反復呼び出しします。

  • バースティ負荷: 数千件の並列ロールアウトそれぞれが数十回の呼び出しを行うため、突発的な負荷変動が生じます。
  • Neon の動的スケーリング:
    • ピーク時は低レイテンシの検索を提供し、需要増に即座に対応します。
    • アイドル時は計算リソースを縮小(ゼロスケール)できます。

ステートフル(状態保持)エージェントへの対応

エージェントがデータを改変する際や、複雑な状態を持つロールアウトをトレーニングする場合、以下が必要です。

  • 独立した環境: ロールアウトの影響が干渉せず、本番環境にも触れない安価な環境。
  • Neon のブランチ機能: 各ロールアウトに独立したデータベース状態を与え、タイムトラベルクエリでエージェントの遭遇した状態を再現・検査可能。

結論: オートメタスケーリングとゼロスケール機能を組み合わせることで、数千件の常時稼働環境を用意せずに、数千件ものステートフルなエージェントロールアウト をトレーニング可能です。


まとめ:今日から始めるポストトレーニング

Castform はあらゆる開発者が以下のことを可能にします。

  1. オープンソースモデルをポストトレーニングする
  2. それらを フロンティアモデルよりも安価で高速かつ高性能 にする
  • 開始方法: 今すぐ castform.com で最初のモデルのポストトレーニングを試してみましょう。

同じ日のほかのニュース

一覧に戻る →

2026/08/06 3:52

Zed デルタ DB

## Japanese Translation: DeltaDB は、すべてのコード変更を生成した特定のエージェント会話を密接に連携させることで、進行中の作業を記録する次世代のバージョン管理システムです。従来のコミットおよびプッシュサイクルを必要とするシステムとは異なり、DeltaDB ではワークツリーをバーチャライズ化することで、開発履歴のどの時点においても、エージェントがタスクを実行している最中であっても自由なオンデマンドブランチングを実現します。 本システムは各操作に安定したアイデンティティを付与し、コードの経時的な進化を高精度に追跡可能としています。最も重要なのは、すべての変更が元の会話に明示的に結び付けられており、ユーザーは任意のロジックを形作ったメッセージを瞬時に追跡したり、チャットログから影響を受けたファイルへナビゲートしたりできることです。これにより、アクティブなスレッド内でのリアルタイムコラボレーションをサポートし、摩擦を排除します。 その結果、チームメンバーは進行中のエージェントタスクに参加して実行中のエージェントと対話し、変更が生じるにつれて注釈を追加し、新たなブランチを容易に作成することが可能になります。このアプローチは、すべての利害関係者にコード変更の背後にある根拠が見える化されることにより、AI 支援開発における透明性と説明責任を高めると同時に、レビューヤーや注釈付け者が堅牢なコミットサイクルを待ったりワークフローを中断したりすることなくライブプロジェクトにシームレスに統合できることを可能にします。

2026/08/06 1:19

発見のループ

## Japanese Translation: Discovery Loop は、最先端 AI と莫大な計算能力を活用して反復的な実験ループを完全に自動化し、科学的進歩の変革を目指しています。Jeff Dean、Sanjay Ghemawat、Quoc Le、Oriol Vinyals など、AI および分散システムの分野で最も引用されている研究者の一部を代表する先駆者們が率い、Google Search、TensorFlow、AlphaFold、Gemini などの重要インフラの背後で数十年にわたる協力を有しています。彼らのビジョンは、少量で精悍なチームが並行して数千もの実験を同時に提案し、実行し、そこから学習することを可能にし、従来の大規模チームよりもはるかに高い研究品質を達成しつつイテレーション時間を大幅に圧縮することです。 当初は自身の技術スタックの最適化を行っていましたが、Discovery Loop は次に機械学習を超えて、より広範な科学と工学の領域へと展開する計画を立てています。この自動発見インフラをスケールさせることで、より良い医薬品の開発、ヘルスケア情報学の進歩、太陽エネルギーの価格低廉化、安全な水のアクセス確保、サイバー空間の保護、科学的発見のためのツールの設計といった重要な世界的課題に取り組んでいます。結局のところ、同社は機械学習および工学タスク向けの完全自動化システムを通じて、無数の分野でイノベーションを加速させ、人類が迅速な進歩を遂げられることを目的とした世界規模のソリューションを提供することを目指しています。

2026/08/06 4:50

AndroidからLinuxへのスマートフォン乗り換えを決意しました

## Japanese Translation: 2026 年 8 月 2 日、著者は Google の Android プラットフォームの方向性に日益の不満を抱き、主にプライバシー保護とジェスチャー操作に優れた Linux ベースのオペレーティングシステムである SailfishOS に主たる Android スマートフォンを切り替えることを決断した。具体的には、AI 機能の必須化、深いカスタマイズを妨げるロックされたデバイスツリー、ユーザーの自由を制限するアプリストアポリシーといった不満があった。Fairphone 4 (AOSP) から移行する過程において著者は SailfishOS で重大な障害に直面した。これらには、古くなったシステムライブラリ (Python および glibc)、Waydroid などのコンテナアプリとの互換性の破損、GPS サポートの問題、そして品質の低いコミュニティ製アプリケーション(コードが不適切な WhatsApp クライアントを含む)が含まれる。Ubuntu Touch も検討されたものの、アプリエコシステムの悪さ、Bitwarden に影響する通知/クリップボード同期の問題、平均的なネイティブアプリ、VIVO ユーザーによる電話番号のブロック機能の欠如という理由で却下された。その結果として著者は 2 台の端末を用いたハイブリッド構成を維持している:現在の Fairphone は重要な Android 固有サービス(ノルウェーおよびブラジルにおいて必要な銀行検証ソフトウェア、ブラジルにおける Uber などのセキュリティアプリ)へのアクセスのためにホットスポットとして機能する一方、新しい SailfishOS デバイスは代替 OS の実験に使われている。今後の計画には、この旅路を文書化し、ノルウェーへ戻った際により良いハードウェアサポートを受けられる Jolla Phone 2 を購入することを含み、プライバシーに注力する代替手段と不可欠なプロプライエタリアプリの世界的必要性との間にある持続的なギャップを浮き彫りにするものである。著者はこの構成に加えて Galaxy A17 をバックアップ用スマートフォンとしても使用している。

GPT-5.6 Sol よりも検索性能で上回り、オープンソースモデルのコストは 100 分の 1 に抑える | そっか~ニュース