
2026/08/06 3:18
GPT-5.6 Sol よりも検索性能で上回り、オープンソースモデルのコストは 100 分の 1 に抑える
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Castform は、生の企業ドキュメントから高品質なトレーニングデータを自動生成することで、スケーラブルなエージェント運用を構築するための複雑なエンジニアリングの必要性を取り除きます。Neon のインフラストラクチャを介してオープンソースモデル上で強化学習(RL)ポストトレーニングを可能にし、Castform はこれらのモデルが高価な先端的モデルを上回る性能を発揮できるようにする一方、従来のマルチホップ検索ワークフローと比較してコストとレイテンシを大幅に削減します。该系统は、単純な RAG から遅く高価なエージェントループへの業界の転換に対応し、質問 - 回答対を自動的に生成することで文書から直接真値を推論(例:ビジネスルールを導き出す)し、報酬とツール使用に対する完全な可観測性を有する全体の RL ループを管理します。Castform は Postgres エクステンションを使用した合成データ生成のための Neon Lakebase Search に構築されており、動的コンピューティングスケーリングおよび分離された環境を通じてパルス状の並列トレーニングワークロードを処理し、大規模で連続動作するデータベースを維持する必要性を回避します。この技術は、社内ドキュメント、ウィキ、運用データベースなどの固有データを効果的にステートフルな知的 AI エージェントに教えるために企業が活用することを障壁を下げており、深い機械学習または特殊な GPU 専門知識を持たないチームにも高度な機能へのアクセスを可能にしています。
本文
Castform × Neon:自社のデータを「すぐに使えるエージェント」に変える完全な自動化ソリューション
Castform 共同創業者 Ying Hang Seah のメッセージ 「多くのチームにとって、最高のトレーニングデータはただ自社のデータベースに眠っています。問題は、生データを usable なものへと変換するのが困難であり、エージェントを安価かつ大規模に運用するには高度なインフラが必要になることです。Castform は Neon を対象とし、この二つの課題を回避します。」
エージェント構築における 2 つの必須要素
優れた AI エージェントを構築するためには、以下の 2 つの側面が不可欠です。
- コンテキスト(Context): 適切なデータを発見するためのツールを提供できるか?
- Neon(Lakebase Postgres)と Search 拡張機能による解決領域
- モデル(Model): モデルが何を検索すべきかを判断できるか?
- Castform が解決する領域
業界の変化:エンベッディングから Agentic Retrieval へ
AI エンジニアリングの潮流は、約 10 年かけて大きく変化しています。
| 時期 | トレンド | 特徴と課題 |
|---|---|---|
| ~2022 年頃 | エンベッディング検索 (pgvector など) | LLM にコンテキストを提供するため、手作業で RAG パイプラインを構築する必要がありました。類似度検索に依存し、自動化されていませんでした。 |
| ~2025 年頃 | エージェント型リトリバル (Agentic Retrieval) | モデルが計画を立て、ループ内で複数回検索を行うようになります。 課題: フロンティアモデルへの追加呼び出しが必要で、コストとレイテンシが増大しました。 |
フロンティアモデル vs オープンソースモデルの壁
- フロンティアモデル(例:gpt-5.6-sol)の問題
- 典型的な多ターン検索リクエストに 10 秒以上 かかります。
- エンドツーエンドのコストが約 $0.03 と非常に高額です。
- → 遅すぎて高価すぎます。
- オープンウェイトモデルの現状
- コストはフロンティアモデルの 100 倍も低い です。
- しかし、能力が劣っており、特定のタスクでは性能不足です。
Castform のアプローチ:RL ポストトレーニングによるギャップ埋め
強化学習(RL)によるポストトレーニングは、この性能ギャップを解消する鍵となります。
- 検索タスクにおける成果
- ポストトレーニングされたオープンソースモデルは、フロンティアモデルと同等、あるいはそれ以上のパフォーマンスを発揮します。
- コストは桁違いに低く抑えられます。
Castform のミッション 機械学習や GPU の内部機構を気にすることなく、開発者がモデルの RL ポストトレーニングを行うことを可能にし、ポストトレーニングを「プロンプトエンジニアリング」と同じくらい手軽にします。
Castform と Neon を連携したパイプライン
Castform のワークフローはすべて Neon + Lakebase Search 上で動作します。
- ステージ: Neon + Lakebase Search
- コーパス保存: 生ドキュメントを Postgres に保存
- 合成データ生成:
とlakebase_text
を使用してトレーニングタスクを作成lakebase_vector - RL トレーニング: ロールアウト中の検索ツール呼び出しに Lakebase Search を使用
- 本番環境での推論: ファイナルモデルも同様の検索ツールを使用
RL ポストトレーニングの仕組み
効果的な RL は以下の 3 つの要素が必要です。これらが揃うことで、試行錯誤のループが始まります。
- タスク: ユーザーの質問に答える
- 環境: コーパスに対する検索ツール
- 報酬関数: 答えは正しいか?(正解との比較)
モデルがツールを使ってタスクを試み、報酬関数が評価し、フィードバック信号を元に最適化(hill-climb)を行います。
企業が抱える 2 つの課題と Castform の解決策
多くの企業は、ポストトレーニング用のクリーンなデータセットや報酬関数を準備するのが困難です。一方で、以下のような大規模な独自データを抱えています。
- 社内ドキュメント
- プロダクトレコード
- サポート記事
- クライアントとのやり取り
- ウィキ
- オペレーショナルデータベース
これらを「効果的なトレーニングデータセット」に変換するには、大規模なデータエンジニアリングと手動ラベリングが必要です。そのため、多くのチームがポストトレーニングを見送っていた理由は以下の 2 点でした。
- 「トレーニングデータを持っていない」
- 「ファインチューニングは難しく、私たちはそれようなインフラを持っていない」
Castform はこれらを完全に解消します。 既存のコーパスを自動的にトレーニングタスクに変換し、オープンソースモデルがデータを効果的に使うための RL ループ全体を管理します。つまり、「貴社のナレッジベースをそのままモデルとして作成」できます。
自動データセット生成の具体例(Navan × GitLab)
| データタイプ | 内容例 | 特徴 |
|---|---|---|
| ドキュメント (自社データ由来) | 「Navan で予約された列車は GitLab の旅行カードで支払い。標準クラス・14 日以上前予約必須。」 | ルールや事実関係の記録 |
| 正解 (自社データから推論) | 「列車利用の場合、座席は標準クラスで、14 日以上前の予約が必要。」 | 質問への直接的な回答 |
| 質問 (合成生成) | 「Navan で鉄道を予約する際、早めに予約する必要がある規則や、どの席を選べばよいか教えて。」 | ユーザー視点の疑問 |
Castform は、このように生成されたデータセットを用いて、以下の構造(scaffold)を提供します:
- エージェントがアクセスできるツールの指定
- 報酬関数の指定(モデルに何を習得させたいかを記述)
- 例:正しいチャンクを検索し、適切なソースを引用して、正しい最終回答を提供することを目指す。
コード実装と可観測性
Castform を使用すれば、開発者は RL の詳細を気にせず実行できます。以下の Python スケレットが基本構造を示します。
def run_tool(tool, tool_args): """Single tool: hybrid search over Lakebase.""" if tool == "search": query = tool_args["query"] # テキスト検索とベクトル検索をハイブリッドに実行 bm25 = neon.lakebase_text(query, k) vector = neon.lakebase_vector(query, k) return rrf_merge(bm25, vector, k) def reward(trace, ground_truth): """Grade a trace against the ground-truth answer.""" answer = parse_trace(trace) # 各評価項目をチェック retrieval = ... # 正しいソースを検索したか? citation = ... # 正しいチャンクを引用したか? correctness = ... # 正しい回答に至ったか? return retrieval + citation + correctness
- 完全な可観測性: 各ステップごとの報酬上昇を監視可能。
- デバッグの容易さ: 個々のタスクやプロンプトに飛び込み、モデルの定性パフォーマンスを観察可能。
→ ツール不具合や「報酬ハッキング」などの問題を早期発見できます。
詳細なトレーニング実行の監視方法や実例は Castform のブログ および デモページ を参照してください。
高負荷なワークロードへの耐性:Neon の強み
RL トレーニング中は、エージェントが回答までのコンテキスト確保のために Lakebase Search を反復呼び出しします。
- バースティ負荷: 数千件の並列ロールアウトそれぞれが数十回の呼び出しを行うため、突発的な負荷変動が生じます。
- Neon の動的スケーリング:
- ピーク時は低レイテンシの検索を提供し、需要増に即座に対応します。
- アイドル時は計算リソースを縮小(ゼロスケール)できます。
ステートフル(状態保持)エージェントへの対応
エージェントがデータを改変する際や、複雑な状態を持つロールアウトをトレーニングする場合、以下が必要です。
- 独立した環境: ロールアウトの影響が干渉せず、本番環境にも触れない安価な環境。
- Neon のブランチ機能: 各ロールアウトに独立したデータベース状態を与え、タイムトラベルクエリでエージェントの遭遇した状態を再現・検査可能。
結論: オートメタスケーリングとゼロスケール機能を組み合わせることで、数千件の常時稼働環境を用意せずに、数千件ものステートフルなエージェントロールアウト をトレーニング可能です。
まとめ:今日から始めるポストトレーニング
Castform はあらゆる開発者が以下のことを可能にします。
- オープンソースモデルをポストトレーニングする
- それらを フロンティアモデルよりも安価で高速かつ高性能 にする
- 開始方法: 今すぐ castform.com で最初のモデルのポストトレーニングを試してみましょう。