
2026/09/18 8:15
Show HN:混雑課金を備えたプログラミング可能なインターネット検索エンジン Scry
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
Scry は、AI エージェントが 43 のソースにわたる数十億行(≒163 億行)のインターネットドキュメントをスキーマベースの SQL とベクトル検索ツールを使用して照会するための読み取り専用インターフェースとして機能する MCP サーバーです。従来のウェブ検索とは異なり、大規模なデータの再配布や競合製品の作成を禁止する厳格なルールを適用し、公開された作品については明示的な出典表示を要求します。このシステムは、高次元的な索引速度(18 GB/s)とともにサブ秒間のパフォーマンス(中央値クエリ時間 98ms)を実現し、ベンチマークにおいて複雑な質問に対する回答率は 71.8% に達しました(Gemini の 66.1% と比較)。サポートされるソースには Reddit、Wikipedia、SEC EDGAR、arXiv などが含まれており、ChatGPT や Claude などの主要クライアントを介して統合されながら、ユーザーのマシン上でコードを実行することはありません。商業的可行性は、プライシングティア(チーム向けに月々$2,000 から)とエージェント課金モデル($0.05/秒)に依存しており、信頼できるデータソース上で準拠したアプリケーションを構築しつつ、観察と負荷時間に関する独自のメタデータを維持することを可能にします。
本文
Scry: プログラムによるインターネット研究用 MCP サーバー
インターネットは広大で、あなたの好奇心も深いです。Scry は、エージェントが数十億ものインターネット文書上でプログラムを実行できるようにする MCP(モデルコンテキストプロトコル) サーバーです。娯楽や利益のために利用できます。Reddit や Hacker News から arXiv、予測市場に至るまで、毎日何百万もの新しい投稿とコメントが到着しています。Scry は、エージェントに特定の照会条件に一致するすべての照問可能な文書に対して、数千行ずつデータを抽出したり、自ら答えを計算したりする能力を提供します。
概要とメトリクス
- 照問可能データ:
- 約 1638 億 3786 万 4844 行。
- 43 のソースにまたがる(UTC 21:50 に測定済み;5 分ごとにカウント)。
- 保有データセット:
- 約 4189 億 218 万 53 行(UTC 21:50 に測定済み;5 分ごとにカウント)。
- インデックス化速度(過去 24 時間):
- +279 億 286 万 9484 行(平均約 1940 万/分)。
提言: インターネット上で任意のプログラムを実行する。人々はページを検索しますが、エージェントは基となるレコードを直接照会できます。 エージェントが持つ問いかけは、単に 10 のリンクを見つけることだけではあまりに稀です。特定の化合物について言及されているすべてのページが必要である場合や、特定の特許については言及していないものをドメインごとにグループ化して検索したい場合などはあります。Scry は、それを繰り返しの検索とスクレイピングされた結果を組み立てる代わりに、単一の照会として実行します。
仕組み
- ライヴスキーマ: アジェントは
を読み取り、有効なソースネイティブな関係(relation)およびリストされたベクトルヘルパーを選択します。/v1/scry/schema - 有界照会: フレーズマッチング、時間ウィンドウ、結合、またはベクトルの合成のための 1 つの有界照会を記述します。
- 結果の保持: 結果となる行は、関係が提供するソースネイティブの識別子と出典フィールドを保持します。
- エージェントの機能: Scry は、エージェントが一度に 1 ページずつ取得するのではなく、数十億の文書上で計算することを可能にします。ステイディング照会は、あなたが記述できる任意の条件についてレコードを観察し続けます。パブリックウェブ上の派生テーブルは、単一の照会で完結し、クローラーを必要としません。
インストールガイド
前提条件
- インストール対象: アジェント側(ChatGPT, Claude, Codex, Cursor、または任意の MCP クライアント)にのみインストールします。
- URL:
https://mcp.scry.io
- URL:
- アカウント: サインアップフローでアカウントが作成されます。機械上でローカルに動作するのは接続のみです。
セットアップ手順
1. ChatGPT の設定
- ウェブ上の ChatGPT を開き、設定へ移動します。
- セキュリティとログインの下で、開発者モードをオンにします(リスクを受け入れます)。
- オープンプラグインへ移動し、**+**をクリックして以下の情報を入力します:
- 名前:
scry - 説明:
programmatic search - サーバー URL:
https://mcp.scry.io
- 名前:
- 作成をクリックします。
- ChatGPT がサインアップフローを提示したら完了させてください。
- Scry はプラグインとして表示され、任意のチャットでそれを選択するか、
と呼び出してください。@scry
2. Claude の設定 (Claude.ai, デスクトップ、モバイル)
- 設定 → コネクタへ移動します。
- カスタムコネクタを追加をクリックします。
- 名前を
にし、URL をScry
に設定して追加します。https://mcp.scry.io - サインアップフローを完了させてください。
- チャットのツールメニューから Scry を有効にしてください(1 つのセットアップがすべてのプラットフォームに対応します)。
3. デベロッパー向け (Claude Code, Codex, Cursor)
MCP クライアントがないエージェントは、HTTP API とあなたのキーを使用します。クライアントごとの手順はコネクトページにあります。
- Claude Code:
claude mcp add --transport http scry https://mcp.scry.io # 次にセッション内で /mcp を実行し承認してください。 - Codex:
codex mcp add scry --url https://mcp.scry.io && codex mcp login scry - 一般的な MCP クライアント: その URL でカスタムコネクタを追加し、
の同意を承認してください。scry.io - ヘッドレス/CI 環境:
- Claude Code:
を追加します。--header "Authorization: Bearer $SCRY_API_KEY" - Codex:
を追加します。--bearer-token-env-var SCRY_API_KEY - キーはダッシュボード
にあります。https://scry.io/dashboard
- Claude Code:
HTTP API(MCP が利用できない場合)
- ベース URL:
https://api.scry.io - 認証ヘッダー:
(Authorization: Bearer $SCRY_API_KEY
から読み込み)。キーがない場合は、ダッシュボードへの遷移を促します。~/.config/scry/env
コア API エンドポイント
-
ディスカバリー
: ライブのコントラクト(契約書)。GET /v1/scry/context?mode=agent
: ディスカバリーの唯一の権威。デフォルトのドキュメントには、スタート・フォー・スチュア関係の完全なコントラクトとコンパクトなインデックスが含まれます。GET /v1/scry/schema
はより多くの完全なコントラクトを、?relation=<name>
は全カタログをリストします。?mode=index- SQL 呼び出し: スキーマのディスカバリーも 1 つの SQL 呼び出しで行えます:
およびscry.relations
は、フィルタリングおよび結合可能な関係として提供される同じカタログです。scry.columns
-
照会
: Scry SQL の読み取り専用ステートメント(常にPOST /v1/scry/query
を伴う)。同期処理ですが、長い照会は JSON ボディの前にホワイトスペースをストリーミングすることがあります。LIMIT
CTE をサポートします。WITH RECURSIVE- 固定点グラフウォーク: JSON ボディに
は、境界線(citation, reply/quote, thread-tree edges)のみを読み取る固定点グラフウォークを実行します。{"program": {...}}
- 最適化フラグ:
: すでに保持しているドキュメントを指示順にソートします。ローカルモデル上で動作($0)。x-scry-rerank
: レスポンスは計画とインデックス分析(選択された部分、参照された関係、行/バイト/メモリに関する予測)です。x-scry-explain: 1
-
ベクトルおよび高度な操作
: すでに保持しているドキュメントを指示順にソートします。POST /v1/scry/rerank
: 検索文法行 (POST /v1/scry/compile
) および関係を入力し、実行せずにその関係自身のステートメントにコンパイルします。q
ワーキングルールとベストプラクティス
- トークンフィルタ:
- 最も稀なトークンの速度で実行されます。1 つの独自性の高いトークン(名前、識別子、unusual な単語)を含めてください。
- すべての共通語セットは 30-60 秒をかけてスキャンします。
- 幅広いトピックについては埋め込みヘルパーを使用してください。
- ソースネイティブな関係:
- テキストはソースネイティブな関係(例:
,reddit.comments
)に存在し、それぞれ独自の列とクロックを持ちます。hackernews.items - どのソースファミリーが回答できるかを決定し、それらの関係を直接読み取るか並列で読み取ってください(各ステートメント 1 つずつまたは
)。UNION ALL
- テキストはソースネイティブな関係(例:
- ソートとリランキング:
- 属性に従って行をソートするには、
を送信してください。ローカルモデル上で動作します($0)。x-scry-rerank: <directive>
- 属性に従って行をソートするには、
- 説明計画:
- ステートメントを実行する前に何に触れるかを見るには、
を送信してください。x-scry-explain: 1 - 注意: ANN ステートメントは、explain 中に候補を見つけるために独自の検索を実行しますが、実行ではそのコストを支払う必要があります。
- ステートメントを実行する前に何に触れるかを見るには、
- 出典(Provenance):
- ソースタイムスタンプ、観察時間、読み込み時間、処理ステータス、品質フィールドを区別して保持してください。最近の読み込みは最近のソースイベントとは限りません。各主張をサポートするフィールドを指定してください。
- 報告:
- 正確な SQL、関係、行数、期間、トリャンケーション状態、および返された会計フィールドを報告してください。
- 法的・利用:
で管理されます。結果の大規模再配布やコーパスの大部分の再構築は許可されません。Scry を基盤とした公開作品は、https://scry.io/legal/terms
へのリンクとともに Scry に明示的にクレジットを付与する必要があります。https://scry.io
データソースインベントリ(保有データセット)
ソーシャル・フォーラム
| ソース | 説明 | 保有行数 | 備考 |
|---|---|---|---|
| 2005 年以降のほぼ完全な歴史アーカイブ;キャプチャ前に削除された投稿/コメントは欠落しています。ライブテールは一部をキャプチャします。 | 27,068,135,758 | でカウント。 | |
| Hacker News | 2006 年以降のソースネイティブエクスポート;アップvotes は特定の観察期間に従います。 | 45,616,978 | を含む。 |
| LessWrong | 主要なフォーラムコーパス(投稿/コメント);ライブテールによってアーカイブベースが更新されます。 | 48,398,596 | コミュニティスコーピングには を使用。 |
| Stack Exchange | ネットワーク全体にわたる質問/回答;コメントは直接提供されません(カウントのみ)。 | 83,480,861 | ダンプベースのベース + API テール。 |
| EA Forum | より広範なフォーラムスキーマ内の主要なフォーラムコーパス。 | 926,263 | LessWrong の注記を参照してスコーピング。 |
| Bluesky | アーカイブ観測と継続するテールを持つ投稿。 | 3,745,260,469 | スキーマエントに公開される時間的カバレッジ。 |
| Mastodon | Zenodo ダンプおよびライブパブリックタイムラインからのステータス。 | 2,415,689,538 | デデュピケーションの注意点があります。 |
| フォーラム(一般) | DEV、DataSecretsLox、クリプトガバナンスなどを含む数千のフォーラムサイト。 | 48,398,596 | LessWrong の注記を参照してスコーピング。 |
ライティング・ウェブ
| ソース | 説明 | 保有行数 | 備考 |
|---|---|---|---|
| Common Crawl Index | キャプチャごとの URL インデックス(CDX);テキストコストなしの存在性と出典レイヤー。 | 45,468,367,569 | 正確な WARC 出典トリプルが含まれます。 |
| Common Crawl Pages | 全ページから抽出されたテキスト;ボイラープレートを含む;同じ URL はエポックを超えて再帰します。 | 23,467,722,695 | リコールには を使用。 |
| メールリスト | 公開メールリスト/Usenate アーカイブ(extropians, SL4 など);返信/ルートでスレッド化されます。 | 1,611,702,651 | ペイロードはメッセージテキストです。 |
| Web Crawl Pages | すべてのホストにわたる観察されたウェブページのテキスト抽出(ライブコーパス)。 | 964,948,659 | 以前の静的アーカイブは にあります。 |
| Web Crawl Artifacts | 保存されたキャプチャ;フェッチされたバイトがセグメントパックに保持されます。 | 731,311,356 | ページごとの生バイト。 |
| Wikidata | ウィークリーエンティティスナップショットからのアイテムと主張(CC0)。 | 373,834,895 | ソースネイティブキー。 |
| Internet Documents | 85 のソースファミリーにわたるテキストドキュメント;固定された連盟スナップセットとライブテーブルの対比。 | 204,516,642 | を id で解決。 |
| Substack Comments | Substack 投稿下部のコメント。 | 87,222,365 | — |
| Common Crawl Distillate | クリーンされた読み物レイヤー(ジャンル分類、ボイラープレートなし)。Tier A/B/C レベル。 | 64,994,473 | トークンインデックス化;WARC トリプルを保持。 |
| Substack Posts | 出版リスト全体にわたってスウィープされ、カスタムドメインも含まれます。 | 30,796,194 | — |
| Wikipedia | 英語のメインネームスペース記事(全テキスト、カテゴリ、品質フラグ)。 | 6,332,561 | 6.2M ページセットが読み込まれ、新規記事も加わる。 |
シンク・学術
| ソース | 説明 | 保有行数 | 備考 |
|---|---|---|---|
| OpenAlex Citations | 逆引用エッジ;この論文を引用するもの(最新順)。 | 3,086,374,182 | で結合。 |
| 図書館目録 | OCLC/WorldCat、OpenLibrary、ISBNdb、Google Books にわたるレコード。 | 1,527,812,492 | — |
| OpenAlex Works | メタデータスナップセット;タイトル、会場、DOI、著者、トピック、引用。 | 511,893,275 | 引用グラフを含む。 |
| Paper Extractions | すべてのテキスト抽出試行/改訂;ステータス、品質、テキスト自体。 | 396,105,644 | 品質フラグは忠実度を示す。 |
| Crossref | パブリックデータファイル(2026 年 3 月);登録された DOI ごとに 1 つの行。 | 179,535,192 | — |
| Patents | Google Patents パブリックデータセットからの出版物。 | 170,418,479 | — |
| Academic Papers (Full) | 'good' クオリティでフィルタリング;PDF ベースと TeX 派生テキストを含む。 | 91,219,378 | マクロ値付き番号を検証。 |
| PubMed | 年間ベースライン + 毎日更新;改訂/削除は順序立てて解決されます。 | 42,943,113 | — |
| Book & Magazine Full | 全テキスト(epub、pdf など);形式、コンバーター、品質ラベル。 | 17,174,359 | コレクションの読み込みに伴い継続的に増加。 |
| arXiv | TeX ソースと提供された場合の全テキストを含む書誌フィード。 | 6,930,006 | — |
マーケット・金融
| ソース | 説明 | 保有行数 | 備考 |
|---|---|---|---|
| Market Trades (Unified) | Kalshi、Polymarket、Manifold にわたるストリームで確率前/後の。 | 631,974,838 | マーケットの単一カタログ。 |
| Kalshi | エグゼキューション(実現価格/流動性)とマーケット(ステータス/決済)。 | 589,970,678 / 576,731,011 | アペンディオンリー。 |
| Polymarket | 取引(エグゼキューション)とマーケット(タイトル/カテゴリ/解決/ボリューム)。 | 306,173,459 / — | — |
レコード・コード
| ソース | 説明 | 保有行数 | 備考 |
|---|---|---|---|
| SEC EDGAR | 全テキスト filings(1993+);DOJ Epstein リリース;Trace ledger。 | 234,042,272 | 現在の報告書/インサイダー filing を含む。 |
| Google Trends | US メトロ/国別のトップ/上昇用語;毎日更新。 | 1,048,992,260 | 2026 年 5 月まで毎時。 |
| FEC Transactions | コーミッティー/候補者別の選挙資金取引。 | 434,463,850 | — |
コード・ソフトウェア
| ソース | 説明 | 保有行数 | 備考 |
|---|---|---|---|
| GitHub Archive Events | パブリックスナップセットからの時系列プッシュ/issue/PR/star/fork ストリーム。 | 11,180,778,027 | アーカイブの最新の訪問の結果が別々に記録されます。 |
| Software Heritage Revisions | グラフエクスポートからのコミット(履歴レイヤー)。 | 5,940,997,207 | — |
| Package Registries | npm、Go、PyPI などへのリンクを単一のカタログとして。 | 1,152,917,663 | Libraries.io 統合。 |
| GitHub Archive Events | リポジトリのアーカイブ観測(結果は別々に記録)。 | — | オーナー検索で観察されたリポジトリが返されます。 |
非公開ソース
- 総保有: 2550 億 9320 万 1093 行(データセットの 61%)。
- 説明: リビュwow アクセス下のソースは、保有データセットにカウントされますが、デフォルトでは照問できません。
への記述が必要です。hi@scry.io
ベクトル空間と埋め込み
Scry は直接便利な線形構造を提供します:
- ファーストクラスベクトル: テキストから任意のものを作製し、照会で加算、減算、投影できます;結果に沿って全コーパスをランク付けできます。
- オペレーター: テキスト検索は完全なオペレーター文法(正確なフレーズ、除外、OR、正規表現、フージー、近接)を話し話します。
はその文法を単一の述語として照会に持ち込みます。scry_lex - 主要関数:
: ランキングのために説明を 1 つの概念に平均化します。@metric@school@reward
: 2 つの文書間の差を方向として。scry_contrast_axis_balanced(@a, @b)
: 意味の 1 つの成分を保持または削除します。scry_project_onto
: 例から概念を構築します。scry_seed_centroid([@x, @y])
クエリ例
1. 高レバレッジのツイートを見つける(「保存数がいいね数を上回った」)
コーディングエージェント用にフィルタリングし、配布用の餌を避けながら、人々がブックマークしたがいいねしなかったアカウントを特定します。
SELECT any(author_handle) AS handle, max(author_followers) AS followers, max(like_count) AS likes, max(bookmark_count) AS saves, round(saves / likes, 1) AS saves_per_like, substring(any(text), 1, 150) AS text FROM twitter.tweets WHERE bucket_date >= today() - 3 AND hasAnyTokens(search_text_lc, ['subagents', 'mcp', 'evals', 'agentic', 'finetuning']) AND NOT hasAnyTokens(search_text_lc, ['giveaway', 'retweet', 'free', 'bookmark', 'link']) AND lang = 'en' AND NOT startsWith(text, 'RT @') AND bookmark_count >= 150 AND bookmark_count >= like_count AND author_followers < 20000 GROUP BY tweet_id ORDER BY saves_per_like DESC LIMIT 10;
- 結果:
、@navaneethvb
、@LLMpsycho
(高い保存/いいね比率を示す)。@syrgkanis
2. LessWrong のアラインメントドリフトを分析する
「到達可能」と「到達不可能」のアラインメント概念の対比軸上で各投稿をスコアリングし、四半期ごとのコミュニティドリフトを追跡します。
SELECT quarter, if(scored = 0, NULL, lean - avgIf(lean, scored > 0) OVER ()) AS drift, scored, posts, round(scored / posts, 3) AS coverage FROM ( SELECT quarter, avg(post_lean) AS lean, count() AS scored FROM ( SELECT e.target_key, toStartOfQuarter(any(p.original_timestamp)) AS quarter, avg(scry_cosine_similarity(e.embedding, scry_contrast_axis_balanced(@achievable, @unreachable))) AS post_lean FROM embeddings.chunks AS e JOIN forums.posts AS p ON p.post_key = e.target_key WHERE e.source = 'forum_posts' AND e.model_name = 'voyage-4-lite' AND p.source = 'lesswrong' AND p.kind = 'post' AND p.original_timestamp >= '2009-01-01' GROUP BY e.target_key) GROUP BY quarter) AS s RIGHT JOIN ( SELECT toStartOfQuarter(original_timestamp) AS quarter, uniqExact(post_key) AS posts FROM forums.posts WHERE source = 'lesswrong' AND kind = 'post' AND original_timestamp >= '2009-01-01' GROUP BY quarter) AS c USING (quarter) ORDER BY quarter LIMIT 100;
3. "Vibe Coding" の採用率を追跡する
集約演算子を使用して、月単位で Hacker News における特定のフレーズの採用を測定します。
SELECT toStartOfMonth(original_timestamp) AS month, count() AS items, countIf(scry_lex('"vibe coding"')) AS mentions, round(100000.0 * mentions / items, 1) AS per_100k FROM hackernews.items WHERE original_timestamp >= '2024-12-01' GROUP BY month ORDER BY month;
- 結果: 2025 年 1 月からの 0 から、2025 年 4 月の約 10 万件あたりの 212 への指数関数的成長。
4. 共通の接続を見つける(Musk, Altman, Yudkowsky がすべてフォローしている人)
特定のユーザーのフォローリストの共通部分を見つけます。
WITH common AS ( SELECT followee_id FROM twitter.following WHERE follower_id IN (44196397, 1605, 2595244026) -- Elon, Sam, Eliezer GROUP BY followee_id HAVING uniqExact(follower_id) = 3) SELECT argMax(handle, observed_on) AS handle, argMax(followers, observed_on) AS follower_count FROM twitter.users WHERE author_id IN (SELECT followee_id FROM common) GROUP BY author_id ORDER BY follower_count DESC LIMIT 10;
- 結果:
、Vitalik Buterin
、JD Vance
が上位。Paul Graham
5. 共有引用を特定する
OpenAlex 引用エッジ上の集合共通部分論理を使用して、2 つの特定の作品を引用する論文を見つけます。
SELECT id, title, publication_year, cited_by_count FROM openalex.works WHERE id IN ( SELECT citing_work_id FROM openalex.cited_by WHERE cited_work_id IN ('https://openalex.org/W3001279689', -- Scaling Laws 'https://openalex.org/W4225591000') -- Chinchilla GROUP BY citing_work_id HAVING uniqExact(cited_work_id) = 2) ORDER BY cited_by_count DESC;
6. Hacker News の抗争を検出する
両者が互いに少なくとも 3 回返信したユーザーペアを特定します。
SELECT least(a.original_author, b.original_author) AS one, greatest(a.original_author, b.original_author) AS other, count() AS replies, uniqExact(a.story_hn_id) AS threads FROM hackernews.items AS a INNER JOIN hackernews.items AS b ON a.parent_hn_id = b.hn_id WHERE a.original_timestamp >= now() - INTERVAL 21 DAY AND a.original_author != b.original_author GROUP BY one, other HAVING countIf(a.original_author = one) >= 3 AND countIf(a.original_author = other) >= 3 ORDER BY threads DESC, replies DESC LIMIT 8;
7. Manifold マーケットセンチメントのシフト
群衆が大幅に考えを変えた市場を見つける(例:暗殺未遂ベトが 30% から 99% にシフト)。
WITH moves AS ( SELECT contract_id, argMin(prob_before, created_at_source) AS p_start, argMax(prob_after, created_at_source) AS p_now, uniqExact(user_id) AS bettors FROM manifold.bets WHERE created_at_source >= now() - INTERVAL 7 DAY AND prob_before != prob_after AND answer_id IS NULL GROUP BY contract_id HAVING bettors >= 30) SELECT m.title, round(100 * p_start) AS was, round(100 * p_now) AS now, bettors FROM moves INNER JOIN (SELECT market_id, argMax(title, observed_on) AS title FROM manifold.markets WHERE market_id IN (SELECT contract_id FROM moves)) AS m ON m.market_id = moves.contract_id ORDER BY abs(p_now - p_start) DESC;
価格設定とアクセス権限
| プラン | 料金 | 機能 | ターゲット |
|---|---|---|---|
| Researcher | $0(登録時 5 クレジット) | API キー、MCP アクセス | 非商業的研究 |
| Patron | $100/月 | クレジットがバランスタイに移り、残高としてロールオーバー | パトロンになる |
| Team | $2,000/月より | 専用容量 | 商用利用 |
| Agents | $0.05/秒(x402) | 宣言されたタイムボックス課金 | 大規模評価 |
注記: Scry は独立した非商業的研究および商用エンゲージメントのための公共便益インフラストラクチャとして補助されています。
コミットメントとフィードバック
Scry は、良心あるプロソーシャルな勢力が世界を劇的に平坦化させるプログラムを実行しやすくするよう設計されています。Scry が失敗することは想定されていません!もし何か点で失敗した場合、どのように失敗したかをお知らせください(メールのコピーを送ります)。私たちは迅速に適応して克服しようとします。
- フィードバック:
(資格証不要)。POST https://api.scry.io/v1/feedback - スキーマ更新:
は各関係の観察された extent とラグを運搬します。/v1/scry/schema
結論
Scry は
https://mcp.scry.io にある MCP サーバーです。ChatGPT や Claude で接続するには約 2 分かかり、コードは不要です。サインアップページでもアカウント作成が可能です。Scry はプラグインとして表示されます。それを選択するか、任意のチャットで @scry と呼び出してください。セットアップはウェブ上で一度行います。OpenAI の MCP ヘルプ記事には、どのクライアントがカスタムコネクタを持つかが記載されています。