Toast 1 の発表です。

2026/08/15 0:07

Toast 1 の発表です。

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

現在のサマリーは読みやすく、しかし「主要な要点がすべて反映されているか」というチェックポイントを完全に満たすには不十分であり、キーポイントリストに存在する詳細さや証拠の詳細さが欠けています。品質を向上させるためには、具体的な価格 figur es、正確なベンチマークパフォーマンス指標、および完全な統合経路を組み込むべきです。

改善されたサマリー:
Toast 1 は Mixedbread API を介してすぐに利用可能な新しい専用検索エージェントであり、市場リーダー(GPT-5.6 Sol および Claude Opus 5 など)と比較して最大 10 倍のコスト削減と 12 倍の高速化を実現しながらフロンティアレベルの品質を提供します。割引適用されたローンチ価格(例:$0.30/百万入力トークン)で提供されており、中位遅延時間は 8〜11 秒で、他のフロンティアエージェントに比べて 4 から 20 倍高速です。技術的には、Toast 1 はバックエンド非依存設計により、データを移行する必要がなく、クエリを分解し証拠を集めソースを検証する検索ループを完全に管理しており、GPT-5.6 Sol のようなモデル内でのサブエージェントとして、あるいはスタンドアローンツールとしても動作します。

その効率は厳密なベンチマークで検証されています:OfficeQA Pro V2 では、Toast 1 を使用するシステムが約 $1.15〜$1.20/タスクの費用で 70% の回答正答率を達成し、類似の精度を約 $4/タスクというコストでしか達成できない競合他社を上回りました。法的知識テスト(Harvey LAB)では、高い精度を維持しながら総トークン使用量を 60% 以上削減(80.6M から 23M に)しました。ユーザーは標準的な Chat Completions API、コーディングエージェント向けの

npx skills add
コマンド、または Mixedbread Python クライアントを通じて Toast 1 を統合できます。$5 のトライアルクレジットが付属し、ポッドキャスト転写を検索するインタラクティブデモも利用可能です。

本文

トースト 1:初の特化型検索エージェントを一般公開

エージェントへの導入背景と特長

  • 特化型検索エージェントとしての位置づけ
    • 当社の第一号となる特化型検索エージェントです。
    • 本日、正式に一般公開されました。
  • パフォーマンスとコストの革新
    • 検索品質:最前線の検索品質を実現し、Claude Opus 5 および GPT-5.6 Sol に匹敵する、あるいはそれを超える性能を発揮します。
    • コスト削減最大 10 分の 1のコストで動作可能に。
    • 速度向上:処理速度は最大 12 倍の高速化を達成しました。
  • バックエンドの柔軟性
    • Mixedbread Search と組み合わせることで特に高い性能を発揮します。
    • 一方で、他のどの検索バックエンドでも動作可能です。

なぜ今、「特化型エージェント」が必要なのか?

  • フロントリ어나モデルの限界と課題
    • 複雑なドキュメントコレクション内で推論や分析を行い、情報を発見できる能力を持っています。
    • しかし、これらはスタック内で最も高価なモデルでもあります。
  • コストと性能の両立
    • 知能が段階的に課金される環境において、高い能力を維持しつつもコストを大幅に削減する必要があります。
    • これを実現できる特化型エージェントに対するニーズはかつてないほど大きくなっています。

トースト 1 の動作原理:カスケード検索ループ

  • 独立した機能とサブエージェントとしての役割
    • 単独で動作する特化型取得エージェントとして実行できます。
    • また、信頼できるフロントリ어나モデルの一人(サブエージェント)としても機能します。
  • 検索ループ全体を自律的に制御
    1. 初期クエリの受領
    2. サブクエリへの分解
    3. 証拠の収集
    4. ソースの検証
    5. 関連文脈の整理
    6. 最終結果の返却
  • 汎用性とリソース集中
    • エージェント全体が推論、行動、回答生成に注力できるため、コンテキストウィンドウと計算資源を最大限活用できます。

実演:雇用率比較クエリのケーススタディ

  • カスケード(ウォーターフォール)トレースの結果
    • クエリ:「雇用率比較」
    • ツールコール回数:16 回(3 ラウンド)
    • 処理時間:わずか 5 秒以上で回答完了。
  • 詳細な制御可能性
    • ステップを展開することで、生成されたサブクエリや grep パターン、立案された計画を確認できます。

実証ベンチマーク:OfficeQA Pro V2(金融分析)

Databricks の OfficeQA Pro V2 で、複雑な企業金融シナリオにおける回答正確性を検証。

「GPT-5.6 Sol + トースト 1」構成の成果

  • 最高スコアの達成
    • Databricks が評価したシステムの中で**最も高いスコア(回答正確性 70%)**を記録。
    • 品質と効率性の両面で、新たな**ステート・オブ・ザ・アート(最上位性能)**を確立しました。
  • コストパフォーマンス
    • タスクあたりのコストは約 $1.15 です。
    • GPT-5.6 Sol が主モデルで動作し、トースト 1 をサブエージェントとして採用する構成が、従来のパレートフロンティア(Claude Fable 5 のライン:約 $4 で 60%)を大幅に上回っています。

比較対照

  • 従来最高性能:Databricks Genie 上で動作する Claude Fable 5(約 $4/タスク、正確性 60%)。
  • トースト 1 を使用しない場合:GPT-5.6 Sol のみで 33% の正確性に留まりました。

向上の理由:証拠収集の経済構造再定義

  • トースト 1 の特化能力により、高品質かつトークン効率的な証拠パッケージを生産できます。
  • これにより、推論プロセスに十分な資源を残しつつ、最終回答へ到達できる環境が整いました。

実証ベンチマーク:Firm Knowledge(法務エージェント)

Harvey LAB の「Law Firm Knowledge」ベンチマークで、機関独自の法的知識を検索・活用できるかを検証。

法的作業の課題

  • 文脈の重要性:関連判例や詳細な情報へのアクセスが必須です。
  • ノイズ処理:多数の誤検知(False Positives)を伴わずに高品質な証拠パッケージを集めるのは極めて困難です。

トークン使用量削減の劇的な改善

ランダム選択の 33 タスクにおいて、同一タスクスコア(55 点)での比較結果です。

  • バナナ(標準)エージェント
    • タスクあたり:21.7 トルン(Total: 8060 万トークン)
  • Mixedbread Search 追加
    • 削減率:42%
    • タスクあたり:14.6 トルン(Total: 4700 万トークン)
  • トースト 1 サブエージェント追加
    • 削減率:さらに51%(累積削減は約 83%)
    • タスクあたり:11.2 トルン(Total: 2300 万トークン)

結論:コストと品質の両立

  • Mixedbread Search とトースト 1 の導入により、回答品質は維持されたまま、トークン消費を 3.5 倍削減
  • コストは60% 以上削減できました。
  • トースト 1 は最先端モデルのコンテキストウィンドウを解放し、トークンを「正解に至るプロセス」に集中させることを可能にしました。

独自モデルとしての深層検索性能

複雑なタスクにおいてサブエージェントとしても機能しつつ、深層検索に特化したスタンドアローンモデルとしても強力です。

  • ベンチマークでの成績
    • BrowseComp Plus, OfficeQA Pro, LongSeal において、最良のフロントリ어나モデルスイープに匹敵するかそれを超える性能を発揮しました。
    • クエリあたりのコストは極小化され、回答時間は約8〜10 秒(フロントリ어나スイープよりもはるかに高速)。
  • 他のトップモデルとの比較
    • GPT-5.6 Sol と同じリーグにあり、Kimi K3 や GLM-5.2 を確実に上回る性能を発揮します。

コストとレイテンシの概要(実運用時)

  • 標準実行
    • コスト:クエリあたり約 $0.016〜$0.023
    • レイテンシ:8 秒(中位値)
  • 最高品質フュージョン構成
    • コスト:クエリあたり約 $0.05〜$0.07
    • レイテンシ:11 秒(中位値)

フロントリ어나モデルとの比較

  • 同程度の性能に達したシステムの中では、トースト 1 は7〜11 倍のコスト削減と著しい高速化を達成しました。
  • 従来のフロントリ어나モデル駆動のエージェントが要していた時間は、20 秒から 4 分間でしたが、トースト 1 では大幅短縮されます。

ご利用方法:Mixedbread API と既存システムへの統合

パイプライシング(割引導入価格)

Mixedbread API を介して即座にご利用可能です。

  • インプットトークン:30 万件あたり $0.30
  • キャッシュされたインプットトークン$0.036/百万件(キャッシュ書き込み無料)
  • アウトプットトークン:72 万件あたり $0.72

:トースト 1 の Mixedbread Search 呼出は特別価格で提供されています。

1. 既存検索スタックとの組み合せ

Mixedbread Search と共同設計されており、最高パフォーマンスを発揮します。ただし、バックエンド非依存(Backend Agnostic)であり、移行不要です。

Chat Completions API を活用した実装例(ゴールデンハネス) 数分間で既存のエージェントワークフローへのリトリバルツールとして追加可能です。

// 概念的な構造イメージ
{
  "model": "your-preferred-llm",
  "tools": [
    {
      "type": "mixedbread_search",
      // トースト 1 が背後で検索ループを制御
    }
  ]
}

2. コーディングエージェントとの連携

コーディングエージェントに統合処理を任せられます。

  • コマンドラインでの追加
    npx skills add mixedbread-ai/skills
    
  • OpenCode インテグレーション
    • トースト 1 を直接サブエージェントとして利用可能です。

3. Mixedbread Stores との連携(Python サンプル)

from mixedbread import Mixedbread

client = Mixedbread()

results = client.stores.search(
    store_identifiers=["legal-documents"],
    query="does the MSA allow assignment on a change of control?",
    search_options={
        "agentic": True,  # トースト 1 を有効化
    },
)

アクションプラン

  • 試すための API キー取得$5 のクレジットが付与されたプランをご利用ください。

まとめ:業界へのインパクト

  • トースト 1 は、SID-1 や Chroma の Context-1 と並ぶ、特化型検索エージェント領域の重要な研究成果です。
  • 共通目標:より低いコストとレイテンシで、生産環境へフロントリ어나レベルのリトリバルをもたらすこと。

同じ日のほかのニュース

一覧に戻る →

2026/08/15 0:00

Qwen 3.8 27B

## Japanese Translation: Qwen3.8 は、コーディング、プロフェッショナルなワークフロー、研究、長期的なエージェントタスクにおいて大幅な性能向上をもたらす、Qwen3.5 の機能に継承する最新オープンモデルです。コンパクトな Qwen3.8-27B バリエーションは、複雑な多段階実行のためのネイティブのビジョン・ランゲージ理解を備えています:STEM 図や数時間の動画を処理し、環境からのフィードバックを取り扱い、`preserve_thinking` を介して履歴メッセージにわたる思考を保持します。性能は、SWE-bench Pro で 61.7、Terminal Bench 2.1 (Terminus) で 73.0、LiveCodeBench v6 で 90.3、OSWorld-Verified で 84.3、MathVision および OmnilDocBench で 90% 超のスコアを含む強力なベンチマーク結果によって検証されています。 アーキテクチャにおいて、モデルは YaRoPE スケーリングによる拡張性を通じてネイティブに 262k トークンのコンテキストウィンドウをサポートし、最大 100 万トークンまで拡張可能です。`enable_thinking`(デフォルトでオン)と `reasoning_effort`(xhigh/medium/low)によって制御される柔軟な推論モードを提供します。推奨サンプリングパラメータはモードごとに異なります:思考モードでは temperature=1.0、top_p=0.95、top_k=20、min_p=0.0 を使用し、指示モードでは temperature=0.7、top_p=0.80、presence_penalty=1.5 を使用し、思考を無効にするためのオプションの追加ボディ調整が可能です。 本番デプロイメントは、SGLang、vLLM、TokenSpeed、Qwen Cloud API との互換性を通じて簡素化されており、高スループットシナリオには専用サービングエンジンが推奨されます。数時間のビデオ処理については、`video_preprocessor_config.json` の `longest_edge` を 469,762,048(224k ビデオトークン)に設定します。全体として、Qwen3.8 は深い歴史的文脈と長期間にわたる自律的な意思決定を可能にし、既存の画像/ビデオ分析パイプラインとシームレスに統合されます。

2026/08/15 5:46

研究がコーヒー摂取量と代謝健康および性ホルモンの関連性を示唆

## Japanese Translation: 大学のウェブサイトは、主要な学術および行政リソースにユーザーを接続する包括的なポータルとして機能します。構造的には、生化学・分子医学学部、教育学・心理学学部、人文科学部、医学部、情報技術電気工学部、理学部、技術学部、オウルビジネススクールなどの特定ファカルティへの直接ナビゲーションを提供するとともに、「Oula-Finna」図書館システムをはじめとする重要なサポーツサービスにアクセスすることを可能にします。この図書館システムでは、サービス、コレクション、施設、ガイド、連絡先時間などへのアクセスが提供されています。さらに、ニュース、出願、研究、協力、寄付、キャンパス、キャリア、連絡先情報、登記所、中央アーカイブなどのセクションも利用可能です。ウェブサイトはまた、大学ランキングを際立たせて表示しています。これらの多様な要素を統合することによって、ウェブサイトはステークホルダーが特定の機関データおよびサービスを見つけるために効率よく動作し、内部ナビゲーションおよび外部エンゲージメントのための重要なハブとなっています。

2026/08/15 0:03

私が大切にしている本7冊:なぜか大好きだからです。

## Japanese Translation: **改善された要約:** 本文の主な焦点は、作家の机周および棚に配置され、インスピレーションと参照のための詳細な物品リストにある。このキュレートのコレクションは古典文学や神学から数学論理、児童書、デジタルツールまで多様な分野を繋ぎ合わせている。著者は実用性やテーマ的な深さに基づいて特定の版を残しており、例えばロジェの類語辞典第 4 版は時間概念(例:優先度、同時性)の簡潔な分類のために保持されているが、サイズのため第 8 版は遠い棚に移されており使用されていない。他の注目すべき作品には、サウス・トマス・ブラウンの『Pseudodoxia Epidemica』があり、これはロジェのスペースに置かれ、蝗虫やピタゴラスのタブーなどに関する話題が論じられている;ボッカッチョの『デカメロン』(1348 年の黒死病を背景とし、ダンテと比較される);そして『フレゲからゲーデルへ』という数学論理論文集が含まれている。リストにはさらに、ヨハネス・コメニウスの挿絵入り児童書『Orbis Sensualium Pictis』(1658 年)、特定の記事に関する注釈を付した大型文字の NIV 聖書、ベリー公の中世『Belles Heures』、そして 8mm バックアップテープや韓国式麻雀カードのような個人的な文脈を持つ物品も含まれている。最後に、GNU Emacs や Blosxom ソフトウェアなどの実用的なデジタルツールに加え、ドラフト作成およびテキスト修正のために GNU grep およびその他のユーティリティのコレクションも含まれている。

Toast 1 の発表です。 | そっか~ニュース