Qwen 3.8 は GPT-5.5 Pro の推論事前埋め込みを採用しています

2026/09/10 2:24

Qwen 3.8 は GPT-5.5 Pro の推論事前埋め込みを採用しています

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

まとめ

本研究 v1.1 では、教師モデルとして GPT-5.5 Pro を用いて推論プリフィル実験を再実行し、それがより小さな対象モデルに与える影響を評価した。各問題について、2 つの応答が生成された:非プリフィル済みと、GPT-5.5 Pro の推論のうち最初の 1% を対象モデルのチャネルに挿入したプリフィル済みである。成功度は、教師の可視化された答えの対象応答の最初の 100 トークンに含まれる割合により測定され、スコアは単一元(unigram)、2 グラム(bigram)、3 グラム(trigram)のソース再帰デルタ(絶対パーセントポイント変化)の平均として計算された。

評価データセットには、STEM カテゴリ 15 問、非 STEM カテゴリ 15 問、合成パズルカテゴリ 15 問を合計 45 問が含まれていた。主要な結果では、GPT-5.5 Pro の推論プリフィルにより、DeepSeek V4 Flash では -1.17 pp の性能デルタ、Inkling では +0.46 pp、Kimi K3 では +4.54 pp が得られた。Qwen3.8 A95B は全 45 問で +18.18 pp という最大の改善を示し、すべてのカテゴリにわたって最も大きな向上を達成した。カテゴリー別に分けると、Qwen の性能デルタは STEM タスクで +26.99 pp が最高であり、次に合成パズル(+14.75 pp)、そして非 STEM タスク(+12.80 pp)の順であった。

議論では、以前の実験で Qwen が Opus 4.8 へとシフトしていた一方で、今回は GPT-5.5 Pro へ +18.18 ポイントのシフトを示しており、Qwen が Opus からではなく、GPT-5.5 Pro またはそれと密接に関連する GPT モデルから学習したことを示唆している。さらに、Kimi K3 はプリフィルなしで GPT-5.5 Pro と 31.11% の重なり、プリフィルありで 35.65% の重なりを維持しており、GPT-5.5 Pro とのオーバーラップが最も高いが、プリフィルによる性能向上は Qwen に比べて小さい。

本文

Reasoning Prefills v1.1:GPT-5.5 Pro を用いた推論先読み評価

実験概要

「Reasoning prefills」および「Stolen Thoughts」の続報として、教師モデルに GPT-5.5 Proを用いて再評価を行いました。

生成手順

各ターゲットモデルに対して、以下の 2 パターンの回答を生成しました:

  • 通常(先読みなし):通常の生成プロンプトで得た回答。
  • 推論先読みあり:ターゲットモデルの「推論チャンネル」に、GPT-5.5 Pro の推論内容の**最初の 1%**を挿入して生成した回答。

スコア定義

  • 最終的な答え自体は自由な生成により得られています。
  • 評価指標:ターゲットモデルによる回答の最初の 100 トークン内で、教師モデル(GPT-5.5 Pro)の答えがどの程度出現するかを測定。
    • スコア計算式:unigram、bigram、trigram のソース再現率の平均値
    • Δ(差分):絶対パーセントポイント変化を表します。

全問題の結果 (45 問)

評価対象は計 45 問(STEM 15 問、非 STEM 15 問、合成パズル 15 問)です。

モデルn(件数)先読みなしGPT-5.5 Pro 推論先読みありΔ(差分)
DeepSeek V4 Flash4527.30%26.13%−1.17 pp
Inkling4519.99%20.45%+0.46 pp
Kimi K34531.11%35.65%+4.54 pp
Qwen3.8 A95B4516.79%34.97%+18.18 pp

注目点: Qwen3.8 A95B は、推論先読みを導入することでスコアが倍増する劇的な改善を示しています。


Qwen のカテゴリ別結果

Qwen3.8 A95B の各分類ごとの詳細な評価結果です。

カテゴリn(件数)先読みなしGPT-5.5 Pro 推論先読みありΔ(差分)
STEM1519.26%46.24%+26.99 pp
Non-STEM1520.62%33.42%+12.80 pp
パズル1510.49%25.23%+14.75 pp
全体4516.79%34.97%+18.18 pp

考察

1. Qwen の学習ソースの再検証

  • 前回の実験では Qwen は Opus 4.8 への変化が僅かでしたが、今回は GPT-5.5 Pro に対して +18.18 ポイントの大幅改善を記録。
  • **「合成パズル」**という非公開カテゴリでも顕著な効果が見られたことは、Qwen が Opus からではなく、**GPT-5.5 Pro(またはこれと極めて近い関係にある GPT モデル)**からの学習を行った可能性が示唆されます。

2. Kimi K3 の親和性

  • 先読みを施さない場合でも高い値(31.11%)を示した Kimi K3 は、GPT-5.5 Pro との親和性が最も高く確認できました。
  • 推論先読みによる改善幅は +4.54 ポイントと限定的でしたが、依然として GPT-5.5 Pro との強い関連性が裏付けられました。

同じ日のほかのニュース

一覧に戻る →

2026/09/10 3:15

iPhone デュオ

## Japanese Translation: アップルは、二画面デザインの画期的な初代折りたたみスマートフォン「iPhone Duo」の発売を予定しています。内蔵ディスプレイが 7.6 インチ、外側ディスプレイが 5.4 インチというこのデュアルディスプレイ構成は、どちらも Super Retina XDR テクノロジー、ProMotion(最大 120Hz)、そして最大 3,000 nits のピーク輝度を備えています。開いた状態での 7.6 インチ画面は iPhone 18 Pro Max よりも 50% も大きく、かつこれまで製造された中最薄の iPhone です。折りたたんだ状態ではポケットに収まるサイズのデバイスとなり、外側ディスプレイは iPhone 18 Pro の画面面積の 90% を超えます。本体フレームとヒンジカバーにはグレード 5 タイタンを使用し、IP68(防水・防塵)対応、また内蔵ディスプレイにノアノテクスチャ仕様にすることで反射を軽減しています。 性能は、高度な A20 Pro チップと二重 16 コアニュラルエンジンにより支えられ、集約的な AI タスクを効率的に管理します。これらのワークロードを処理しバッテリー寿命を延長するために、iPhone 初採用のデュアルバッテリーシステムを採用しており、内側ディスプレイでは最大 31 時間の動画再生、外側ディスプレイでは最大 44 時間の再生が可能です。電源供給オプションには、MagSafe ワイヤレス充電と、約 20 分で 50% までの給電可能な有線充電が含まれます。 カメラシステムは、48MP デュアルフュージョン構成(メインカメラと超広角カメラ)、48MP フュージョン遠望レンズ(最大 2 倍の光学的品質ズーム)、そして 12MPセンターステージ前面カメラを備えています。このハードウェアにより、近しい友人との Duo FaceTime、ハンズフリーでグループ写真を撮影する Smart Take、ライブでの外側ディスプレイによる構図表示のための Duo Preview、子供向けの Kid Cue アニメーションなどの新しいソフトウェア機能が実現します。本デバイスは Apple Intelligence と Siri AI を対応しています。 ストレージオプションには 256GB、512GB、1TB、および 2TB の構成が用意されており、eSIM 専用設計によって容量を最大化しています。2026 年 10 月 23 日に apple.com および一部のキャリアで発売予定であり、同時にはリデザインされた折りたたみデバイスの姿勢に最適化された iOS 27 が導入されます。iPhone Duo は技術ハードウェアの新たな基準を設定し、折りたたみデザインと AI インテグレーションを進化させながら、利用者に前例のないワークフローの柔軟性を提供します。

2026/09/09 22:27

Shopify が Tailwind を買収

## Japanese Translation: Shopify は、安定した長期的な据え場所を提供し、主要な商用エコシステム内でのアクティブなメンテナンスを確保することを目的として Tailwind CSS を買収します。この動きにより、両社のミッションが統合され、Tailwind の核心となる強みである「美しいインターフェースを簡素化する」ことと、Shopify の「エージェント型コマース」のビジョンが一致します。週間に 1 億 1000 万回以上のインストール数を持つ Tailwind は、ChatGPT、X、Cloudflare、Reddit、そして Shopify そのものを含む大手企業によって採用されており、すでに Shopify 自身の技術スタックの一部として不可欠な役割を果たしています。買収により、Tailwind 周辺の商用成長は停止し、新規顧客の登録も一時中断されますが、すべての既存ライセンス(Tailwind Plus および ui.sh 含まれる)は引き続き完全サポートされます。特に重要なのは、Tailwind が MIT ライセンスを維持し、開発者の自由を守りつつ、チームが Shopify のサポートの下でコミュニティプロジェクトを主導し続けることです。このパートナーシップにより、Tailwind は Shopify スタックの中核となるコンポーネントとしての将来性が確保され、9 年間のイノベーションに基づき信頼が強化されます。

2026/09/09 3:11

Visa とマスタカードは何をするか? カードネットワークの入門

## Japanese Translation: Visa および Mastercard は、従来の銀行ではなく、安全で両当事者を繋ぐカードネットワークとして機能します。これらはカードを発行することも、製造することも、POS ハードウェアを取り扱うことも、商取引業者(マERCHANT)のオンボーディングを管理することもしません。両者は通信手段を通じて発行者とマERCHANT を接続しており、認証(ルーティングのリクエスト/レスポンス)および清算(最終額面の提出)を行います。カード番号は IP アドレスのように利用されます。日常の決済処理を管理するため、Visa は 1,120 億ドルの流動性を保有しており、2024 年度における最大の daily 決済曝露額は 1,374 億ドルです。 収益は、地域によって異なる手数料分割から得られ、安全な支出や望ましい行動を促進することを目的としています。典型的なアメリカでの取引では、マERCHANT が約 2.5%(MDR)、プロセッサが約 0.35%、発行者銀行が約 2%(インターチェンジ)、Visa が約 0.15%(ネットワークアセスメント)をそれぞれ受取ります。欧州連合では、インターチェンジ手数料は 0.3%に上限が設けられており、これはアメリカモデルと比較して消費者の支払習慣を代替決済手段へと転換させる影響を与えています。 セキュリティは運営の中心です:バージニア州アッシュバーンにある Visa の旗艦オペレーションセンター・イーストでは、地震や時速 270 キロメートル(170 マイル)の風などの災害に耐えるために強化されたデータセンターを使用しており、時速 80 キロメートル(50 マイル)の車両を停止できる水力式bollard が備わっています。ガバナンスは、ブランドの使用、データ要件、紛争手続きを含む包括的な規則書を通じて強制され、違反には月間あたり 25,000 ドルから 100 万ドルまでの罰金が科される場合があります。紛争は 600 ドルの審査料(上訴では 1,000 ドル)がかかる強制仲裁によって解決され、当事者が合意しない場合、Visa は署名やセキュリティ映像などの証拠を頼りに介入します。世界的には、ネットワークは国際的な決済におけるアダプターとして機能し、銀行システム間で資金のルーティングを行い通貨変換を取り扱いながら、重大なペナルティを避けるために厳格な遵守が求められます。

Qwen 3.8 は GPT-5.5 Pro の推論事前埋め込みを採用しています | そっか~ニュース