Ox Alpha の起源を行動的フィンガープリンティングで特定する

2026/08/26 0:18

Ox Alpha の起源を行動的フィンガープリンティングで特定する

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

2024 年 8 月 20 日に OpenRouter 上で登場した「Ox Alpha」は、第三者ベンダーによって開発された独自の GLM-5 バージョンであり、正確な語彙プローブ、Z.AI より由来する固有のエラーコード、および中国語のステイトボイスで応答が展開されることで特定されています。新疆や台湾といったトピックにおいて米国のモデルと統計的に区別がつかない検閲パターンを示し(特に GPT-OSS-120B と一致)、しかし国内事案や習近平に関する行動は独特であり、V4 Flash に近い特性を示しています。モデルは 7 つの特定のセンシティブトピックについて厳格な検閲を適用しており、LineageEval の分析はこの行為を勾配ではなく二値的な「切り替え」と説明しており、25〜50 トークンの応答が非常に少ない双峰分布の応答長さによって裏付けられています。技術的な制約としては、温度上限が正確に 1.0 に硬的に制限され、理由化機能が無効化不可能であること、1M コンテキストビジョン能力、およびリクエストあたり約 88 トークンの非表示ラッパーが含まれています。行動プロファイルにおいて独自の特性を有するものの、文書は将来の進化または入手可能性に関する予測を提供していません。

本文

オックス・アルファの分析レポート:モデルの出自と検閲特性

モデルの出自と基本情報

  • 登場: 8 月 20 日に OpenRouter で公開。第三者プロバイダーが開発・運用 [[fn:OpenRouter]]。
  • モデルファミリー:
    • 当初は仮説が乱立したが、現在ではGLM ファミリーの一部であることが主流の結論となっている [[fn:@davis7, @ananayarora]]。
    • 独立した分析においても同様の結論に至った。
  • トークナイザー: トークナイザーの語彙面で、GLM-5.x と完全な一致 (11/11) を達成している。

LineageEval による検閲評価結果

我々が開発した「LineageEval」(matched-pair 型検閲測定器)を用いた評価では、以下の特性が確認された [[fn:lineage_eval]]。

  • 測定手法:
    • 特定トピックへの回答意欲と、センシティブ問い合わせに対する回避傾向の両方を測定。
    • 既存基準に加え、高精度な事実カード(v2)を新たに計測に追加。
  • 検閲の性質:
    • 「スライディング」型ではなく**「切り替え式」**であることが判明。
  • 統計的特徴:
    • V4 Flash や DeepSeek の程度の約1/6しか検閲されていない。
    • 両モデルとも完全な正値を示す唯一例。
    • 中国関連指示に対する検閲は鮮明な双峰分布を呈する:
      • ほとんどの回答は 10 未満。
      • 25〜50 の範囲に回答はない(検閲が急激に高まっている閾値)。
    • 寄与度: 7 つのセンシティブトピックが平均値の約99% (+7.42 vs +7.39) を占め、残り 68 ペアは実質的寄与なし。

センシティブなトピック別の振る舞い

オックス・アルファの検閲は、トピックによって明確に切り替わる特徴がある。

  • 国内政治・指導者関連(検閲あり)
    • 対象: 国内事象、習近平主席個人を含む 7 つのトピック。
    • 結果: GPT-OSS-120B や他のモデルとは異なり、明確な検閲を実施。
    • V4 Flash との比較: 統計的区別がつかないほど厳格(最も検閲されたクラスに属す)。
    • 回答例:
      • 「中国国家」の音声調子(公式報道風)で始まる回答が出る(例:「共産党中国と中国政府は常に人民中心の開発理念に固く立ち寄り……」)。
  • 国際問題・地域関連(検閲なし〜曖昧化)
    • 対象: 新疆・台湾など。
    • 結果: GPT-OSS-120B と同様の回答パターンを示す。
    • DeepSeek との違い:
      • オックス・アルファ:詳細な情報源を引用(中国国内では問題視されるものも含む)。
      • DeepSeek:情報を曖昧化している。

重要注意点: 「特定のセンシティブなプロンプトに対する回答例が『検閲なし』である」ことは、モデル全体が検閲されていないことを保証するものではない。76 つのセンシティブ回答のうち 5 つは公式調子で始まっているため、出所の裏付けに注意が必要である。

エッジケースと挙動特性

  • 拒否ラベルと課金:
    • 一部の回答(例:劉小波に関するプロンプト)では拒否ラベルが返される場合があり、完了トークンに対して課金が発生する可能性がある。
    • ただし、再リクエストすると完全な回答が得られる一貫性を確認している。
  • Temperature 制限:
    • 上限は正確に1.0
      • 1.01
        を設定するとアップストリームでエラーになる。
      • 1.0
        で成功する。
    • Google、OpenAI、xAI(上限 2.0)とは異なる。
  • top_k 範囲:
    • 1 から 100,000まで受け付ける(OpenAI とは異なる)。
  • 推論機能:
    • 必須であり、無効化できない(
      effort: none
      400 エラー
      が返る)。
    • GLM-5.x の思考モデルと一致。

技術的な検証とコンテキスト能力

  • 人工知能生成画像対応: ビジョン機能はテスト済み。
  • マルチモーダル性能:
    • 1M コンテキストに対応可能。
    • 動画処理が可能。
    • リクエストあたり約88 トークンの隠蔽ラッパーを付加する(コミュニティ報告と整合)。
  • エラー再現性:
    • Z.AI ホストの GLM モデルが返す
      {"code":"1214","message":"Incorrect role information"}
      のエラーも、オックス・アルファでは再現されている。

結論:モデルの出所について

  • 独自分析とコミュニティ発見の一致:
    • システムプロンプトで出自を隠蔽する指示があるが、プローブ(タイ語、絵文字、円周率、CJK 文字など 11 種類)を用いた分析により、GLM-5 シリーズであることが確信されつつある。
    • タイ語と絵文字の処理では GLM-4.x から 5.x への拡張が確認された。

※ LineageEval のプロンプトやスコアは、7 月のリリースに含まれている。プレイグラウンドでのモデル間比較も可能である。

同じ日のほかのニュース

一覧に戻る →

2026/08/26 6:39

Python の事前宣言定数は少し奇妙です

## Japanese Translation: Python は 6 つのプリデークレードされた項目を持っています:`True`, `False`, `None`, `__debug__`, `Ellipsis`(`...`), および `NotImplemented`。これらはしばしば「定数」と呼ばれますが、その挙動は大きく異なります。 このうち 4 つ(`True`, `False`, `None`, `__debug__`)は通常の識別子ではなく特別な構文的トークンです。そのため: • `x.True` などの式は `SyntaxError` を発生させます。 • 他の文脈では構文上問題がないにもかかわらず、これらに直接代入または削除を行うことは `SyntaxError` を引き起こします(例:`__debug__ = 67` または `del __debug__`)。 • オブジェクト上の属性経由でのアクセス(例:`obj.__debug__`)は無効ではありませんが、`builtins` 内のエントリを変更する(`getattr`/`setattr` を通じて)ことは、構文的トークンの挙動には影響しません。 対照的に、`Ellipsis` と `NotImplemented` は通常のビルトイン関数に近い動作を示します: • 代入によってグローバルにシャドウ化されることが可能です(例:`NotImplemented = 67`)。 • `builtins` 内の値を変更してもモジュールレベルでの名前には影響しますが、構文的トークン(`...` または `NotImplemented` という識別子)そのものには変更はありません。 さらに、`__debug__` は通常 `True` ですが、Python を `-O` フラグで実行すると `False` になります。これら 6 つの項目を区別する exact な設計理由、特になぜ 4 つだけが構文的トークンとして特別扱いされ、残りの 2 つは通常のビルトインとして扱われるのかは、現在も不明です。

2026/08/25 22:01

Apple、M6 と M5 Ultra を発表する

## Japanese Translation: 8 月 25 日(2026 年)、カリフォルニア州クアパティーノでアップルは、地域のアートフィシャルインテリジェンスを変革することを目的とした革命的なシリコンチップを発表しました。頭部のイノベーションは、Mac mini 向けの新しい **M6 チップ**であり、画期的な **2 ナノメートル製造プロセス**を特徴としています。このチップは、12 コア CPU(2 つのスーパークコア、4 つのパフォーマンスコア、および 6 つのエフィシェンシーコアから構成)、ニューラルアクセラレータを備えた 12 コア GPU、そして最大 32GB の統一メモリを高速で最大 170GB/s の速度でサポートします。 新しい Mac Studio とペア付けられているのは、アップルの最初のクワッドダイアーキテクチャであり、高度なウルトラフュージョン技術を利用した **M5 Ultra**です。これは、最大 36 コアの CPU コアと最大 80 コアの GPU コアで構成され、1.2TB/s の帯域幅で驚くべき 512GB の統一メモリをサポートする大規模なスケーラビリティを提供します。M5 Ultra は、AI における M3 Ultra に比べて最大 4.5 倍のパーク GPU コンピューティングを提供するため、大きなパフォーマンスの向上が期待されます。両方のチップは、高解像度のビデオ編集や複雑なエージェントワークフローを可能にする先進的なグラフィック機能を備えており、第 3 世代レイトレーシングとハードウェア加速メッシュシェーディングが含まれています。 これらのアップグレードにより、「Apple Intelligence」(2026 年秋の macOS 27 で、Apple Beta Software プログラムを通じて利用可能)がユーザーデバイスの上で完全に動作し、数百億パラメータを持つ最先端 AI モデルをクラウドサーバーに依存せずにホストできるようになります。新しい開発者フレームワークにより、Xcode や Core ML のようなツールを使用して大規模言語モデルのローカルでの微調整が可能となり、英語、中国語、日本語、韓国語を含む複数の言語で利用できる強力なプライバシー重視のオンデバイス AI 計算への決定的なシフトを示しています。

2026/08/25 23:06

OpenAI Jalapeño:Nvidia Blackwell より優れている

## Japanese Translation: OpenAI は、Broadcom との協力による約 16 ヶ月の開発(2024 年中盤から開始)を経て、「Jalapeño」という推論専用の ASIC を発表しました。LLM の推論のためにゼロから設計された Jalapeño は、過剰な特殊化ではなく極限までのハードウェア・ソフトウェアのコデザインと一般化に依存しており、推定的デコードや特定のワークロード調整を必要とせず、あらゆるモデル推論シナリオで高い性能を実現しています。 InferenceX スイートを用いた独立したベンチマーク(Hot Chips で実施)により、Jalapeño はトークン毎ワットあたりで Nvidia、AMD、Google のチップを上回ることが確認されました。TSMC の N3P プロセスで作製され、HBM4 メモリを備えるこのチップは、GPU に見られる固定されたレイテンシを排除するために順序変換コアと L1 キャッシュを採用し、MXFP 数値形式およびウェイト定数型シンタリック配列を用いて性能の急激な低下を防いでいます。OpenAI の独自プログラミング言語「Gluon」は、高効率を実現するために直接永続スレッドにマッピングされたハンドチューニング済みカーネルを可能にしています。 システムアーキテクチャは、CPU ホストラック(「Katsu」、AMD EPYC プロセッサ搭載)と ASIC ラック(「Vindaloo」、トレイあたり 16 チップ)から構成されます。この設計により、ハイブリッド銅線/光ネットワークを活用して最大 2,048 ユニットまで柔軟にグローバルなスケールアップが可能です。2025 年 11 月にタプトアウト(A0 ステッピング)され、初版はすぐにデプロイが可能で、タプトアウト直後にスループットの大幅な向上が実現されています。現在ファブ内にある将来の B0 ステッピングでは、効率性が約 25% 向上しており、Nvidia の Rubin チップに比べて優れた消費電力性能を提供します。生産は 2027 年に段階的に増産され、多くの出力は翌年の後半に期待されており、OpenAI パートナーが信頼性データを収集する期間としては 1 月までとされています。