自己成長のためのハネスエンジニアリング

2026/08/04 15:17

自己成長のためのハネスエンジニアリング

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

人工知能分野は、リカursive自己改善(RSI)——この概念は I.J. グッドおよび Yudkowsky にさかのぼる——において決定的な転換点にあり、焦点は生粋の知能从事から、それを管理するシステムの工学へと移っています。Anthropic や OpenAI などのフロントヤードラボによる実証実験が進むこの実用的な進化は、「ハーネス工学」として知られるものであり、モデルの知能と並んでデプロイシステム(評価、オーケストレーション、ツール)が極めて重要になります。開発者は静的コードから離れ、文脈エンジニアリングやメタ・ハーネスアプローチなどによる動的環境へと移行しています:文脈エンジニアリングは文脈を専門エージェントにより管理される進化するプレイブックとして扱い、メタ・ハーネスアプローチではハーネスコード自体を最適化のための探索空間とみなします。AFlow のような Monte Carlo Tree Search(MCTS)を用いた自動設計手法や、厳密な可観測性の支柱を採用した propose-evaluate ループを実装する Agentic Harness Engineering(AHE)のようなフレームワークは、コア機能の再設計なくしてシステムが作業フローを反復的に洗練させることを可能にします。これらの進歩により、報酬ハッキングといった落とし穴を防ぎつつ、進化的探索とメタ最適化を通じて戦略を進化させながら複雑な数学問題やソフトウェア問題を安全に解決できる堅牢なエージェントシステムが実現されます。

本文

ハネスエンジニアリングと自己改善(Harness Engineering for Self-Improvement)

はじめに

  • 反復的 자기 改良(Recursive Self-Improvement, RSI) の概念は、I. J. グッド(1965)が定義した「超知的機械」の起源に遡ります。
  • ユドロフスキー(2008) は、「RSI」という用語を特定のフィードバックループのために採用しました:すなわち、人工知能が現在の知性を活用して自らの認知メカニズムを向上させるプロセスです。
  • 現代の AI における RSI のフィードバックループは、以下のいずれかによりモデルの後継版を作り上げることを指します。
    • モデルの重み(weights)を直接的に書き換えること。
    • トレーニングパイプラインやデプロイメントシステム自体を改良すること。
  • AI 分野の研究開発速度は、Anthropic や OpenAI の最前線の研究所で劇的な加速を示しています。

「ハネス(Harness)」の重要性

  • 定義: ハネスとは、ベースモデルを取り囲むシステムであり、生モデルと現実世界のコンテキストの間にある層です。モデル自身の生の知能に匹敵するほど重要です。
  • 役割: 実行のオーケストレーション、思考・計画方法の決定、ツールの呼び出し、行動の実行、文脈の管理、アーティファクトの保存、結果の評価などを担当します。
  • 例示: Claude Code や Codex のような成功したコーディングエージェントがハネスの重要性を証明しています。

本投稿の焦点

  • ハネスエンジニアリングに関する研究とそれがRSI にどのように寄与するかについて焦点を当てます。
  • 関連する他の研究(自動リサーチ、自己改良エージェント、進化的なプログラム検索など)は RSI のビジョンと一致しますが、本稿の主要な対象ではありません。

ハネス設計パターン

初期のエージェントフレームワーク(LLM + メモリ + ツール + 計画 + 行動)に加え、ハネスエンジニアリングには以下が追加されます:

  • ワークフロー設計(例:ループエンジニアリング)
  • 評価と権限制御
  • 永続的な状態管理

これらは単なるプロンプトテンプレートではなく、実行時のソフトウェアシステム設計に近く、モデルがどのように観測し、行動し、記憶し、自らをチェックして改善するかを定義します。

設計原則

  1. 意図的に簡潔かつ汎用的: 一般化を可能にする必要があります。
  2. 既存の知識への依存: 既存のソフトウェアエンジニアリングの実践(事前学習知識)からの恩恵を受けることが期待されます。
  3. OS に似た役割: OS のように、複雑なロジックをカプセル化しつつ、インターフェースをシンプルに保つべきです。
  4. 標準化の趋势: 設定ファイルやツールインターフェースは業界全体で徐々に標準化されていく可能性があります。

パターン 1: ワークフロー自動化

  • 目標: モデルが動作し、テストし、反復できるワークフローを定義することです。
  • : Karpathy の
    autoresearch
    リポジトリ。
  • 一般的なサイクル: 計画 → 実行 → 観測・テスト → 改善 → 再度実行(ゴール達成まで)。
    • 必要に応じて、ユーザーにタスク仕様や優先度について能動的なリクエストを行います。
  • 分析: ワークフローグラフは静的なテンプレートではなく、「エージェントランタイム」を通じて自身の軌跡や失敗を分析し、進歩を繰り返します。

パターン 2: ファイルシステムを永続的メモリとして

  • 理由: 長期的視野のエージェントシステムでは、コンテキストウィンドウよりも長いアーティファクト(実験ログ、コード差分、論文要約など)が発生します。
  • 実装: ハネスはコンテキストにすべてのログを保持するのではなく、ファイルを介した堅牢な状態を維持する必要があります。
  • スキル習得: ファイルシステムを読み書き・編集する方法(一般的には
    bash
    コマンドを通じて)は LLM にとって基礎的であり、永続的メモリ管理はコア能力から自然に恩恵を受けます。

パターン 3: サブエージェントとバックエンドジョブ

  • 機能: ハネスは複数のサブエージェントを生成して並列実行し、バックエンドジョブを監視できます。
  • 用途: メインエージェントが仮説を検索したり、実験を実行したり、メインコンテキストを汚染せずに孤立したタスクに委任する際に有用です。
  • 親エージェントの役割: プロセスマネージャーとして、ジョブの起動、ログ検査、失敗実行のキャンセル、結果の統合を担当します。
  • 並行性の重要性: 出力を一時的なチャットコンテキストに留めると陳腐化しますが、ファイルやログとして保存することで、モデルは中断から回復し実行履歴を再考できます。

ケーススタディ:コーディングエージェントハネス

主流のコーディングエージェント(Claude Code, Codex, OpenCode, Cursor など)において安定しているコアインターフェースは、以下のループを使用します。

  • ツールのセットへのアクセス: リポジトリ内で開発・デバッグを行い、人間が IDE を使うのと同様です。

ツール定義の一覧

グループ具体的なツール例
ファイルシステム発見 (glob, grep), 読み取り (read), 修正 (write, edit, apply_patch)
シェル実行
bash
,
PowerShell
コマンド実行
IO / バージョン管理LSP,
git
ツール (status, diff, commit など)
外部コンテキストMCP ツール、スキル
ウェブ検索web_search, web_fetch, ブラウザツール
アーティファクトドキュメント/画像の読み取り・生成 (HTML, 画像)
バックエンドプロセスCronCreate, CronDelete, CronList など
エージェント委任spawn_agent, resume_agent, wait_agent, close_agent, interrupt_agent など

ハネス層対コア知能?

RSI の短期経路は、モデルが直接的に重みを書き換えることから始まる可能性は低いです。

  • 短期的展望:
    • ハネスエンジニアリングはメタ手法論(より良い答えを得るための機械を改善し、その答え自体を改善する)の方向に進化するでしょう。
    • ハネスシステム自体が最適化対象となり、ヒューリスティックな規則が減り、より一般的なメカニズムを持つようになります。
  • 長期的展望:
    • 成熟したハネスは自動リサーチを可能にし、より賢いモデルはハネスの過剰設計を防ぎます。
    • 最終的には多くの改善がコアモデル行動に内部化される可能性がありますが、外部コンテキストおよびツールとのインターフェースは存続します。
    • プロンプトエンジニアリングでも同様のパターン(手動のトリックは減少し、目標・制約・評価の指定が必要)が見られます。

ハネス最適化のプロセス

指示プロンプト → 構造化コンテキスト → ワークフロー → ハネスコード → オプタイマーコード モデルが賢くなるにつれ、ターゲットと方法はより複雑で一般的になります。


コンテキストエンジニアリング (ACE & MCE)

長文脈の拡大により制御不能になるのを防ぐために、LLM に対して構造化された簡潔なコンテキストを構築する層が必要です。

Agentic Context Engineering (ACE; Zhang ら 2025)

  • 進化しているプレイブックとして扱い、3 つの構成要素でコンテキストプレイブック(箇条書き形式)を維持します:
    1. ジェネレーター: タスク軌跡を生成。
    2. リフレクター: 成功/失敗からの洞察を精製。
    3. キュレーター: 構造化コンテキストを更新(フルプロンプトを書き換えるのではなく、構造化項目への追加)。
  • 設計選択: キュレーターは重複除去を行い、決定論的ロジックを用いてマージします。

Meta Context Engineering (MCE; Ye ら 2026)

  • メカニズム(コンテキストの管理方法)とアーティファクトコンテンツを分離し、メタ最適化レベルでスキル進化を実行します。
  • **スキル $s$**は文脈関数 $c_s=(\rho_s,F_s)$ を定義:
    • $\rho_s$: 静的構成要素(プロンプト、知識ベース)。
    • $F_s$: 動的オペレーター(検索、選択、フィルタリング)。
  • 階層二重最適化:
    • 内側ループ: トレーニングデータ上で最適なコンテキスト $c_s^*$ を見つける。
    • 外側ループ: 検証セットで最良のパフォーマンスを提供する最適スキル $s^*$ を見つける。

Meta-Harness (Lee ら 2026)

  • 最適化対象を決定し、モデルに保存すべき情報や提示すべき情報をコードとして最適化します(「メタ」の意味)。
  • ハネス進化の特性: 新しいハネスを作成する提案者自体がコーディングエージェントであり、出力はパレト frontier 上の候補コレクションです。

ワークフロー設計

ハネスエンジニアリングにおけるワークフロー設計を自動リサーチを用いて検索・最適化します。

  • AI Scientist (Lu ら 2026): 研究アイデアから原稿記述、ピアレビューまでを自動化するパイプライン。
    • ScientistOne: 検証可能性を重視し、あらゆる主張が証拠源に追跡可能(Chain-of-Evidence)。
  • Autodata (Kulikov ら 2026): データサイエンティストとして機能し、「ちょうどよい」難易度のデータを合成します。
    • チャレンジャーの提示 → 弱求解器・強求解器の実行 → 検証者による評価 → プロンプト更新のループ。
  • Automated Design of Agentic Systems (ADAS; Hu ら 2025): エージェント設計自体を最適化問題として定式化。
    • メタエージェントが新しいワークフローの設計をコードで提案・自己改善(CoT, self-refine を用いたフィードバックループ)。
  • AFlow (Zhang ら 2025): ワークフローをグラフとして表現し、MCTS(モンテカルロ木探索)を用いて最適化。

自己改良ハネス (Self-Harness)

単なるワークフローやコンテキスト管理だけでなく、全体の設計空間を検索し、ハネスそのものをコードとしてプログラム・最適化します。

Self-Taught Optimizer (STOP; Zelikman ら 2023)

  • 目標: 改善器 $I$ そのものを進化させること(直接ソリューション $s$ を改善するだけでなく)。
  • メカニズム: メタユーティリティを通じて改善器のパフォーマンスを測定し、反復的に新しいバージョンを得ます。
    • 遺伝的アルゴリズムやベイズ最適化などの戦略を発見しました。
  • 課題: ベースモデルはメカニズムを改善する能力が必要であり、弱いモデルでは劣化する傾向があります。

Work Self-Harness (Zhang ら 2026)

LLM エージェントが

propose-evaluate-accept
ループを通じて自身のハネスを改善します。

  1. 弱点鉱掘り: 検証者による失敗パターン(タイムアウト、欠落など)をクラスタリングし、根本原因を特定します。
  2. ハネス提案: 有界なハネス編集を提案します。候補は多様で、解決可能且つ狭い変更であるべきです。
  3. 提案検証: キャンディデート編集を検証(回帰テスト)し、新しいハネス $h_{t+1}$ を作成します。

Agentic Harness Engineering (AHE; Lin ら 2026)

  • ハネス進化のボトルネックは**可視性(observability)**にあります。
  • 3 つの可視性の柱:
    1. コンポーネント可視性: ファイルシステム内に表現を持ち、7 つのコンポーネント(プロンプト、ツール説明など)を個別に追跡可能。
    2. 経験可視性: 軌跡を分析し、タスク毎の失敗レポートを生成(トークン効率的)。
    3. 決定可視性: 各編集は予言とペア付けられ、ファイルレベルで反証可能。報酬ハッキングを防ぐ制御が施されています。

進化的検索 (Evolutionary Search)

自然選択に触発された最適化手法です。ハネス検索に適しています。

  • Promptbreeder: プロンプト自体を突然変異を通じて進化させる。
  • AlphaEvolve: コーディングエージェントで候補プログラムを凍結 LLM で評価し、時間的に良いソリューションを発見。
    • メタプロンプトも共進化します。
  • Darwin Gödel Machine (DGM; Zhang ら 2025): エージェント自身のハネスコードリポジトリを進化させます。
    • 固定モデル下で機能し、SWE-bench Verified などでの大幅な向上を実現しました。

進化的検索の利点と限界

  • 適応: 広範で奇妙な形状の検索空間や、勾配計算が難しいケースに適しています。
  • 課題: 計算効性と効果は懸念事項であり、評価が遅く曖昧なドメインでは困難です。

モデル重みとの共同最適化

ハネス進化だけでなく、モデル自体の重み更新と組み合わせる完全な自己改善も可能になります。

  • SIA (Hebbar ら 2026):
    • メタエージェント(提案)、タスクエージェント(実行)、フィードバックエージェント(更新選択)の 3 つからなる最適化ループを構築。
    • トレーニング安定性やグードハート効果などの課題が残っています。
  • Continual Harness (Karten ら 2026):
    • ハネス更新と低報酬軌跡上で強力な教師モデルからのラベル蒸留による共学習を実験。

将来の課題とボトルネック

研究が進歩していますが、以下のボトルネックが存在します。

  1. 弱いおよび曖昧な評価器:
    • 研究味や新規性は測定が困難です。「p-hacking and eureka-ing」による虚偽の成功宣言のリスクがあります。
  2. コンテキストおよびメモリのライフサイクル:
    • 自律性の向上に伴いメモリ増大しますが、人間のように生涯維持する知能のコア部分としての管理が必要です。
  3. ネガティブ結果への対応:
    • LLM はデータの不均衡により成功偏りを示す傾向があり、失敗から学ぶ能力が不足しています。
  4. 多様性の崩壊:
    • 既知の高報酬パターンへの収束を防ぐメカニズムが必要です(研究の進展には重要)。
  5. 報酬ハッキング:
    • ベンチマークやテスト自体を過学習するリスクがあり、評価器および権限制御はループの外側に置く必要があります。
  6. 長期成功:
    • 短期的なタスク完了ではなく、リポジトリの長期的健康や保守性を考慮する必要があります。
  7. 人間の役割:
    • ループから完全に除去せず、正しい時期に正しい抽象化レベルで監視(タッチポイント)を提供すべきです。

引用情報

論文タイトル: Harness Engineering for Self-Improvement
著者: Lilian Weng
公開日: 2026 年 7 月
URL: https://lilianweng.github.io/posts/2026-07-04-harness/

BibTeX 引用例

@article{weng2026harness,
  title = {Harness Engineering for Self-Improvement},
  author = {Weng, Lilian},
  journal = {lilianweng.github.io},
  year = {2026},
  month = {July},
  url = "https://lilianweng.github.io/posts/2026-07-04-harness/"
}

付録:有用なベンチマーク一覧

ベンチマーク概要主な特徴
PaperBench論文の再現性評価 (ICML 2024 スポットライト 20 件)8,316 の基準事項。最良モデルは ML 博士課程学生より劣る。
CORE-Bench計算再現性の評価90 の論文に基づく 270 のタスク。最良エージェントも困難なタスクでは精度不足。
ScienceAgentBenchデータ駆動科学発見の評価数学・化学・生物学・地理学のピアレビュー済みデータからの 102 タスク。
RE-Bench現実的な ML 研究環境での評価 (人類専門家対)7 つの課題的エンジニアリング環境。短期予算では AI が上回るが、長期予算では人間の方が優れる。
MLE-benchオフライン Kaggle コンペティション評価75 のコンペ。Kaggle プUBLIC リーダーボードを基準に、16.9% のコンペでメダルレベル達成。
KernelBenchGPU カーネル生成の評価250 の PyTorch タスク。高速かつ正しいカーネルの生成能力を測る (
fast_p
インデックス)。

参考文献

  1. Good, I. J. "Speculations Concerning the First Ultraintelligent Machine." Advances in Computers, 6:31–88, 1965.
  2. Yudkowsky, Eliezer. "Recursive Self-Improvement." LessWrong, 2008.
  3. Choi, et al. "Anchored Self-Play for Code Repair." ICML 2026.
  4. Zhao, et al. "Absolute Zero: Reinforced Self-play Reasoning with Zero Data." arXiv preprint arXiv:2505.03335, 2025.
  5. Yuan, et al. "Self-Rewarding Language Models." arXiv preprint arXiv:2401.10020, 2024.
  6. Chen, et al. "Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models." ICML 2024.
  7. Zhang, et al. "Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models." ICLR 2026.
  8. Ye, et al. "Meta Context Engineering via Agentic Skill Evolution." arXiv preprint arXiv:2601.21557, 2026.
  9. Lee, et al. "Meta-Harness: End-to-End Optimization of Model Harnesses." arXiv preprint arXiv:2603.28052, 2026.
  10. Lu, et al. "Towards end-to-end automation of AI research." Nature, 651:914–919, 2026.
  11. Meng, et al. "ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence." arXiv preprint arXiv:2605.26340, 2026.
  12. Kulikov, et al. "Autodata: An agentic data scientist to create high quality synthetic data." arXiv preprint arXiv:2606.25996, 2026.
  13. Hu, Lu, and Clune. "Automated Design of Agentic Systems." ICLR 2025.
  14. Madaan, et al. "Self-Refine: Iterative Refinement with Self-Feedback." NeurIPS 2023.
  15. Zhang, et al. "AFlow: Automating Agentic Workflow Generation." ICLR 2025.
  16. Zelikman, et al. "Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation." COLM 2024.
  17. Zhang, et al. "Self-Harness: Harnesses That Improve Themselves." arXiv preprint arXiv:2606.09498, 2026.
  18. Fernando, et al. "Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution." arXiv preprint arXiv:2309.16797, 2023.
  19. Agrawal, A. et al. "GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning." arXiv preprint arXiv:2507.19457, 2025.
  20. Novikov, et al. "AlphaEvolve: A coding agent for scientific and algorithmic discovery." arXiv preprint arXiv:2506.13131, 2025.
  21. Lange, Imajuku, and Cetin. "ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution." arXiv preprint arXiv:2509.19349, 2025.
  22. Wang, et al. "ThetaEvolve: Test-time Learning on Open Problems." arXiv preprint arXiv:2511.23473, 2025.
  23. Zhang, et al. "Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents." arXiv preprint arXiv:2505.22954, 2025.
  24. Zhang, et al. "Hyperagents." arXiv preprint arXiv:2603.19461, 2026.
  25. Yuksekgonul, et al. "Learning to Discover at Test Time." arXiv preprint arXiv:2601.16175, 2026.
  26. Riaz, et al. "Epistemic Uncertainty for Test-Time Discovery." arXiv preprint arXiv:2605.11328, 2026.
  27. Hebbar, et al. "SIA: Self Improving AI with Harness & Weight Updates." arXiv preprint arXiv:2605.27276, 2026.
  28. Trehan and Chopra. "Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts." arXiv preprint arXiv:2601.03315, 2026.
  29. Bubeck, et al. "Early science acceleration experiments with GPT-5." arXiv preprint arXiv:2511.16072, 2025.
  30. Starace, et al. "PaperBench: Evaluating AI's Ability to Replicate AI Research." ICML 2025.
  31. Wijk, et al. "RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts." ICML 2025.
  32. Chan, et al. "MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering." arXiv preprint arXiv:2410.07095, 2024.
  33. Chen, et al. "ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery." ICLR 2025.
  34. Siegel, et al. "CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark." TMLR 2024.
  35. Ouyang, et al. "KernelBench: Can LLMs Write Efficient GPU Kernels?" arXiv preprint arXiv:2502.10517, 2025.
  36. Lin, et al. "Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents." arXiv preprint arXiv:2605.30621, 2026.
  37. Lin, et al. "Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses." arXiv preprint arXiv:2604.25850, 2026.
  38. Karten, et al. "Continual Harness: Online Adaptation for Self-Improving Foundation Agents." arXiv preprint arXiv:2605.09998, 2026.
  39. Che, et al. "DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations." arXiv preprint arXiv:2605.24539, 2026.

同じ日のほかのニュース

一覧に戻る →

2026/08/05 7:01

インターポールが警告、アフリカのサイバー犯罪の半分以上を AI が支えデジタル詐欺急増

## 日本語訳: 以下に、元の草案から欠落していた特定の地域的なニュアンスおよび文脈源をより適切に統合しつつ、明瞭さを維持するためにもたらされた改善されたバージョンが示されます。 ## サマリー(改善版) INTERPOL の 2026 アフリカサイバー脅威評価によると、人工知能はアフリカ全体でサイバー犯罪における支配的な力となり、報告された事例の半分以上を原動力とし、2024 年の 1,9200 万ドルから 2025 年には 4,8400 万ドルへと金融損失を増大させています。状況は地域によって多様です:西アフリカおよび南部アフリカは主要な詐欺センターを擁しており(調査対象国の 72% で特定)、中央アフリカではビジネスメールへの侵害やロマンス詐欺の発生率が高く、東アフリカではモバイルマネー詐欺、重要インフラに対するランサムウェア攻撃、合成アイデンティティ犯罪に苦しんでいます。特定のセックス extortion の急増が明らかで、TrendAI がディープフェイクに関連する約 60 万件の事例を検出しています。犯罪者はこれらのツールをソーシャルメディアやモバイルマネーおよびデジタル銀行のようなプラットフォームと組み合わせ、ローンの目的や SIM カード登録のために合成アイデンティティを伴う複雑なスキームを実行するために使用します。しかし、依然として重大な脆弱性が存在しており、特に南部アフリカのように高度なデジタル接続を有する国々において、銀行、通信事業者および法執行機関間の弱い連携は、犯罪者が盗まれた資金を瞬時に国境を超えて移動させることを可能にしています。これらの課題にもかかわらず、対応は増えつつあります;2025 年だけでも、セネガルの新しいオンライン報告プラットフォームを含むサイバー犯罪法の更新を行ったアフリカ諸国は 17 カ国あり、Serengeti 2.0 など共同作戦を促進し、それらは 1,500 件以上の逮捕と 1 億ドル以上の資金の回復をもたらしました。将来のセキュリティは、これらの進化する AI 駆動型の脅威に対処するために、持続的な国際協力および強化された地域準備に依存します。

2026/08/05 1:36

Mistral の Shieldstral:マルチモーダル検閲向けに公開された 3B オープンウェイトモデル

## 日本語訳: Shieldstral は、NVIDIA との Open Secure AI Alliance の初メンバーとして Apache 2.0 ライセンスの下でリリースされた、30 億パラメータを持つオープンウェイトのマルチモーダル安全性分類器です。このモデルは、テキストと画像の安全性評価を単一の適応型インターフェースに統合し、1 トークンから定量化された連続的な安全性スコアを返します。Shieldstral は、コンテンツモデレーションを文脈・厳格度に適応する質問応答タスクとして位置付け、推論時に再トレーニングなしで平易な言語でのポリシーを受け入れる 3 つのコンポーネント(<Instruct>:文脈/厳格度、<Query>:はい/いいえの安全性に関する質問、<Document>:評価対象のテキストまたは画像)を採用しています。Shieldstral は、プロンプト分類、回答モデレーション、拒否検出、毒性検出を単一の適応可能な問題に統合します。性能については、テキスト安全性、拒否検出、ポリシー適応性、マルチモーダルベンチマークにおいて、最大 7 倍のサイズを持つオープンガードモデルと同等かそれ以上の性能を示し、1 つの 16GB の NVIDIA GPU で効率的に動作します。Forge 上でのエンドツーエンドトレーニングでは、多様なラベル形式を持つ現実および合成データを組み合わせたヘテロ지니어ズなデータを使用し、以下の 4 つの主要な課題に取り組んでいます:(1)ヘテロ지니어ズなデータタクソノミーの統合、(2)暗記ではなく判別の学習、(3)画像に基づく安全性の根拠付け、(4)LoRA と SLERP メージを介した補完的なチェックポイントの組み合わせです。データ処理では、ソースごとの厳格度調整(ジャイルブレイク用は厳しく、回答品質用は緩い)を行い、定量化された意思決定境界を学習し、一般的な画像データセットを負例として使用するとともに、視覚・言語再ランク付けにより誤ラベル付けされたペアをフィルタリングしました。今後の計画としては、多言語対応の拡大、長文書に対する堅牢性の向上、およびマルチモーダル安全性機能の幅広化が含まれます。

2026/08/05 0:16

Show HN: 肌の色調を多様化する単純なアルゴリズムと色彩空間

## Japanese Translation: このプロジェクトは、デジタルアートおよびキャラクター作成向けに包摂的なツールを促進することを目的とした、簡略化された RGB ベースの色空間を導入します。これは、現在のシステム(絵文字:5 色、メイクアップパレット:約 50 色など)の限界に対処するものです。本モデルは、生物学的要因(メラニンや血流など)、個々のバイアス、健康状態(例:黄疸など)、および異なるディスプレイ環境によって複雑化している人間の肌トンの莫大な複雑性に対する科学的権威を主張するのではなく、実用的で「十分良好な」エンジニアリングの起点を優先します。手法は、手動での RGB データラベリング、主成分分析(PCA)によるデータセットの変換、Desmos 3D、SymPy、matplotlib、scikit-learn などのツールを用いた球面式のフィッティングを含みます。得られたシステムは、PCA 軸から導かれる 3 つの独立した値を利用し、UI を介して調整されます。ここで、可変的な球半径パラメータは色の変化を制御します;具体的には、この半径を小さくすると、すべての肌トーン(深肤色、白人、冷色調、温色調)において一様に変化が減少し、特定のグループを不均衡に排除することはありません。原点点はニュートラルな曖昧なトーンを表し、マッピングバイアスを特定するために有用です。今後の作業では、専門家ラベラーを用いてモデルを微調整し、黄疸や白斑症などの状態に対する簡略化された表現を取り入れる予定です。本アプローチは科学的でないことを認める一方で、エンジニアリング用途においては依然として非常に機能性を備えていることを認識しています。