秀 HN:CUA-S1 — コンピューター利用のためのシステムワンモデル

2026/09/20 0:52

秀 HN:CUA-S1 — コンピューター利用のためのシステムワンモデル

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

Cua プロジェクトは、デスクトップ自動化のための包括的なオープンソースエコシステムを導入し、エージェントが複数のオペレーティングシステムにおいてコードとグラフィカルインターフェースの両方と対話できるようにします。この概念は「Computer-Use 2.0」として記述されています。このスイートは、専用 API キーや複雑なコンテナ化環境への依存を排除するため、Sandbox SDK を通じた孤立型クラウドデスクトップ(Cua Fleets)のラン.cua.ai を介した柔軟なデプロイメントオプション、および Apple の Virtualization.Framework を使用したローカル macOS/Linux 仮想マシン(Lume)を提供します。主要ツールには、CLI、MCP、または Typed SDK を介して macOS、Windows、Linux でのネイティブアプリケーションの検査と操作を行う Cua Driver および、VM、Docker、モデル API キーを必要とせずにコンピューター使用タスクの構築と評価を行える Cua Bench が含まれます。プラットフォームには Hugging Face ホストされた高速かつ有界な意思決定を実現する専門化された「System 1」モデル(CUA-S1)が特徴です。すべてのコアコンポーネントは MIT ライセンスであり、Kasm(MIT)、OmniParser(CC-BY-4.0)などのサードパーティ統合、および ultralytics(AGPL-3.0)を含むオプションの cua-agent[omni] が含まれます。ユーザーはコマンドラインインターフェースまたはソフトウェア開発キットを通じてこれらのリソースを容易にデプロイでき、Cua Driver、Lume、Cua Bench のためのインストールコマンドが提供されています。プロジェクトは研究者や企業がエージェントベースのワークフローの標準化によって運営を合理化できるように支援し、ドキュメント、ブログ記事、Discord コミュニティへの関与、GitHub Issues、およびプライベートな脆弱性情報報告を含むサポートを提供します。ユーザーには研究文脈でソフトウェアを引用することを求められており、Apple、macOS、Ubuntu、Canonical、Microsoft の商標はそれぞれの所有者に属し、本プロジェクトはこれらの会社とは無関係であり、推奨されるものではありません。将来の開発では、コミュニティ関与とモデルリポジトリの拡大を通じて継続的な成長を約束しており、ベンダーロックインや過度な技術的オーバーヘッドなしで高度なコンピューター使用アプリケーションを育成します。

本文

Cua: AI エージェントのための包括的なコンピューティングプラットフォーム

Cua は、AI エージェントに利用可能なコンピューティング環境を提供するオープンソースのプラットフォームです。デスクトップ自動化機能、隔離されたクラウドデスクトップ、ローカル仮想マシン (VM)、専門的な意思決定モデル、および評価用ベンチマークを備えています。

すぐに試したい場合は、Cua Fleets をチェックしてください。


あなたの選択に応じたパス

プラットフォームでは以下の機能を提供しています:

  • Cua Fleets: リンクスデスクトップのプロビジョニング、コマンド実行、スクリーンショット保存。
  • CUA-S1: 迅速な意思決定に特化した小型モデルの探索。
  • Cua Driver: カルキュレーターアプリ操作と結果検証。
  • Lume: Tahoe VM の作成および SSH 接続。
  • Cua Bench: シミュレーションタスクの構築と評価。

独自のエージェントを持ち込むことも可能です。**「コンピューター使用 2.0」**は、コード、API、グラフィカルインターフェースを行き来するエージェントを指す概念です。

Cua Driver の実動作例

Omarchy デスクトップ上で、以下の同時動作が確認できます:

  • 2 つの
    Cua Driver
    セッションで LibreOffice Calc と Inkscape を操作
  • 端末はフォアグラウンドで稼働継続
  • 50 秒間のデモ映像を参照

Cua Fleets: 隔離されたクラウドデスクトップのプロビジョニング

run.cua.ai で、サンドボックス容量を維持する単位である「Fleet」を使用してデスクトップを取得し、Sandbox SDK を用いてコマンドを実行・対話できます。

最初の成果

  1. リンクスデスクトップのプロビジョニング
  2. uname -a
    コマンド実行
  3. スクリーンショット保存
  4. クラウドリソース削除(必ず Clean up ステップに従う

注意: プーリング機能により割り当て終了後も有料容量が保持されるため、クリーンアップは必須です。

ローカルサンドボックスと Fleets の違い

  • 両者とも
    Sandbox SDK
    を共有しますが、認証情報・イメージ・操作内容・ランタイム要件に差があります。
  • ハードウェア管理の詳細は「Manage local sandbox lifecycle」を参照してください。

関連リンク:


Cua Driver: ネイティブデスクトップアプリとブラウザの操作

macOS、Windows、Linux のネイティブアプリおよびブラウザを操作するためのエージェント用ツールを提供します。CLI、MCP、または typed SDK で接続可能です。

背景配信(Background delivery)

対応プラットフォームでは、ポインタ移動やフォーカス取得なしに作業が可能です(境界条件はサポートドキュメント参照)。

インストールコマンド

macOS / Linux

/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"

Windows (PowerShell)

irm https://cua.ai/driver/install.ps1 | iex

最初の成果

  • エージェントに接続し、「6 × 7」を計算させる
  • アプリが「42」と表示していることを検証
  • 設定・パーミッション・エージェント接続の詳細はドキュメント参照

関連リンク:

統合情報: Claude Code、Codex、Cursor、OpenClaw 等のお使いの環境に応じたインテグレーションをご用意。アーキテクチャノートは

libs/cua-driver/README.md
にあります。


CUA-S1: コンピューター使用のための小型特化モデル

CUA-S1 は、「システム 1」タイプの小型意思決定モデルファミリーです。値入力の有無や要素操作などの、迅速で限定された意思決定に適しています。

特徴と仕組み

  • 研究プロファイル: フォームを対象とし、トークンごとの生成ではなく、構造化されたインターフェース要素から意図スコアリング
  • アクション処理: アプリコードが順序付けを行い、オプションの Cua Driver インテグレーションで明示的な境界を用いて実行。

リソースとライセンス

  • 初期リリースは GitHub でソースコード公開(MIT ライセンス)。
  • モデル重みは Hugging Face に独立してホスト。
  • 各モデル・データセットカードにスコープ、制限事項、アーティファクト固有のライセンスを必ず確認してください。

関連リンク:


Lume: Apple Silicon 上のローカル macOS/Linux VM の管理

Apple Virtualization.Framework を使用し、Apple Silicon でローカル macOS および Linux VMを管理します。

インストール

/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"

最初の成果

  • Apple リストアーからバニラ macOS Tahoe VM を作成・起動
  • SSH 経由での接続
  • Lume CLI を直接操作し、無人設定のデフォルト値を活用

関連リンク:


Cua Bench: コンピューター使用タスクの構築と評価

コンピューター使用タスクを構築し、エージェントを評価・トレーニング用の軌跡をエクスポートします。VM や Docker、API キーが不要なシミュレーションタスクから始められます。

環境準備 (Python 3.12 または 3.13 + uv)

uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium

最初の成果

  • 小さなタスク作成
  • 参照ソリューション実行
  • 評価器が報酬値**「1.0」**を報告することを確認
  • 同じタスクの再試行を試す

関連リンク:


リソース一覧

  • Documentation: ガイド、例、API リファレンス
  • Blog: チュートリアル、更新情報、研究成果
  • Discord: コミュニティサポートと議論
  • GitHub Issues: バグ報告・機能リクエスト
  • Security: プライバシー保護の脆弱性報告

引用 (Citation)

研究で Cua を使用する場合、以下のソフトウェアを引用してください:

@software{cua2025,
  author = {{Cua AI, Inc.}},
  title   = {Cua},
  year    = {2025},
  url     = {https://github.com/trycua/cua},
  license = {MIT}
}

推奨: 再現性のため、実験で使用した Cua リリースまたはコミットを明記してください。

CITATION.cff
ファイルも参照可能です。


コントリビューションとライセンス

**コントリビューション大歓迎。**詳細は「コントリビューションガイドライン」をご覧ください。

ライセンス

  • Cua: MIT ライセンス
  • サードパーティコンポーネント:
    • Kasm (MIT)
    • OmniParser (CC-BY-4.0)
    • cua-agent[omni]
      (AGPL-3.0 ※ultralytics 含む)

商標

Apple、macOS、Ubuntu、Canonical、Microsoft の商標はそれぞれの所有者に登録されています。本プロジェクトはこれらの企業との関係や支援を受けておりません。

同じ日のほかのニュース

一覧に戻る →

2026/09/19 19:46

1 年前に RL を用いた非自己回帰型決定モデルを構築した

## Japanese Translation: 本テキストは、エンタープライズワークフローを悩ませてきた高遅延と幻覚(ハルシネーション)のリスクを排除することを目的として設計された画期的な完全にオープンソースの AI モデル「Laya」を紹介する。標準的な生成型大規模言語モデルがしばしば 500〜2,000 ミリ秒の遅延を経験するのに対し、Laya は単一の GPU で顕著な 32.8 ms の遅延を実現し(バッチ処理された質問の場合には 7.2 ms)、これを達成するためには形式自由なテキスト生成を完全に回避し、代わりに辞書からオプションを選択する「choice」命令、順序付けされた評価基準レベルを割り当てる「score」命令、および真理値論理によって有用でない出力を示す「noul」という 3 つの特定の決定プリミティブのみを通じて構造化データのみを出力することを行っている。この建築学的なシフトは、ルーティングやスパム検出などの重要なタスクに対して瞬時に数学的に校正された確率を確保し、100 言語以上をカバーしている。TypeSafe の「Jev」といったプロプライエタリ競合製品に優越するように開発された Laya は、企業がローカルで展開することを可能にし、API 手数料と運用コストを大幅に削減する。将来的な改良により、現在のトークン予算の制限を超えたより大きなオプションセットを処理することが予想され、英語専用モデルに見られる一般的な失敗がないグローバルかつマルチスキーマの意思決定のための堅牢なソリューションとなるだろう。

2026/09/19 18:20

生成 AI で作られたポスターがひどいものに終わる必要はありません。

## Japanese Translation: チャットGPT は、AI アートにしばしば関連づけられる反復的・一般的な外見を避け、独自で高品質なポスターデザインを容易に生成できます。初期の要求では標準的なテンプレートが生成される場合もありますが、具体的な指示を与えることで、文脈に応じたテキストオーバーレイ付きのバウハウス幾何学や日本のミニマリズムなど、多様な芸術スタイルを解き放つことができます。以前の批評において「すべての AI 画像は同一である」と主張されていた点とは対照的に、洗練されたプロンプティングは、鑑賞者が直ちに機械生成であると特定しにくい独自性のある視覚コンテンツの作成が可能であることを証明しています。さらに、Claude や Gemini などの他の高度なモデルも、編集可能なテキスト層を含む PDF や HTML ファイルといった実用的に使用可能な形式を出力し、デザイナーが必要なグラフィックアセットを素早く取得する際に実践的な利便性を提供します。これらの成功した結果を他者が再現できるようにするために、著者は様々なポスタースタイルを網羅した 100 の即座に使用できるプロンプトのカタログを編纂しました。このリソースにより、各新しいプロジェクトに対して複雑な手動指示を必要とせずに、多様な視覚コンテンツを迅速に生成できるようになります。結局のところ、効果的なプロンプティングは、AI を退屈なデフォルトの源から、実世界のデザイン基準を満たすプロフェッショナルでユニークなグラフィックを作成する強力なツールへと変革します。

2026/09/20 5:00

インターネット検閲を測定し、最大級のオープンデータセットに貢献しましょう。

## 日本語訳: オニー・プローブは、インターネット検閲に関する世界の最大のオープンデータセットの中核を成すものであり、主に異なる国でどの特定のウェブサイトやアプリがブロックされているかを検証することを目的として設計されています。该软件の核心には、WhatsApp、Facebook Messenger、Telegram などの主要プラットフォームが利用者のネットワーク上でアクセス可能であることを確認するテストが含まれています。さらに重要なのは、M-Lab と共同で作成された標準化された測定方法である NDT テストを活用して、一般インターネットの速度と安定性を評価することです。このツールは Linux および macOS で動作し、個人の利用者がデジタル自由の解決策(例えば回避アプリ)が実際にはローカルの制限に対して機能しているかどうかを検証する能力を付与します。個人の検証を超えて、オニー・プローブ は研究者や組織に、世界の検閲トレンドを追跡するための不可欠なデータを提供します。M-Lab と協力することで、オープンソースコミュニティ全体で一貫性のある信頼できるパフォーマンス指標が確保されています。

秀 HN:CUA-S1 — コンピューター利用のためのシステムワンモデル | そっか~ニュース