Show HN: ローカルテキスト、画像、動画、音楽、3Dデータを一つのCLIから取得し、Pythonを使わずに。

2026/07/30 22:25

Show HN: ローカルテキスト、画像、動画、音楽、3Dデータを一つのCLIから取得し、Pythonを使わずに。

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

mere.run は、Apple Silicon搭載のMac(macOS 15以降)およびLinuxシステム(x86_64/arm64)向けに設計されたローカルファースト推論ランタイムであり、画像、テキスト、音声、ビデオ、3D、ワールド、トレーニング、API サービングなど多様なメディア生成タスクを、外部のクラウドサーバーへの依存なしにローカルハードウェア上で直接実行することを可能にします。プラットフォームは、コア操作(モデルのプル

mere.run model pull
や画像生成
mere.run image generate
など)のための統一されたコマンドラインインターフェース(CLI)を提供し、これに加えて、CLI、モデルストア、実行履歴を共有するオプションのマック用SwiftUIスタジオアプリが用意されています。ユーザーは、Klein、ZImage、HiDream O1、Ideogram 4、Qwen3、Wan 2.2 など最新の最先端モデルの広範なラインアップにアクセスできます。

インストール方法はOSにより異なります:macOSユーザーは、アプリバンドルとCLIを含む署名済みのDMGを通じてインストールし、Linuxユーザーは、Swift 6.x、clang、CUDAヘッダー(arm64アクセラレーション用)などの依存関係を必要とするヘッドレスなtarballや.debパッケージを利用します。システムは、生産自動化、VFX、GPUトレーニング向けのプラグインエコシステム(例:

mere-vfx-tools
)をサポートしています。セキュリティは、リスクのあるモードへの明示的なオプトイン制御を通じて最優先されます。API サービングのデフォルトはループバックのみへのアクセスであり、外部へエクスポートする場合は認証キーを必要とします。また、ツールの実行は明示的に自動承認される場合を除き、インタラクティブな承認を必須としています。プラットフォームはさらに、ホストされたバックエンドなしで分散ノード間でワークロードを仲介する
mere.world
アカウントシステムによってユーザーに権限を与え、コード、VLM、ツールコールを含む多様なタスクにおけるパフォーマンスベンチマークを提供し、Hugging Faceモデルに対する堅牢なローカルキャッシュ管理を実現します。

本文

mere.run ドキュメント

イントロダクション

mere.run は、Apple Silicon およびヘッドレス Linux 向けのローカルファースト推論ランタイムです。

単一の公開 CLI が以下の機能をカバーします:

  • 画像・テキスト・音声・ビジョン・音楽・サウンド・動画・3D・ワールド・学習・API サービング
  • オプションの macOS Studio(Studio は 별도의バックエンドを使用せず、同じ CLI とモデルストアを利用)

M4 Max における主な機能

  • チャット
  • 画像生成とグラウンディング(文脈理解)
  • 画像から 3D データへの変換
  • SFX(効果音)および音楽
  • 音声の双方向処理(合成・認識)
  • 動画処理
  • API サービング
  • タイプされたワークフローグラフ
  • すべてローカルで実行。

インストール手順

  1. mere.run/downloads
    から署名済みリリースをインストールしてください。

  2. 大型モデル取得前に、マシン検証を実行します:

    mere.run setup
    mere.run model capabilities --recommended
    mere.run guide --list
    

クイックスタート:画像生成

mere.run model pull image-zimage-nano
mere.run image generate \
  --model image-zimage-nano \
  --prompt "柔らかい朝の光の中のセラミックマグカップ" \
  --output ./mug.png

ドキュメントとヘルプ

  • オフラインレシピブック:
    mere.run guide <コマンドパス>
  • コマンドヘルプ:
    mere.run <グループ> --help

今日動作する機能

カテゴリ公開コマンド例サポートされているモデル・機能
画像と LoRA
image generate
,
image train-lora
Klein, ZImage, HiDream O1, Krea 2, Ideogram 4 など。ローカル学習、チェックサム固定公開アダプター。
テキスト・コード・エージェント
text chat
,
agent
Bonsai 27B、ツール使用、コード生成、埋め込みベクトル、PII 削除、ローカルエージェント。
ビジョン理解
vision caption
,
segment
,
track
キャプション作成、VQA、顔検出(LightOn/GLM/Infinity OCR)、SAM 3.1 セグメント、ランドマーク。
深さ・幾何学・3D
depth-video
,
geometry-multiview
Video Depth Anything, TripoSR, InstantMesh など。EXR、カメラ、ポイントクラウド生成。
動画とワールド
video generate
,
world serve
LTX ビデオ、Wan 2.2 TI2V、Cosmos3-Edge、SCAIL-2 アニメーション、DreamX ワールド。
音楽とサウンド
music generate
,
sfx generate
ACE-Step、Magenta RT2、MuScriptor MIDI 転記、MMAudio テキスト/動画条件付サウンド。
音声
speech synthesize
,
transcribe
Qwen3 TTS、Qwen3 ライブ ASR、Parakeet 転記、MLX Sortformer スピーカダイアライゼーション。
サービングと運用
api serve
,
model runtime
OpenAI 互換チャット/埋め込み/TTS/STT、レジデントモデルプーリング、TTL/ピンニング機能。
自動化
--preflight --json
,
image run-plan
タイプ化プリフライト、機械可読な進捗、再生可能な計画、チェックサム検証。
ポータブルワークフロー
graph catalog
,
executor
不変なタイプ付きグラフ、コンテンツアドレス可能なバンドル、SSH/リレー経由実行。

注: モデルの利用可能性やライセンスはコマンドによって異なります。大規模モデル使用前に

mere.run model capabilities
を確認してください。


リレーとノード

コアランタイムはローカルに留まりますが、ネットワーク経由での拡張が可能です。

リレー

  • 複数の Mac および Linux ホストを管理。
  • 別個の
    mere.run node
    デスクトップアプリでモデルと可用性を発表。
  • 対応 OS: macOS, Linux x86_64, Linux arm64。

プラグイン

公式プラグインは以下のための伴侶実行ファイルです:

  • VFX(視覚効果)
  • リアルタイムパフォーマンス
  • 制作上のトラッキング
  • オートメーション
  • ユーザー所有の GPU 学習

ソースリポジトリ:


リポジトリ構成

ディレクトリ説明
Sources/MereRunCore
モデル解決、マニフェスト、生成プリミティブ、MLX 推論コード。
Sources/Audio*
オーディオ生成と転記サポート。
Sources/MereRunCLI
公開
mere.run
CLI のビルドターゲット。
Sources/MereRunApp
macOS Studio アプリ (
MereRun.app
)。
vendor/llama.xcframework
Vendored llama.cpp ランタイム。
THIRD_PARTY_NOTICES.md
サードパーティ製アーツのライセンスとソース示すこと。

最新リリースをインストールする (macOS)

curl -L https://mere.run/releases/mere-run.dmg -o mere-run.dmg
open mere-run.dmg
  • Studio:
    MereRun.app
    を Applications フォルダにコピー。
  • CLI 設定: アプリ内の設定からターミナルコマンドをインストール。

ターミナル専用インストール (DMG 内):

cd /Volumes/mere.run/.mere-run
./install.sh

インストーラーは

/usr/local/bin/mere.run
にコピーされます (
sudo
は必要な場合のみ使用)。


Linux パッケージビルド

ヘッドレス CLI 専用(macOS Studio は不可)。

ビルド要件

  • Swift ツールチェーン 6.x
  • ffmpeg
    ,
    ffprobe
    , CUDA (オプション) など。

CUDA リリースパッケージビルド (x86_64):

MERERUN_LINUX_ACCEL=cuda \
  MERERUN_SKIP_MLX_CUDA_EXAMPLE=1 \
  scripts/package-linux.sh --version 0.23.0 --artifact-suffix cuda

重要: Linux リリースはヘッドレス CUDA CLI ターボと

.deb
のみ。CPU 専用アーツは公開されません。


ソースからビルドする (macOS)

依存関係のインストール

brew install swiftlint ripgrep node pnpm gitleaks

ビルドコマンド

swift build
swift test
swift run mere.run --help
app_path="$(./scripts/build_mere_run_app.sh debug)"
open "$app_path"

クイックスタートコマンド

モデル管理

  • 利用可能な機能の確認:
    swift run mere.run model capabilities
  • HuggingFace モデルプル:
    swift run mere.run model pull <model-id>
  • ローカルモデルリスト:
    swift run mere.run model list

チャットと推論

# ランタイム設定 (Gemma4 12B)
swift run mere.run model runtime set text-chat-gemma4-12b-4bit \
  --alias chat-default --pinned --ttl-seconds 3600

# チャット実行 (Bonsai 27B)
swift run mere.run text chat \
  --model text-chat-bonsai-27b-1bit \
  --prompt "ローカル推論のための統一記憶を説明せよ。"

# API サービング (OpenAI 互換)
swift run mere.run api serve --engine text-chat-gemma4

画像生成ワークフロー

  • ZImage Nano:
    mere.run image generate
  • HiDream O1: テキスト・編集・多参照対応 (
    --ref-image
    )
  • Krea 2 Turbo: 8 ステップで高速生成。
  • LoRA トレーニング:
    image train-lora
    でスタイル学習。

ビジョンと動画

  • セグメンテーション (SAM 3.1):
    mere.run vision segment ./image.png --prompt "人"
  • オブジェクトトラッキング:
    mere.run vision track ./clip.mp4 --prompt "人"
  • 音声付きビデオ (LTX 2.3):
    video generate
    (
    --output-mode audio-video
    )

API と埋め込み

# 埋め込み生成
curl http://127.0.0.1:8080/v1/embeddings \
  -H "Content-Type: application/json" \
  --data '{"model":"text-embed-qwen3-0.6b","input":"mere.run"}'

# 音声生成 (TTS)
curl http://127.0.0.1:8080/v1/audio/speech \
  -H "Content-Type: application/json" \
  --output speech.wav \
  --data '{"model":"speech-tts-qwen3-nano","input":"Hello"}'

ベンチマークと評価

  • KV キャッシュベンチマーク:
    swift run mere.run model benchmark gemma4-kv
  • コーディングエージェント評価:
    swift run mere.run model benchmark code

コマンドツリー

公開 CLI の主要モジュール:

  • mere.run guide
    : オフラインレシピブック。
  • mere.run image
    : {generate, train-lora, visualize-run} など。
  • mere.run text
    : {chat, code, embed, anonymize}。
  • mere.run vision
    : {caption, segment, track, pose, ocr}。
  • mere.run video
    : {generate, animate, cosmos3}。
  • mere.run music
    : {generate, analyze, realtime}。
  • mere.run sfx
    : {generate, ae encode/decode}。
  • mere.run model
    : {list, pull, delete, benchmark, repair-manifests}。
  • mere.run api serve
    : OpenAI 互換 API サーバー起動。
  • mere.run open-webui quickstart
    : オープンウェブ UI のセットアップ。

Studio:

mere.run.app
はこれらのコマンドをビジュアルインターフェースで利用可能にします。


モデルストアとキャッシュ管理

デフォルトパス:

~/Library/Application Support/MereRun/models

キャッシュ上書き

export MERERUN_MODELS_DIR=/path/to/models
swift run mere.run --models-root /path/to/models model list

HuggingFace キャッシュの共有:

~/.cache/huggingface/hub
ではなく
mere.run-local
を使用します。共有キャッシュを使用する場合は:

export MERERUN_HUB_CACHE=~/.cache/huggingface/hub

ストレージ管理

  • ストレージ確認:
    mere.run model storage
  • 不要なモデルの削除:
    mere.run model remove <id>         # 安全に削除
    mere.run model gc --force          # フォースGC (ロック必要)
    

セキュリティデフォルト

公開 OSS ビルドは「ローカルファースト」を原則として、リスクの高いモードは明示的オプトインが必要です。

  • プリフライトチェック: サーバー起動前に
    --preflight
    でポート/認証/モデルを確認可能。
  • 非ループバック API:
    --api-key
    または環境変数が必要。
  • ツール実行: 自動承認 (
    --auto-approve-tools
    ) はデフォルト非有効。
  • シェル実行:
    shell_exec
    は明示的許可 (
    --allow-shell-exec
    ) 必須。

意図的に弱体化させるフラグ (使用に注意):

  • --allow-shell-exec
  • --allow-absolute-tool-paths
  • --auto-approve-tools
  • 非ループバック API サービング (
    --host 0.0.0.0
    )

検証とドキュメント

スモークラン (Smoke Test)

MERERUN_RUN_E2E=core ./scripts/check.sh
MERERUN_RUN_E2E=installed ./scripts/check.sh

主要ドキュメントリンク

  • 公開ドキュメント:
    docs.mere.run
  • Linux クイックスタート:
    docs/linux-quickstart.md
  • フル CLI ガイド:
    docs/cli.md
  • アーキテクチャ:
    docs/architecture.md
  • サードパーティライセンシング:
    THIRD_PARTY_NOTICES.md

リポジトリ構造概略

mere-run/
  Package.swift
  Sources/MereRunCore
  Tests/
  docs/
  vendor/

アクロウレジメント

mere.run は、Python MLX コミュニティ(Apple Silicon 向けのローカルファースト推論)の成果を Swift ランタイムおよび CLI として移植したものです。

主要な影響を受けたプロジェクト:

  • ml-explore/mlx-lm: 言語モデル推論の参照。
  • Blaizzy/mlx-vlm: ビジョン・ランゲージモデル(キャプション、OCR)への影響。
  • Blaizzy/mlx-audio: TTS/STTおよびオーディオコーデックの形作り。
  • filipstrand/mflux: 画像生成とデノイジングスケジュールへの影響。

帰属とライセンス詳細については

THIRD_PARTY_NOTICES.md
を参照してください。

同じ日のほかのニュース

一覧に戻る →

2026/07/31 2:04

この TV ストックを買う前に読んでください

## Japanese Translation: Bitsight のセキュリティ研究者ペドロ・ファレ(Pedro Falé)が、汎用的な H96 ストリーミングデバイスが秘密裏に自身を携帯電話(サムスン、ビボ、華為(Huawei)、シャオミなど)として偽装し、中国の Fengwo グループ(浙江省 Fengwo IoT Technology Ltd.)が運営する AI 生成ウェブサイト上で広告をクリックさせることを暴露しました。同グループは、これらのデバイスを広告不正のための captive traffic ソースとし、またテレビに接続した際に IP アドレスを貸し出す住宅プロキシとして利用しています。Bitsight は、かつてテレメトリ用に使用された無効化ドメインを経由して「ホームへ電話」している約 38,000 台のそのようなユニットを追跡しました。影響を受けたすべての H96 デバイスには、Fengwo の名称で登録された特許を通じて特定されるように、同グループによってインストールされた 2 つのプロプライエタリなアプリが存在し、低スキルオペレーターが偽装サイトを作成し不正実行ルーチンを動作させることを可能にする簡易的な視覚的プログラミングツール(Google Blockly ベースの実装)を採用しています。ネットワークの AI 生成コンテンツは金融、医療、教育、ゲーム、音楽、食品などのカテゴリにわたっていますが、広告はそのトラフィックが偽装されたモバイルプロファイルから来ている場合에만提供されます。単一の古いドメインからのテレメトリだけでも、この操業は毎日約 50,000 ドルを発生させており、ファレはそれが代金を含めて考慮されていないため控えめであることを警告しました。また、消費者向け IoT における不正プロキシソフトウェアやボットネットについて FBI が警告しているにもかかわらず、Amazon、ベストバイ、Newegg などの主要小売業者は依然として、これら不安全で無印の Android ボックスを販売し続けています。Google は購入者に Play Protect 認証の確認を推奨しており、Synthient は事前にプロキシソフトウェアがプリインストールされた既知の悪意のある IoT デバイスのリストを維持しています。記載されたメールアドレスへの Fengwo グループとの連絡尝试は、受信トレイ容量不足や配信問題のために失敗しました。

2026/07/31 1:26

GitHub に Stacked PR が実装されました

## Japanese Translation: GitHub は、「Stacked Pull Requests」という新機能を導入し、大規模な変更をレビューとマージのために小さな順序付きのレイヤーに分割します。チームは各レイヤーを個別にレビュー・検証でき、個別にマージするか、1 回のクリックですべて準備が整ったレイヤーをまとめてマージできます。このアプローチは、集中したレビューを通じて高いコード品質を維持しつつ、大規模な更新を並列で効率的に進めるように設計されています。既存のブランチ保護設定とシームレスに連携し、GitHub ウェブインターフェース、CLI、モバイルアプリ、Copilot などの AI コーディングエージェント(`gh-stack` スキルを通じて)全体で使用可能です。ユーザーは CLI 拡張機能(`gh extension install github/gh-stack`)をインストールすることで、スタックの作成を 1 分未満で開始できます。現在はすべてのリポジトリで公開プレビュー中であり、自動化されたマージキューへの追加サポートは今後数週間で展開されます。

2026/07/31 0:15

Gemini ロボティクス 2 でロボットに全身知能をもたらす

## Japanese Translation: Google Robotics から、ロボットを複雑な物理的作業と安全な人間の相互作用に適応可能なアシスタントに変容させる画期的な知性層「Gemini Robotics 2」が発表されました。このスイートには、3 つの新しいモデルが含まれています。**Gemini Robotics VLA**は、足先から指先までの完全なヒューマノイドの全身制御を可能にし、**Gemini Robotics ER 2**は身体に埋め込まれた推論を伴う長期的かつ多段階のタスクに対応し、**Gemini Robotics On-Device 2**は最小限のデータを用いて新たな動きを習得でき、Dexmate や SO101 など未慣れなハードウェアにも即座に適応します。システムは、繊細な作業に対応できる特製の 5 本指ハンド(SharpaWave)による高度な巧緻性を示すとともに、複雑な操作には標準の 2 本指グリップサーとも対応しています。多ロボット協調が主要な特徴であり、異なるタイプのロボット同士が通信して単一のユニットでは解決できないワークフローを完了させることができます。安全性は ASIMOV-Agentic など高度なベンチマークを通じて厳格に検証され、安全な近接応答と不安全なツールの呼び出しに対する拒否能力が確保されています。現在、Google AI Studio を通じて早期アクセスパートナーおよびエンタープライズユーザーに利用可能です。これらの革新により、多様な環境において広範な再学習なしに効率的な多ロボットワークフローを実現できます。 ## Text to translate: Google Robotics introduces Gemini Robotics 2, a groundbreaking intelligence layer that transforms robots into adaptable assistants capable of complex physical tasks and safe human interaction. The suite includes three new models: **Gemini Robotics VLA** for whole-body control of full humanoids (feet to fingertips), **Gemini Robotics ER 2** for long, multi-step tasks involving embodied reasoning, and **Gemini Robotics On-Device 2** which allows robots to master new movements using minimal data, adapting instantly to unfamiliar hardware like the Dexmate or SO101. The system demonstrates advanced dexterity through specialized five-fingered hands (SharpaWave) capable of delicate tasks, while also supporting standard two-fingered grippers for complex manipulation. Multi-robot collaboration is a key feature, enabling different robot types to communicate and complete workflows that a single unit cannot solve alone. Safety is rigorously validated via advanced benchmarks like ASIMOV-Agentic, ensuring secure proximity responses and the ability to refuse unsafe tool calls. Currently available to early-access partners and enterprise users via Google AI Studio, these innovations enable efficient multi-robot workflows across diverse environments without extensive retraining.