サハラ・アンツ・ラボ:デバイス上で動作するローカルで高速なモデル

2026/09/09 20:39

サハラ・アンツ・ラボ:デバイス上で動作するローカルで高速なモデル

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

元のサマリーは上層レベルの概要として良好ですが、主張を検証する「Key Points List」に記載されている具体的なデータ駆動型の証拠を欠いています。「345 倍高速」と言及していますが、どのモデルがどのような処理を行うかという文脈を省略しており、競合他社とのエネルギー効率比較や特定の精度統計など、価値提案の中核をなす他の重要なパフォーマンス指標も欠落しています。

以下は、「Key Points List」からの不可欠な欠落した詳細を統合しつつ、明晰さを保持した改良版です:

Improved Summary: Desert Ant Labs は、オーディオ、ビジョン、テキスト用の画期的な無料オンデバイス AI モデルスイートを開始しました。これらはインターネットやログインなしで瞬時に動作し、iPhone や MacBook などのデバイス上で完全にローカルに実行されます。従来のクラウドシステムとは異なり、これらのツールは未使用のローカルハードウェアを活用します。例えば、「Clear」モデルは 9MB の空間のみを使用してラップトップの録音をスタジオ品質に 1 秒で改善し、MacBook Pro (M5) 上ではリアルタイム処理速度が最大 345 倍向上します。音声転写モデル「Voz」は 2 秒で 10 分の音声を転写し、Whisper よりも 4.7 倍高速です。スイートには、「Tongue」という専門ツールが含まれており、これはわずか 2MB で 84 の言語を 93% の精度で識別します。「Clips」は重いクラウド API を置き換えるものであり、10 分の動画を 5 秒に編集すると同時に、エネルギー使用量を 470 倍削減します。この技術は業界での採用がラボ自身のニーズに対して遅すぎた開発の後から生まれたものであり、研究では AI エージェントのタスクの最大 70% はローカルで処理可能であることを示唆しています。今後リリースされるアップデート(iOS 27 に搭載される Detail バージョン 6 など)では、対応可能なデバイスにおいてクラウドへの依存関係を完全に置き換えます。これらのモデルは無料(トークンやログイン不要)であり、グローバルデータセンターへの年間支出が予測される 4500 億ドルに対してスケーラブルな代替手段を提供し、産業を効率的でパーソナライズされた AI 処理へと導きます。

本文

Desert Ant Labs 設立とオンデバイス AI モデル群の発表

欧州に拠点を置く先端的な AI ラボ「Desert Ant Labs」が正式に立ち上げられました。同社は意見を持ったオンデバイス(端末側)でのインテリジェンス構築をビジョンに掲げており、効率的な AI 導入の道筋はオンデバイスから始まると確信しています。

モデル群の概要と特徴

音声、ビジョン、テキストに対応する小型で特化したモデルを開発しました。主な特徴は以下の通りです:

  • 超高速応答:ミリ秒単位のレスポンスタイムを実現。
  • ゼロコスト運用:実行コストがゼロのため、トークン制限や推論速度の限界に縛られません。あらゆる製品とのインタラクションにインテリジェンスを容易に取り込むことができます。
  • 汎用性の高さ:5 年前モデルのスマートフォンでも動作可能であり、1 フレームまたは 1 キーストロークごとに利用可能です。
  • 高パフォーマンス:現在お支払いいただいている API コールよりも優れた性能を発揮します。

ライブリリースされた最初の 18 つのモデル

本日、以下の構成でモデルが公開されました:

  • 安定版:12 モデル
  • ベータ版:6 モデル

これらは、Swift、Kotlin、JavaScript のいずれにも対応する単一の SDKを通じて利用可能です。各タスクは「デバイス内最速実行」を設計目標としており、以下のような具体例があります。

モデル名機能と性能
VoziPhone で 10 分の音声ファイルを2 秒で書き起こし。Whisper に比べて4.7 倍高速です(語の開始・終了時間付与付き)。
Clear容量9MB。5 分間のノートパソコン録音を1 秒でスタジオ品質の音声に変換します。
Redact実時間において、27 言語対応で人名、住所、カード番号などをマスキング。お客様のサーバーへのデータ流出を防ぎます
Tongue容量わずか2MB。3 つの単語から84 ユーザーを識別可能。

言語識別性能比較(Tongue)

  • 精度スコア:0.933
    • 対照実験:293MB の大規模デテクタで 0.887 を記録したが、軽量な Tongue(2MB)の方が高い精度を達成。

📥 詳細確認:その他の 14 モデルの仕様とベンチマークは desertant.com/models および Hugging Face でご確認いただけます。 💡 利用条件:月間アクティブデバイス数10 万回まで無料。トークン課金もログイン也不需要です。

個人情報保護性能(Redact)

  • テキスト内の個人情報検出率:88.8%
    • 対照実験:業界標準 GLiNER-PII ベンチマーク(91.1%)に迫る結果を、容量わずか12MBのモデルで達成。
モデル名機能と性能
Redact (12MB)精度 88.8%(対照 GLiNER-PII: 91.1%)。容量わずか 12MB で高い検出率を実現。

オープンソース戦略と「欧州原則」

このプロジェクトは欧州で展開しており、以下の原則を徹底しています:

  • オンデバイスがデフォルト
  • データ是客户手中を離れることはありません。
  • 他社のクラウド機能に依存せず、アップロードされていないデータについて何者にも強制されることはありません。

これに至るまでの道のり

Detail アプリの開発経験

5 年間、動画アプリ「Detail」を開発し、オンデバイスファーストのアプローチを採用してまいりました。しかし、ショートクリップの自動編集や音声改善等功能を拡張する際、クラウド API に依存せざるを得なくなり、インフラコストが拡大していました。

課題と解決策

  • 現状の問題:Hugging Face などには有用なモデルが存在しましたが、アプリへの実装コードが多く、業界全体の実装スピードに追いつけていませんでした。基盤(チップ、Core ML)は整っておりましたが、「数行のコードでアプリに取り込んでデプロイできる」という中間層が不足しておりました。
  • 自社トレーニング:モデルトレーニングを製品デザインの課題として捉え、自社で行いました。
  • 設計思想:速度、品質、コストにおいてクラウドサービスを超えるよう設計し、サイズの一部のみで他社のローカル・クラウドモデルを上回る性能を実現しました。

具体的な成果(詳細アプリへの統合)

Dolby より優れた高速音声改善や、書き起こしの大幅な高速化を達成しました。

  • Clear: デバイス上でクリップを改善・マスタリング・再エンコードし、3 つの候補から最適な結果を選択。
    • iPhone 上では302 倍の実時間処理を実現(9MB モデル)。
  • Voz: M3 Ultra チップ搭載機器で連続 30 分間においてリアルタイムファクターが30 倍超
    • iPhone 17 Pro では298 倍に達します。
  • Clip: 大容量モデル(284MB)として、Claude Sonnet に代わる役割を担います。
    • 10 分間の動画を 12 クリップへ変換する時間を5 秒に短縮(Sonnet の10 倍高速かつエネルギー消費は470 分の 1)。

Detail 6 との未来

iOS 27 に伴ってリリースされる Detail 6 では、すべてのクラウド API を自社独自のモデルへ置き換え、完全にオンデバイスで動作させる予定です。

コンセプト:「小さな脳」から積み上げるインテリジェンス

業界全体で LLM を単なる API として扱うアプローチが主流ですが、一般主義的な先端的脳(Generalist Frontier Brains)だけが唯一の選択肢ではないことを強調します。

コンプュートコストは既に支払われている

  • 市場規模:今年だけで約4500 億ドルをデータセンターに投入する見込みです。
  • 端末のパワー:世界中の Smartphone、タブレット、ノートパソコンには、能力を増すチップが搭載されています。人間の手元にある計算能力は、地球全体の AI データセンターよりも豊富です。
  • 不公平なアドバンテージ:無料で推論ができるため、すべてのメッセージに対して機能を実行できます。往復遅延(レイテンシ)がなく、データはデバイスを離れることはありません。

製品アーキテクチャの進化計画

  1. 「小脳」層(最初の 100 モデル)
    • 常に動作する仕事(バランス、タイミング、無意識のスキル)を担当。
    • 一日中デバイス上で無料で動作する高速で特化したモデルを構築。
  2. 「皮質」層(後段)
    • 「どのモデルが答えを出すか」を決定する役割。
    • まず小さなローカルモデルを使用し、必要であれば大きなものへ切り替え、最終的にデバイス外に持ち出す必要がある場合のみクラウドを利用。
    • オープンソースの進歩やシリコン技術の向上に伴い、ローカルモデルは成長・トレーニングされ続ける予定です。

クラウドラボとの違い

クラウドラボはトークン単価課金システムにおける中立なモデルを提供しますが、Desert Ant の各モデルは:

  • 弊社の選択したデフォルト設定と、
  • その変更ための**レバー(制御機能)**とともにリリースされます。
  • モデルとランタイムを最適化しており、iPhone 上ではニューラルエンジン上で Clear/Voz が動作し、ブラウザ上では WebAssembly を通じて同等の重みを処理します。

SDK と開発者体験(DX)

すぐに始めたい場合は、以下のネイティブ SDK を利用可能です:

  • 対応言語:Swift、Kotlin、JavaScript
  • 入手先:GitHub
  • ドキュメント:開発者とエージェント向けに執筆済み。Mac で CLI を使い、またはブラウザ上で Hugging Face の環境でも試せます。

クールなものを創作したい方や共同開発をご希望の場合は、ぜひお問い合わせください。

同じ日のほかのニュース

一覧に戻る →

2026/09/10 3:15

iPhone デュオ

## Japanese Translation: アップルは、二画面デザインの画期的な初代折りたたみスマートフォン「iPhone Duo」の発売を予定しています。内蔵ディスプレイが 7.6 インチ、外側ディスプレイが 5.4 インチというこのデュアルディスプレイ構成は、どちらも Super Retina XDR テクノロジー、ProMotion(最大 120Hz)、そして最大 3,000 nits のピーク輝度を備えています。開いた状態での 7.6 インチ画面は iPhone 18 Pro Max よりも 50% も大きく、かつこれまで製造された中最薄の iPhone です。折りたたんだ状態ではポケットに収まるサイズのデバイスとなり、外側ディスプレイは iPhone 18 Pro の画面面積の 90% を超えます。本体フレームとヒンジカバーにはグレード 5 タイタンを使用し、IP68(防水・防塵)対応、また内蔵ディスプレイにノアノテクスチャ仕様にすることで反射を軽減しています。 性能は、高度な A20 Pro チップと二重 16 コアニュラルエンジンにより支えられ、集約的な AI タスクを効率的に管理します。これらのワークロードを処理しバッテリー寿命を延長するために、iPhone 初採用のデュアルバッテリーシステムを採用しており、内側ディスプレイでは最大 31 時間の動画再生、外側ディスプレイでは最大 44 時間の再生が可能です。電源供給オプションには、MagSafe ワイヤレス充電と、約 20 分で 50% までの給電可能な有線充電が含まれます。 カメラシステムは、48MP デュアルフュージョン構成(メインカメラと超広角カメラ)、48MP フュージョン遠望レンズ(最大 2 倍の光学的品質ズーム)、そして 12MPセンターステージ前面カメラを備えています。このハードウェアにより、近しい友人との Duo FaceTime、ハンズフリーでグループ写真を撮影する Smart Take、ライブでの外側ディスプレイによる構図表示のための Duo Preview、子供向けの Kid Cue アニメーションなどの新しいソフトウェア機能が実現します。本デバイスは Apple Intelligence と Siri AI を対応しています。 ストレージオプションには 256GB、512GB、1TB、および 2TB の構成が用意されており、eSIM 専用設計によって容量を最大化しています。2026 年 10 月 23 日に apple.com および一部のキャリアで発売予定であり、同時にはリデザインされた折りたたみデバイスの姿勢に最適化された iOS 27 が導入されます。iPhone Duo は技術ハードウェアの新たな基準を設定し、折りたたみデザインと AI インテグレーションを進化させながら、利用者に前例のないワークフローの柔軟性を提供します。

2026/09/09 22:27

Shopify が Tailwind を買収

## Japanese Translation: Shopify は、安定した長期的な据え場所を提供し、主要な商用エコシステム内でのアクティブなメンテナンスを確保することを目的として Tailwind CSS を買収します。この動きにより、両社のミッションが統合され、Tailwind の核心となる強みである「美しいインターフェースを簡素化する」ことと、Shopify の「エージェント型コマース」のビジョンが一致します。週間に 1 億 1000 万回以上のインストール数を持つ Tailwind は、ChatGPT、X、Cloudflare、Reddit、そして Shopify そのものを含む大手企業によって採用されており、すでに Shopify 自身の技術スタックの一部として不可欠な役割を果たしています。買収により、Tailwind 周辺の商用成長は停止し、新規顧客の登録も一時中断されますが、すべての既存ライセンス(Tailwind Plus および ui.sh 含まれる)は引き続き完全サポートされます。特に重要なのは、Tailwind が MIT ライセンスを維持し、開発者の自由を守りつつ、チームが Shopify のサポートの下でコミュニティプロジェクトを主導し続けることです。このパートナーシップにより、Tailwind は Shopify スタックの中核となるコンポーネントとしての将来性が確保され、9 年間のイノベーションに基づき信頼が強化されます。

2026/09/09 3:11

Visa とマスタカードは何をするか? カードネットワークの入門

## Japanese Translation: Visa および Mastercard は、従来の銀行ではなく、安全で両当事者を繋ぐカードネットワークとして機能します。これらはカードを発行することも、製造することも、POS ハードウェアを取り扱うことも、商取引業者(マERCHANT)のオンボーディングを管理することもしません。両者は通信手段を通じて発行者とマERCHANT を接続しており、認証(ルーティングのリクエスト/レスポンス)および清算(最終額面の提出)を行います。カード番号は IP アドレスのように利用されます。日常の決済処理を管理するため、Visa は 1,120 億ドルの流動性を保有しており、2024 年度における最大の daily 決済曝露額は 1,374 億ドルです。 収益は、地域によって異なる手数料分割から得られ、安全な支出や望ましい行動を促進することを目的としています。典型的なアメリカでの取引では、マERCHANT が約 2.5%(MDR)、プロセッサが約 0.35%、発行者銀行が約 2%(インターチェンジ)、Visa が約 0.15%(ネットワークアセスメント)をそれぞれ受取ります。欧州連合では、インターチェンジ手数料は 0.3%に上限が設けられており、これはアメリカモデルと比較して消費者の支払習慣を代替決済手段へと転換させる影響を与えています。 セキュリティは運営の中心です:バージニア州アッシュバーンにある Visa の旗艦オペレーションセンター・イーストでは、地震や時速 270 キロメートル(170 マイル)の風などの災害に耐えるために強化されたデータセンターを使用しており、時速 80 キロメートル(50 マイル)の車両を停止できる水力式bollard が備わっています。ガバナンスは、ブランドの使用、データ要件、紛争手続きを含む包括的な規則書を通じて強制され、違反には月間あたり 25,000 ドルから 100 万ドルまでの罰金が科される場合があります。紛争は 600 ドルの審査料(上訴では 1,000 ドル)がかかる強制仲裁によって解決され、当事者が合意しない場合、Visa は署名やセキュリティ映像などの証拠を頼りに介入します。世界的には、ネットワークは国際的な決済におけるアダプターとして機能し、銀行システム間で資金のルーティングを行い通貨変換を取り扱いながら、重大なペナルティを避けるために厳格な遵守が求められます。

サハラ・アンツ・ラボ:デバイス上で動作するローカルで高速なモデル | そっか~ニュース