
2026/09/09 20:39
サハラ・アンツ・ラボ:デバイス上で動作するローカルで高速なモデル
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
元のサマリーは上層レベルの概要として良好ですが、主張を検証する「Key Points List」に記載されている具体的なデータ駆動型の証拠を欠いています。「345 倍高速」と言及していますが、どのモデルがどのような処理を行うかという文脈を省略しており、競合他社とのエネルギー効率比較や特定の精度統計など、価値提案の中核をなす他の重要なパフォーマンス指標も欠落しています。
以下は、「Key Points List」からの不可欠な欠落した詳細を統合しつつ、明晰さを保持した改良版です:
Improved Summary: Desert Ant Labs は、オーディオ、ビジョン、テキスト用の画期的な無料オンデバイス AI モデルスイートを開始しました。これらはインターネットやログインなしで瞬時に動作し、iPhone や MacBook などのデバイス上で完全にローカルに実行されます。従来のクラウドシステムとは異なり、これらのツールは未使用のローカルハードウェアを活用します。例えば、「Clear」モデルは 9MB の空間のみを使用してラップトップの録音をスタジオ品質に 1 秒で改善し、MacBook Pro (M5) 上ではリアルタイム処理速度が最大 345 倍向上します。音声転写モデル「Voz」は 2 秒で 10 分の音声を転写し、Whisper よりも 4.7 倍高速です。スイートには、「Tongue」という専門ツールが含まれており、これはわずか 2MB で 84 の言語を 93% の精度で識別します。「Clips」は重いクラウド API を置き換えるものであり、10 分の動画を 5 秒に編集すると同時に、エネルギー使用量を 470 倍削減します。この技術は業界での採用がラボ自身のニーズに対して遅すぎた開発の後から生まれたものであり、研究では AI エージェントのタスクの最大 70% はローカルで処理可能であることを示唆しています。今後リリースされるアップデート(iOS 27 に搭載される Detail バージョン 6 など)では、対応可能なデバイスにおいてクラウドへの依存関係を完全に置き換えます。これらのモデルは無料(トークンやログイン不要)であり、グローバルデータセンターへの年間支出が予測される 4500 億ドルに対してスケーラブルな代替手段を提供し、産業を効率的でパーソナライズされた AI 処理へと導きます。
本文
Desert Ant Labs 設立とオンデバイス AI モデル群の発表
欧州に拠点を置く先端的な AI ラボ「Desert Ant Labs」が正式に立ち上げられました。同社は意見を持ったオンデバイス(端末側)でのインテリジェンス構築をビジョンに掲げており、効率的な AI 導入の道筋はオンデバイスから始まると確信しています。
モデル群の概要と特徴
音声、ビジョン、テキストに対応する小型で特化したモデルを開発しました。主な特徴は以下の通りです:
- 超高速応答:ミリ秒単位のレスポンスタイムを実現。
- ゼロコスト運用:実行コストがゼロのため、トークン制限や推論速度の限界に縛られません。あらゆる製品とのインタラクションにインテリジェンスを容易に取り込むことができます。
- 汎用性の高さ:5 年前モデルのスマートフォンでも動作可能であり、1 フレームまたは 1 キーストロークごとに利用可能です。
- 高パフォーマンス:現在お支払いいただいている API コールよりも優れた性能を発揮します。
ライブリリースされた最初の 18 つのモデル
本日、以下の構成でモデルが公開されました:
- 安定版:12 モデル
- ベータ版:6 モデル
これらは、Swift、Kotlin、JavaScript のいずれにも対応する単一の SDKを通じて利用可能です。各タスクは「デバイス内最速実行」を設計目標としており、以下のような具体例があります。
| モデル名 | 機能と性能 |
|---|---|
| Voz | iPhone で 10 分の音声ファイルを2 秒で書き起こし。Whisper に比べて4.7 倍高速です(語の開始・終了時間付与付き)。 |
| Clear | 容量9MB。5 分間のノートパソコン録音を1 秒でスタジオ品質の音声に変換します。 |
| Redact | 実時間において、27 言語対応で人名、住所、カード番号などをマスキング。お客様のサーバーへのデータ流出を防ぎます。 |
| Tongue | 容量わずか2MB。3 つの単語から84 ユーザーを識別可能。 |
言語識別性能比較(Tongue)
- 精度スコア:0.933
- 対照実験:293MB の大規模デテクタで 0.887 を記録したが、軽量な Tongue(2MB)の方が高い精度を達成。
📥 詳細確認:その他の 14 モデルの仕様とベンチマークは desertant.com/models および Hugging Face でご確認いただけます。 💡 利用条件:月間アクティブデバイス数10 万回まで無料。トークン課金もログイン也不需要です。
個人情報保護性能(Redact)
- テキスト内の個人情報検出率:88.8%
- 対照実験:業界標準 GLiNER-PII ベンチマーク(91.1%)に迫る結果を、容量わずか12MBのモデルで達成。
| モデル名 | 機能と性能 |
|---|---|
| Redact (12MB) | 精度 88.8%(対照 GLiNER-PII: 91.1%)。容量わずか 12MB で高い検出率を実現。 |
オープンソース戦略と「欧州原則」
このプロジェクトは欧州で展開しており、以下の原則を徹底しています:
- オンデバイスがデフォルト
- データ是客户手中を離れることはありません。
- 他社のクラウド機能に依存せず、アップロードされていないデータについて何者にも強制されることはありません。
これに至るまでの道のり
Detail アプリの開発経験
5 年間、動画アプリ「Detail」を開発し、オンデバイスファーストのアプローチを採用してまいりました。しかし、ショートクリップの自動編集や音声改善等功能を拡張する際、クラウド API に依存せざるを得なくなり、インフラコストが拡大していました。
課題と解決策
- 現状の問題:Hugging Face などには有用なモデルが存在しましたが、アプリへの実装コードが多く、業界全体の実装スピードに追いつけていませんでした。基盤(チップ、Core ML)は整っておりましたが、「数行のコードでアプリに取り込んでデプロイできる」という中間層が不足しておりました。
- 自社トレーニング:モデルトレーニングを製品デザインの課題として捉え、自社で行いました。
- 設計思想:速度、品質、コストにおいてクラウドサービスを超えるよう設計し、サイズの一部のみで他社のローカル・クラウドモデルを上回る性能を実現しました。
具体的な成果(詳細アプリへの統合)
Dolby より優れた高速音声改善や、書き起こしの大幅な高速化を達成しました。
- Clear: デバイス上でクリップを改善・マスタリング・再エンコードし、3 つの候補から最適な結果を選択。
- iPhone 上では302 倍の実時間処理を実現(9MB モデル)。
- Voz: M3 Ultra チップ搭載機器で連続 30 分間においてリアルタイムファクターが30 倍超。
- iPhone 17 Pro では298 倍に達します。
- Clip: 大容量モデル(284MB)として、Claude Sonnet に代わる役割を担います。
- 10 分間の動画を 12 クリップへ変換する時間を5 秒に短縮(Sonnet の10 倍高速かつエネルギー消費は470 分の 1)。
Detail 6 との未来
iOS 27 に伴ってリリースされる Detail 6 では、すべてのクラウド API を自社独自のモデルへ置き換え、完全にオンデバイスで動作させる予定です。
コンセプト:「小さな脳」から積み上げるインテリジェンス
業界全体で LLM を単なる API として扱うアプローチが主流ですが、一般主義的な先端的脳(Generalist Frontier Brains)だけが唯一の選択肢ではないことを強調します。
コンプュートコストは既に支払われている
- 市場規模:今年だけで約4500 億ドルをデータセンターに投入する見込みです。
- 端末のパワー:世界中の Smartphone、タブレット、ノートパソコンには、能力を増すチップが搭載されています。人間の手元にある計算能力は、地球全体の AI データセンターよりも豊富です。
- 不公平なアドバンテージ:無料で推論ができるため、すべてのメッセージに対して機能を実行できます。往復遅延(レイテンシ)がなく、データはデバイスを離れることはありません。
製品アーキテクチャの進化計画
- 「小脳」層(最初の 100 モデル):
- 常に動作する仕事(バランス、タイミング、無意識のスキル)を担当。
- 一日中デバイス上で無料で動作する高速で特化したモデルを構築。
- 「皮質」層(後段):
- 「どのモデルが答えを出すか」を決定する役割。
- まず小さなローカルモデルを使用し、必要であれば大きなものへ切り替え、最終的にデバイス外に持ち出す必要がある場合のみクラウドを利用。
- オープンソースの進歩やシリコン技術の向上に伴い、ローカルモデルは成長・トレーニングされ続ける予定です。
クラウドラボとの違い
クラウドラボはトークン単価課金システムにおける中立なモデルを提供しますが、Desert Ant の各モデルは:
- 弊社の選択したデフォルト設定と、
- その変更ための**レバー(制御機能)**とともにリリースされます。
- モデルとランタイムを最適化しており、iPhone 上ではニューラルエンジン上で Clear/Voz が動作し、ブラウザ上では WebAssembly を通じて同等の重みを処理します。
SDK と開発者体験(DX)
すぐに始めたい場合は、以下のネイティブ SDK を利用可能です:
- 対応言語:Swift、Kotlin、JavaScript
- 入手先:GitHub
- ドキュメント:開発者とエージェント向けに執筆済み。Mac で CLI を使い、またはブラウザ上で Hugging Face の環境でも試せます。
クールなものを創作したい方や共同開発をご希望の場合は、ぜひお問い合わせください。