500kb以下のサイズで実装可能な音声認識とTTS

2026/07/15 4:25

500kb以下のサイズで実装可能な音声認識とTTS

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

最も重要な教訓は、Moonshine Micro が極めて低コストのハードウェア、具体的には 80 セントの Raspberry Pi RP2350 マイコン上で高度な音声機能を実現することを通じて、先進的な AI を民主化することにあります。このオープンソース・ツールキットは、音声認識やニューラルテキスト読み上げといった洗練されたタスクが最小限のリソースで効率的に動作することを証明しており、SRAM は約 470 KB(468 KiB)、フラッシュメモリは約 3.6 MiB を使用し、全体としての分類から発声までのエンドツーエンドのサイクルを約 0.7〜1.0 セコンドという迅速な速度で達成しています。TensorFlow Lite Micro ライブラリを活用することで、システムは VAD(音声活動検出)、STT(音声認識)、カスタム単語認識、ニューラルテキスト読み上げ、ネットワーク対応エージェント向けの WiFi 設定といった主要機能をサポートしながら、計算要件をコンポーネントごとに分解しており、それぞれ VAD で約 0.8 MMAC/frame、STT で約 36 MMAC/s、TTS で最大 65 MMAC/s の性能を発揮します。すべてのコアコードとモデル(SpellingCNN および TinyVadCNN を含む)は、制限的な知的財産の障壁なく商用展開を可能にする寛容な MIT ライセンスの下で公開されています。現在の実施可能な機能を超えて、このプラットフォームは IoT プロジェクトへの参入障rier を大幅に低下させる標準化されたベンチマーク点として機能し、安価かつオープンソースの AI ソリューションの業界全体での採用を促進します。

本文

Moonshine Micro: マイコン向けの音声インターフェース

Moonshine Voice は、リアルタイム音声エージェントおよびアプリケーション開発者を対象としたオープンソース AI ツールキットです。

Moonshine Micro(マイクロ版)は、マイクロコントローラーや DSP などの組み込みシステム向けに特別設計されたバージョンです。

  • 参考プラットフォーム: 単価約 80 ドルで販売される Raspberry Pi RP2350 を採用。
  • 主要機能:
    • 音声活動検出(VAD)
    • コマンド認識
    • ニューラルネットワークに基づく音声合成(TTS)
  • 省メモリ動作: 必要な RAM が約 470 キロバイト程度で動作可能。

メモリおよび演算最適化の詳細

リソース制約のあるシステムでも動作できるように、メモリと演算負荷が最適化されています。以下は RP2350 ベースのデモ環境における詳細なメモリ配分(メモリ予算)です。

コンポーネントフラッシュメモリSRAM(アレーナ最大使用量)演算能力(Compute)
VAD(音声活動検出)~89 KB~36 KB~0.8 億 MAC/フレーム(約 25 億操/秒)
STT(SpellingCNN による音声認識)~1.3 MB~346 KB~36 億 MAC/s
TTS(Neural TTS @ 16 kHz)~1.8 MB(音声パック込み)~340 KB通常:~37 億 MAC/s
最大出力時:~65 億 MAC/s
合計(デモパイプライン)~3.6 MB~468 KB(確保済み)*分類 + 合成で所要時間 ~0.7〜1.0 秒

注釈:

  • フラッシュメモリ容量:
    .arm-none-eabi-size
    コマンドで測定した
    .text
    および
    .rodata
    の合計です(デフォルトの
    moonshine_micro_echo
    ファームウェア、埋め込み型ニューラル音声パックを含む)。
  • SRAM:
    .bss
    セクション、ヒープ、スタック領域の合計です。
  • 共有アレーナ: VAD、STT、TTS は順次処理され、それぞれが約 384 KB の共通 TFLM(TensorFlow Lite Micro)アレーナを時間分割して共有するため、SRAM 使用量は単純な総和ではありません。「~468 KB」は RP2350 の全 RAM 520 KB から割り当てられた分であり、そのうち Wi-Fi ハードウェア用で約 491 KB が確保されています。
  • 演算単位: 「MAC(Multiply-Accumulate)」は乗法と累算の合計を指します。「MMAC/s」はアクティブ状態における毎秒あたりの処理能力(百万単位)を表します。

ライセンスと利用方法

本コードは、商用利用にも適合する寛容な MIT ライセンス のもとで公開されています。

  • 実装例: RP2350 マイコン上で Wi-Fi 接続を設定し、音声操作を実現するためのエンドツーエンドの実装が用意されています。
  • モジュールの独立性: VAD、STT、TTS の各ライブラリは相互に依存せず、個別に利用可能です。
  • 計算ライブラリ: ニューラル計算には付属する TensorFlow Lite Micro ライブラリを使用します。

ドキュメント

  • 音声活動検出(Voice Activity Detection)
  • 音声からテキストへ(Speech to Text)
  • カスタム単語認識(Custom Word Recognition)
  • ニューラルテキスト読み上げ(Neural Text to Speech)
  • Wi-Fi 接続設定例(Wifi Setup Example)

ライセンス声明

以下の要素はすべて MIT ライセンス の下で提供されます:

  • 本コード(
    third-party/
    ディレクトリを除く)
  • models/
    ディレクトリ内の SpellingCNN および TinyVadCNN モデル

詳細については、ディレクトリ内の

LICENSE
ファイル(またはリポジトリルートにあるもの)をご確認ください。

  • サードパーティ製コード:
    third-party/
    内のコードは、それぞれが元となるオープンソースプロジェクトのライセンス条項に従います。
  • 内訳確認: 各サブフォルダ内に
    LICENSE
    ファイルを配置しており、詳細なライセンス情報を確認できます。

同じ日のほかのニュース

一覧に戻る →

2026/07/19 6:45

ハードコア・インディーウェブ:1 日わずか 0.01 ドルで、あなたのサイトを 100% 独立して運用する方法

## Japanese Translation: この記事は、複雑なサードパーティ製のデータベースやフレームワークを拒否し、個人ウェブコンテンツの完全な所有権を取り戻すことを目的とした「ハードコア・インディエブ」運動を称賛する。高額でサブスクリプション型のプラットフォームに依存し、ユーザーを引き留めるのではなく、データをローカルに保存し、単純なプレーン HTML ファイルを公開することで、真の自律性を確立する。核心的なメッセージは、単なる 3 つの基本ツールのみで真の自立が可能であるという点にある:投稿を書くためのテキストエディタ、アップロードするためのファイル転送ユーティリティ、そして月額わずか 0.25 ドルから利用可能な按分課金の安価なウェブホスティングである。 この方法論は、著者がサイト構造を手動で管理し、不透明なシステムに支配を委ねることなく、1990 年代のウェブ公開の簡素さを意図的に模倣している。各投稿に対して個別の HTML ファイルを使用し、フィードも手動で扱うことで、ユーザーは各エントリの独自のスタイルをカスタマイズしながら、完全な自律性を維持することができる。最も大きな利点はポータビリティであり、ホスティングプロバイダーが消滅した場合でも、所有者はそのサイトをデータ損失や移行手数料なしに瞬時に他場所へ移動できる。本文は、このデジタル自律性への回帰を実施するに関する支援とさらにの議論のために、オミグ・ドット・ロール (omg.lol) のコミュニティに参加することを愛好家たちに呼びかけて締めくくる。

2026/07/18 22:00

GPT-5.6 はプロンプトを用いて、凸最適化分野における30年間の空白を解消した

## Japanese Translation: GPT 5.6 Sol Pro は、凸最適化における画期的な定理を正式に証明し、特定の精度レベルにおける次元依存性に対する必要な二次の下界を示すことで、30年にわたる空白を解決した。この画期的な成果は、以前の方法が示していた上界と理論的に達成可能なものとの間に存在した長年の乖離を閉じるものであり、OpenAI の CDC プロンプティング手法を適用し、新しい数学的手法を導入するのではなく、既存の凸幾何学の理論的手法を成功裏に活用している。1996 年以来、Protasov アルゴリズムは上界として O(d²) の評価数を確立したが、下界は線形の Ω(d) で留まっていた。GPT 5.6 は、d⁻³ の精度達成には確かに O(d²) の評価数が必要であることを示し(当初はより厳密な d⁻⁴ の要件のために構成された)、これによりこれらの境界を同じ位数に揃えた。この結果は、応用数学博士号を保有する UC Berkeley 教授による著者の手により Lean で正式に検証されたものであり、それ以前のもっともーデル(GPT-5.4 および GPT-5.5)を用いた一連の試みでは成功しなかったため、1 年にわたる努力の結果である。この成果は、現代の AI が既存の枠組みを使用して複雑な理論的問題を解決する能力を確認するものである。本結果はいまだピアレビューを経ておらず、著者によって GitHub/ArXiv にホストされているため、形式的な検証が直ちに次のステップとなる。したがって、この分野は、現在の漸進的な技術で達成可能な問題から離れ、新たなアプローチを必要とする深い構造的課題へと焦点をシフトする可能性がある。

2026/07/19 7:02

表紙から本の内容を知ること

## 日本語翻訳: 本文は、3 つの象徴的な文学的冒頭を比較し、人物と設定に対するそれぞれの独自のアプローチに焦点を当てています。ヘルマン・メルヴィルの『モビ・ディック』は、資金不足や陸上の関心の欠如から航海を余儀なくされる語り手、イシュマエルの登場で始まります。チャールズ・ディケンズの『双城記』は、「それが最良の時代でもあり...」という広範な歴史的評価で幕を開けます。しかし、ジェイン・オースティンの『エマ』からの抜粋は、完全に人物の紹介に焦点を当てています。そこでは、エマ・ウッドハウスが手さばきが良く、聡明で裕福であり、世界中で約21年間過ごしてほとんど悩まされることもないと描かれています。彼女は愛情深く甘やかし続ける父親のもとで長女として生まれ、母の死と妹の結婚の後から幼い頃から家の主人となりました。本文は、エマが母の愛撫についてのみあいまいな記憶を保っている一方、母親としての役割は16年間家族に在籍し、厳格な教師よりも愛される友人のように振る舞った家庭教師ミス・テイラーによって補完されたと注記しています。ミス・テイラーは、特にエマを愛していました。他のテキストが直ちに行動や歴史的範囲を示唆しているのに対し、この節は主に物語が始まる前にエマの安定した社会的地位と家族的絆を確立することを厳格に目的としています。

500kb以下のサイズで実装可能な音声認識とTTS | そっか~ニュース