オープンソース · Apache 2.0 · 完全オフライン

オンデバイスの音声。
本番プロダクトへ。

話者分離付き文字起こし、ゼロショット音声クローン、長尺音声合成 —— Apple Silicon、Android、Windows、組み込み Linux で動作。クラウド API なし、分単位課金なし、データはデバイスから出ません。

Apple · Homebrew
brew install speech
Android · Gradle
implementation("audio.soniqo:speech:0.0.9")
最新記事と動画
すべての記事
YouTube · 90 秒

完全オフラインの音声エージェントを Android の 1.2 GB に収めた

話せば Android が実行:音声から実際のデバイス操作、音声での返答までの完全なコマンドループが 1 台のスマホ・RAM 1.2 GB で動作 — Silero VAD、Parakeet STT、FunctionGemma ツールコール、Pocket TTS。

視聴
YouTube · 4 分

MacBook のローカル音声 AI — 4 分でわかるライブラリツアー

4 分のオープンソースライブラリツアー:Nemotron Streaming のリアルタイム文字起こし、PersonaPlex のローカル音声対話、VoxCPM2 の 48 kHz クローン — すべてラップトップ上で動作。

視聴
2026年7月7日 · Soniqo ブログ

音声エージェントをオンデバイスで動かす:一つのパイプライン、三つのメモリ予算

スマホと Mac で VAD → STT → LLM → TTS · iPhone 約 1.2 GB · S23 約 1.5 GB · デスクトップ <4 GB

同じ VAD → STT → LLM → TTS エージェントパイプラインを iPhone・Galaxy S23・Mac で実行し、各メモリ予算の実測値を掲載。

読む
2026年7月2日 · Soniqo ブログ

音声クローンモデルを五言語で実測

8 エンジン:コサイン・WER・UTMOS・RTF・ピーク RSS · 新規行:F5-TTS、Higgs TTS 3、IndexTTS2 · 言語ごとに参照とクローンを聴き比べ

言語ごとに 10 組の FLEURS 参照/ターゲット対:話者類似度、WER/CER、UTMOS、速度、メモリ、耳で確かめられる音声付き。

読む
作れるもの

3 つのオンデバイス・ユースケース・グループ。

各グループは Soniqo コンポーネントを組み合わせた複数のサブユースケースをカバーします。音声を投入すれば、対話・文字起こし・合成音声がローカルかつリアルタイムに得られます。

すべてのコンポーネント

30 以上のモデル。1 つのスタック。

上記のユースケース・パイプラインはこれらのモデルから構成されます。コンポーネントを選んでアーキテクチャ、CLI、Swift API、ベンチマークをご覧ください。すべて Apple Silicon で動作し、多くは Android と Linux にも対応。

音声合成