完全オフラインの音声エージェントを Android の 1.2 GB に収めた
話せば Android が実行:音声から実際のデバイス操作、音声での返答までの完全なコマンドループが 1 台のスマホ・RAM 1.2 GB で動作 — Silero VAD、Parakeet STT、FunctionGemma ツールコール、Pocket TTS。
話せば Android が実行:音声から実際のデバイス操作、音声での返答までの完全なコマンドループが 1 台のスマホ・RAM 1.2 GB で動作 — Silero VAD、Parakeet STT、FunctionGemma ツールコール、Pocket TTS。
4 分のオープンソースライブラリツアー:Nemotron Streaming のリアルタイム文字起こし、PersonaPlex のローカル音声対話、VoxCPM2 の 48 kHz クローン — すべてラップトップ上で動作。
スマホと Mac で VAD → STT → LLM → TTS · iPhone 約 1.2 GB · S23 約 1.5 GB · デスクトップ <4 GB
同じ VAD → STT → LLM → TTS エージェントパイプラインを iPhone・Galaxy S23・Mac で実行し、各メモリ予算の実測値を掲載。
8 エンジン:コサイン・WER・UTMOS・RTF・ピーク RSS · 新規行:F5-TTS、Higgs TTS 3、IndexTTS2 · 言語ごとに参照とクローンを聴き比べ
言語ごとに 10 組の FLEURS 参照/ターゲット対:話者類似度、WER/CER、UTMOS、速度、メモリ、耳で確かめられる音声付き。
各グループは Soniqo コンポーネントを組み合わせた複数のサブユースケースをカバーします。音声を投入すれば、対話・文字起こし・合成音声がローカルかつリアルタイムに得られます。
上記のユースケース・パイプラインはこれらのモデルから構成されます。コンポーネントを選んでアーキテクチャ、CLI、Swift API、ベンチマークをご覧ください。すべて Apple Silicon で動作し、多くは Android と Linux にも対応。
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
CoreML INT8: timestamps + speakers, RTF 0.070
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution