Stenograf — От разговора к действию
Концептуальный ролик о том, как Stenograf видит превращение разговоров в полезные дальнейшие действия.
Диаризованная транскрипция, zero-shot клонирование голоса, длинный синтез речи — на Apple Silicon, Android, Windows и embedded Linux. Никаких облачных API, никакой оплаты по минутам, никакие данные не покидают устройство.
Личная память о разговорах
brew install speechimplementation("audio.soniqo:speech:0.0.9")Концептуальный ролик о том, как Stenograf видит превращение разговоров в полезные дальнейшие действия.
От Moshi и PersonaPlex к VoiceChat: как полнодуплексная речь обрабатывает перебивания и вызовы инструментов MCP и когда подходит компактный конвейер голосовых команд на Android.
Реальная сессия с NVIDIA Nemotron VoiceChat 11B, запущенная локально: речевой ход, перебивание на середине фразы и полный вызов инструмента MCP в Напоминания Apple. RTF 0,92 на M5 Pro, и ничего не покидает машину.
Скажи — и Android сделает: полный командный цикл от речи до реального действия на устройстве и голосового ответа, на одном телефоне в 1,2 ГБ RAM. Silero VAD, Parakeet STT, вызовы инструментов FunctionGemma и Pocket TTS.
Каждая группа охватывает несколько подсценариев, собранных из компонентов Soniqo. Подаёте аудио — получаете диалог, транскрипции или сгенерированную речь локально, в реальном времени.
Создавайте voice-first интерфейсы — от полнодуплексного speech-to-speech до компонуемых пайплайнов с активацией по ключевому слову, всё локально.
Превращайте аудио в структурированный текст — потоковый режим в реальном времени для живых субтитров и диктовки, высокоточный пакетный режим для архивов, с диаризацией для именования каждого спикера.
Синтезируйте речь любым голосом — клонируйте голос за секунды, читайте аудиокниги часами или озвучивайте многоголосые подкасты — полностью офлайн.
Все пайплайны выше собраны из этих моделей. Выберите компонент, чтобы увидеть его архитектуру, CLI, Swift API и бенчмарки. Все работают на Apple Silicon, большинство — также на Android и Linux.
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
MLX INT5: 128K offline context, RTF 0.028
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
SpeechBrain ECAPA, 107 languages, 21M
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
End-of-turn detection, 23 langs, 3.5 ms per pause
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution
Streaming on-device LLM
Structured tool / function-call grammar
Many-to-many translation, 400+ languages
Streaming speech translation, FR/ES/PT/DE → EN
Moshi-family full-duplex speech-to-speech
Asymmetric duplex speech-to-speech, INT5 / INT8