324c427c74
STT-модуль для отладки (без UI): WhisperStt (offline whisper int8, CPU), VadSegmenter (Silero VAD, фразы), WavReader (16k mono s16), SttDebug (распознавание wav-файла по фразам с печатью в лог). Вызов: am start --ez stt_debug true (первый wav из filesDir/samples). Модели — в filesDir/models (вне git): small-encoder/decoder.int8.onnx, small-tokens.txt, silero_vad.onnx (fp32!). Грабли, найденные на эмуляторе (Android 15): - Silero VAD int8 (643КБ) молчит в Android-рантайме — нужна fp32 (2.2МБ) - WavReader: littleShort возвращал беззнаковое 0..65535 — сэмплы с DC-offset, whisper давал мусор; теперь знаковый -32768..32767 - VAD требует подачу окнами ровно window_size (целиком — переполнение) - Модели кладутся через adb push /data/local/tmp + run-as cp (внешний каталог приложения на Android 15 не видит adb-файлы) Проверено на эмуляторе (CPU): «раз два три четыре пять» → «Раз, два 3 4 5», грека → почти идеально, masha/anton → 21 фраза, диалог распознан. README: таблица жестов обновлена (TripleClick — безусловный вызов).
16 lines
796 B
Markdown
16 lines
796 B
Markdown
# voice-samples — образцы голоса для тестов распознавания
|
||
|
||
Тестовые аудио для on-device STT (очки/телефон). Не удалять — образцы
|
||
пользователя, присылаются повторно только по необходимости.
|
||
|
||
| Файл | Что там | Длительность |
|
||
|---|---|---|
|
||
| `skorogovorka-greka.mp3` | «Ехал грека через реку…» (скороговорка) | ~6 с |
|
||
| `raz-dva-tri.mp3` | «раз два три четыре пять» | ~3 с |
|
||
| `masha-anton.wav` | Голоса Маши и Антона (с 142, 16 кГц mono) | 60 с |
|
||
|
||
Конвертация в 16 кГц mono (как для STT):
|
||
```
|
||
ffmpeg -y -i in.mp3 -ar 16000 -ac 1 out.wav
|
||
```
|