Голосовые сообщения: распознавание речи
Расшифруйте голосовые сообщения MAX скачанной локальной моделью речи: языки, сохранённые результаты и доступные команды.
Это руководство помогает превратить голосовые MAX в текст: выбрать модель под язык, скачать её один раз и расшифровать одно сообщение или голосовые из выбранной выдачи. Речь распознаётся на вашем компьютере; запись не отправляется внешней AI-модели.
Быстрый запуск
max models audio list --json
max models audio download gigaam-v3
max messages transcribe "Учебная группа" 204 --jsonCLI получает нужную запись из MAX, закрывает соединение и запускает локальную модель.
Модель не скачивается автоматически во время чтения чата: сначала выполните
models audio download. Уже скачанные файлы используются повторно и проверяются
по контрольной сумме при установке.
Как выбрать модель
| Модель | Для чего подходит |
|---|---|
gigaam-v3 | Русская речь; модель по умолчанию |
gigaam-v3-ctc | Другой вариант русской модели; результат и оформление текста могут отличаться |
parakeet-v3 | Многоязычная речь, включая испанский, английский и русский; занимает больше места и памяти |
Точный размер и состояние установки смотрите в models audio list. Выбирайте модель,
которая поддерживает язык записи. Для одного запуска:
max models audio download parakeet-v3
max messages transcribe "Учебная группа" 204 --model parakeet-v3 --jsonДля следующих запусков:
max config set --defaults transcribeModel parakeet-v3models audio — модели речи. models text относится к поисковым моделям и ключам API;
это другая группа. Настройка models.ocr для изображений не меняет распознавание голоса.
Несколько сообщений
max messages list "Учебная группа" --limit 20 --transcribe --json
max inbox --transcribe --json--transcribe обрабатывает голосовые из показанной выдачи, у которых ещё нет текста,
а не всю историю чата. Сначала скачиваются нужные записи, затем закрывается соединение
и выполняется распознавание. При необходимости задайте --model для одного запуска.
Текст сохраняется под вашим аккаунтом в общей локальной базе. Его используют просмотр
сообщений, входящие, обзор и MCP. Повторная расшифровка того же сообщения той же моделью
может использовать сохранённый результат. В JSON текст находится в поле transcript;
неудавшиеся записи перечисляются в unheard, причина также выводится в stderr.
Форматы и ограничения
Это путь для голосовых сообщений, которые MAX представляет как kind: voice.
Он не обещает расшифровку любого MP3/WAV, присланного документом, и не извлекает речь из
видео автоматически. Для такого файла агенту нужен отдельный доступный инструмент:
например, извлечение звуковой дорожки, преобразование аудио и подходящая модель речи.
Модели лежат в общем каталоге MAX и Telegram; CLI_COMMON_CACHE_DIR меняет его.
Скачивание требует места на диске, распознавание — памяти и времени процессора.
Скорость зависит от длины записи, выбранной модели и компьютера.
Качество
На результат влияют язык, шум, несколько одновременно говорящих людей, качество микрофона, темп речи, имена и специальные термины. Более крупная модель не гарантирует лучший результат для конкретного языка. Важные числа, имена и договорённости сверяйте с аудио. Сохранённая расшифровка не доказывает, что каждое слово распознано правильно.
Агент может прочитать готовый текст и помочь найти ошибки, но для проверки ему нужен доступ к записи и средство воспроизведения или распознавания. Это зависит от инструментов агента. Команды CLI выше не требуют внешнего API и не расходуют его лимит.
Документы и OCR изображений описаны отдельно в руководстве по вложениям. Настройка внешних моделей — в руководстве по API.