MAX

Голосовые сообщения: распознавание речи

Расшифруйте голосовые сообщения MAX скачанной локальной моделью речи: языки, сохранённые результаты и доступные команды.

Это руководство помогает превратить голосовые MAX в текст: выбрать модель под язык, скачать её один раз и расшифровать одно сообщение или голосовые из выбранной выдачи. Речь распознаётся на вашем компьютере; запись не отправляется внешней AI-модели.

Быстрый запуск

max models audio list --json
max models audio download gigaam-v3
max messages transcribe "Учебная группа" 204 --json

CLI получает нужную запись из MAX, закрывает соединение и запускает локальную модель. Модель не скачивается автоматически во время чтения чата: сначала выполните models audio download. Уже скачанные файлы используются повторно и проверяются по контрольной сумме при установке.

Как выбрать модель

МодельДля чего подходит
gigaam-v3Русская речь; модель по умолчанию
gigaam-v3-ctcДругой вариант русской модели; результат и оформление текста могут отличаться
parakeet-v3Многоязычная речь, включая испанский, английский и русский; занимает больше места и памяти

Точный размер и состояние установки смотрите в models audio list. Выбирайте модель, которая поддерживает язык записи. Для одного запуска:

max models audio download parakeet-v3
max messages transcribe "Учебная группа" 204 --model parakeet-v3 --json

Для следующих запусков:

max config set --defaults transcribeModel parakeet-v3

models audio — модели речи. models text относится к поисковым моделям и ключам API; это другая группа. Настройка models.ocr для изображений не меняет распознавание голоса.

Несколько сообщений

max messages list "Учебная группа" --limit 20 --transcribe --json
max inbox --transcribe --json

--transcribe обрабатывает голосовые из показанной выдачи, у которых ещё нет текста, а не всю историю чата. Сначала скачиваются нужные записи, затем закрывается соединение и выполняется распознавание. При необходимости задайте --model для одного запуска.

Текст сохраняется под вашим аккаунтом в общей локальной базе. Его используют просмотр сообщений, входящие, обзор и MCP. Повторная расшифровка того же сообщения той же моделью может использовать сохранённый результат. В JSON текст находится в поле transcript; неудавшиеся записи перечисляются в unheard, причина также выводится в stderr.

Форматы и ограничения

Это путь для голосовых сообщений, которые MAX представляет как kind: voice. Он не обещает расшифровку любого MP3/WAV, присланного документом, и не извлекает речь из видео автоматически. Для такого файла агенту нужен отдельный доступный инструмент: например, извлечение звуковой дорожки, преобразование аудио и подходящая модель речи.

Модели лежат в общем каталоге MAX и Telegram; CLI_COMMON_CACHE_DIR меняет его. Скачивание требует места на диске, распознавание — памяти и времени процессора. Скорость зависит от длины записи, выбранной модели и компьютера.

Качество

На результат влияют язык, шум, несколько одновременно говорящих людей, качество микрофона, темп речи, имена и специальные термины. Более крупная модель не гарантирует лучший результат для конкретного языка. Важные числа, имена и договорённости сверяйте с аудио. Сохранённая расшифровка не доказывает, что каждое слово распознано правильно.

Агент может прочитать готовый текст и помочь найти ошибки, но для проверки ему нужен доступ к записи и средство воспроизведения или распознавания. Это зависит от инструментов агента. Команды CLI выше не требуют внешнего API и не расходуют его лимит.

Документы и OCR изображений описаны отдельно в руководстве по вложениям. Настройка внешних моделей — в руководстве по API.