Может ли ChatGPT расшифровать аудио — да, но только двумя официальными путями: диктовкой (микрофон в поле ввода) и режимом записи ChatGPT record, который на 3 августа 2026 доступен лишь в десктопном приложении для macOS. Просто загрузить mp3 в чат и попросить расшифровку нельзя: аудиоформатов нет в списке поддерживаемых типов файлов. Готовый файл расшифровывает API OpenAI.
- Диктовка возвращает текст вашей речи, который можно отредактировать до отправки.
- ChatGPT record транскрибирует и суммирует встречу; сессия ограничена 4 часами (240 минутами).
- Список типов файлов, поддерживаемых загрузкой в ChatGPT, состоит из текстовых, табличных, презентационных и документных расширений — аудио в нём нет.
- API принимает файл до 25 МБ в семи форматах: mp3, mp4, mpeg, mpga, m4a, wav, webm.
- Русская речь официально идёт с оговоркой: record mode «works best in English today».
Может ли ChatGPT расшифровать аудио: четыре пути и что выбрать
Путаница в теме держится на том, что «ChatGPT» — это сразу несколько разных продуктов OpenAI с разными возможностями. Один из них слушает микрофон, другой пишет встречу, третий вообще не про звук, четвёртый живёт в коде. Ниже — что именно умеет каждый по состоянию на 3 августа 2026.
| Способ | Что делает | Где доступен | Ключевое ограничение |
| Диктовка (иконка микрофона) | Записывает вашу речь, возвращает транскрипцию текстом | В интерфейсе ChatGPT | Работает с живым голосом, а не с загруженным файлом |
| ChatGPT record | Транскрибирует и суммирует запись: встречу, брейншторм, голосовую заметку | Только приложение для macOS; планы Plus, Enterprise, Edu, Business, Pro | До 4 часов (240 минут) на сессию |
| Загрузка аудиофайла в диалог | Не предусмотрена | — | Аудиорасширений нет в официальном списке поддерживаемых типов файлов |
| Audio API (/v1/audio/transcriptions) | Расшифровывает готовую запись, отдаёт текст или JSON | Через код или curl, нужен API-ключ | Файл до 25 МБ, семь форматов, ссылки на файл не принимаются |
Практический вывод простой: если запись уже лежит файлом на диске — вам нужен API или сторонний сервис. Если разговор только предстоит и вы на Mac — хватит встроенного record.

- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
- Где и как применять? Потестируем модель после установки на разных задачах
- Как дообучить модель под себя?
Диктовка: как ChatGPT превращает вашу речь в текст
Самый простой сценарий преобразования аудио в текст встроен в чат и не требует ничего, кроме микрофона. В справке OpenAI механика описана так: «When you press the microphone icon to record an audio message, the recorded audio is sent to our models to be transcribed. The transcription is returned as text, which you can edit before sending as a user message».
То есть вы получаете не ответ модели на голосовую команду, а именно расшифровку — редактируемый текст в поле ввода. Это удобно, когда нужно надиктовать длинный запрос, черновик письма или тезисы, а потом поправить формулировки перед отправкой.
- Отключить передачу голоса на обучение моделей можно переключателем «Include your audio recordings» в настройках данных, либо выключив «Improve the model for everyone» целиком.
- Для бизнес-аккаунтов обучение на вводе и выводе по умолчанию не ведётся.
Ограничение очевидное и его стоит проговорить: диктовка расшифровывает то, что вы говорите в микрофон прямо сейчас. Записанное интервью с диктофона она не откроет.
ChatGPT record: расшифровка встреч без сторонних сервисов

Режим записи — единственный способ получить в самом ChatGPT расшифровку разговора, а не только своей реплики. Формулировка справки: «With record mode, ChatGPT can transcribe and summarize audio recordings like meetings, brainstorms, or voice notes». Итог сохраняется как канвас в истории чатов, и из него можно тут же собрать письмо, план проекта или заготовку кода.
Прежде чем планировать на этом рабочий процесс, сверьтесь с четырьмя фактами из официальной справки OpenAI на 3 августа 2026:
- Доступ: «Currently, ChatGPT record is available for Plus, Enterprise, Edu, Business, and Pro workspaces, and only available for the macOS desktop app». Windows и веб — мимо.
- Длительность: сессия ограничена 4 часами (240 минутами), при превышении запись останавливается сама и заметки выгружаются в приватный канвас.
- Цена: «Upon launch, it is included at no extra cost» — отдельной платы за режим нет, но OpenAI отдельно оговаривает, что лимиты и цены могут меняться.
- Спикеры: режим различает нескольких говорящих и подставляет метки вида Speaker 1, которые потом можно переименовать.
Для корпоративных пространств есть нюанс администрирования: в Enterprise и Edu режим по умолчанию выключен и включается владельцем воркспейса.
Почему нельзя просто загрузить mp3 в чат и попросить расшифровать
Это самая частая попытка — и самый частый тупик. Справка OpenAI о типах файлов формулирует круг возможностей загрузки предельно узко: «Most common file extensions for text files, spreadsheets, presentations, and documents are supported, including XLSX, XLS, CSV, TSV, DOCX, PPTX, PDF, and TXT». Аудиорасширений в перечне нет — ни mp3, ни wav, ни m4a. Загрузка в ChatGPT построена вокруг анализа документов и таблиц, а не звука.
Отсюда расхождение, которое стоит держать в голове, потому что оно порождает противоречивые статьи в интернете:
- Версия «ChatGPT не работает с аудио вообще» верна применительно к загрузке файлов: официальный список типов файлов её не предусматривает (справка OpenAI, обновление от конца июля 2026).
- Версия «ChatGPT расшифровывает аудио» верна применительно к диктовке и record mode: OpenAI прямо описывает транскрибацию встреч и голосовых заметок (справка ChatGPT record, обновление от конца июля 2026).
Обе версии описывают один продукт, но разные его части. Спор возникает, когда автор проверяет один путь, а вывод делает про все сразу. Если задача разовая и лезть в код не хочется, разумнее взять специализированный транскрибатор — такие сервисы есть в нашей подборке нейросетей, которые сейчас в тренде.
Отдельная тонкость касается ссылок. В FAQ по Audio API вопрос «Can I send links to audio files to the Audio API?» закрыт одним словом: «No, you must send a file in one of the supported audio formats». Так что схема «дам модели ссылку на запись в облаке» не работает ни в чате, ни в API — файл нужно передать целиком.
Расшифровка аудио через API: модели, лимиты, форматы
Когда запись уже существует файлом, задачу решает Audio API. Документация OpenAI разводит три модели по назначению, и это тот случай, когда выбор влияет на результат сильнее, чем промпт.
- gpt-transcribe — рекомендованная модель для транскрибации записанной речи на языке оригинала.
- gpt-4o-transcribe-diarize — только когда нужно разметить, кто из говорящих что сказал; для обычной расшифровки её брать не советуют.
- whisper-1 — когда нужны таймкоды слов и сегментов, форматы субтитров или перевод.
Технические рамки документация Audio API задаёт дословно: «Files can be up to 25 MB. Supported input formats are mp3, mp4, mpeg, mpga, m4a, wav, and webm».
Минимальный запрос на Python выглядит так:
from openai import OpenAI
client = OpenAI()
audio_file = open("audio.wav", "rb")
transcription = client.audio.transcriptions.create(
model="gpt-transcribe", file=audio_file
)
print(transcription.text)
keywords — список конкретных терминов, которые вы ожидаете услышать, languages — ожидаемые языки. Документация предупреждает: ключевые слова это подсказка, а не гарантия, и их стоит проверять на предмет ложных срабатываний. Для gpt-transcribe параметр languages заменяет прежний одиночный language, и отправлять оба поля нельзя.
Сколько стоит расшифровка через API
Цены на странице тарифов OpenAI даны как оценочная стоимость минуты аудио:
| Модель | Назначение | Оценочная стоимость |
| gpt-transcribe | Транскрибация | $0,0045 за минуту |
| gpt-4o-transcribe | Транскрибация | $0,006 за минуту |
| gpt-4o-mini-transcribe | Транскрибация | $0,003 за минуту |
| gpt-live-transcribe | Транскрибация в реальном времени | $0,017 за минуту |
Тарифы OpenAI меняет регулярно, поэтому перед расчётом бюджета сверяйтесь с текущей страницей цен, а не со статьями.
Что делать с записью длиннее 25 МБ

Лимит в 25 МБ упирается не в длину, а в вес файла, и часовая планёрка в wav его пробивает легко. Документация даёт два выхода: «For larger recordings, use a compressed audio format or split the file into chunks of 25 MB or less». И сразу же — предупреждение, которое обычно игнорируют: «Avoid splitting in the middle of a sentence, which can remove context and reduce accuracy».
Для нарезки OpenAI приводит пример на open-source библиотеке PyDub, оговариваясь, что за стороннее ПО не отвечает:
from pydub import AudioSegment
song = AudioSegment.from_wav("good_morning.wav")
# PyDub считает время в миллисекундах
ten_minutes = 10 * 60 * 1000
first_10_minutes = song[:ten_minutes]
first_10_minutes.export("good_morning_10.wav", format="wav")
Порядок действий, который экономит время: сначала пережать запись в mp3 с невысоким битрейтом (речь от этого почти не страдает), проверить вес, и только если файл всё ещё тяжёлый — резать на куски по паузам между фразами.
Русская речь, таймкоды и перевод: где ChatGPT ставит границы
Для русскоязычных задач важны три официальные оговорки, которые в обзорах обычно теряются.
Русский язык. В FAQ по режиму записи вопрос о неанглийской речи закрыт честно: «ChatGPT record mode works best in English today. Accuracy for other languages is improving but can vary». Это не запрет, а предупреждение: на планёрке с плотной русской речью и перебиваниями расшифровку придётся вычитывать. Для API-модели whisper-1 документация формулирует так же аккуратно: «Whisper supports 98 languages, but accuracy varies by language». Языки для gpt-transcribe задаются кодами ISO 639-1 — в документации приведены примеры en, es, fr.
Перевод. Отдельный эндпоинт /v1/audio/translations работает только с whisper-1 и только в одну сторону: «This endpoint supports translation into English only». Расшифровать немецкое интервью сразу на русский он не может — сначала транскрипция на языке оригинала, потом обычный перевод текста.
Таймкоды. Параметр timestamp_granularities поддерживается только для whisper-1. Если вам нужны субтитры или монтажные метки, брать рекомендованную gpt-transcribe бессмысленно — таймкодов она не даст.
Как выбрать способ под свою задачу
Сведём всё к рабочему чек-листу. Найдите свою строку — и дальше читать не нужно.
| Задача | Что использовать |
| Надиктовать длинный запрос или черновик текста | Диктовка в интерфейсе ChatGPT |
| Расшифровать и суммировать встречу, идущую прямо сейчас | ChatGPT record (только macOS, платные планы) |
| Расшифровать файл, который уже записан | Audio API, модель gpt-transcribe |
| Понять, кто из участников что сказал | Audio API, модель gpt-4o-transcribe-diarize |
| Получить субтитры с таймкодами | Audio API, модель whisper-1 |
| Получить английский текст с иноязычной записи | Эндпоинт /v1/audio/translations с whisper-1 |
| Причесать уже готовую расшифровку | Обычный диалог с ChatGPT: вставить текст и задать правила редактуры |
Последняя строка — то, ради чего ChatGPT в этой связке и нужен большинству. Машинная расшифровка отдаёт поток без абзацев, со словами-паразитами и ошибками в терминах. Модель хорошо приводит его в читаемый вид: расставляет структуру, чистит повторы, собирает из разговора список решений и задач. Разделение труда честное — распознаёт речь одна модель, редактирует другая.
Частые вопросы про расшифровку аудио в ChatGPT
Может ли ChatGPT расшифровать аудиофайл, загруженный в чат?
Нет. В официальном списке поддерживаемых типов файлов ChatGPT перечислены текстовые, табличные, презентационные и документные форматы — XLSX, XLS, CSV, TSV, DOCX, PPTX, PDF и TXT. Аудиорасширений в нём нет. Расшифровку записанного файла делает Audio API, а внутри интерфейса доступны диктовка и режим записи.
Какой максимальный размер аудиофайла принимает API OpenAI?
25 МБ. Для более тяжёлых записей документация советует использовать сжатый аудиоформат либо разрезать файл на фрагменты по 25 МБ и меньше, не разрывая предложения посередине.
Какие форматы аудио поддерживает расшифровка через API?
Семь: mp3, mp4, mpeg, mpga, m4a, wav и webm. Ссылку на файл вместо самого файла отправить нельзя — в FAQ по Audio API это указано прямо.
Сколько стоит расшифровка аудио через API OpenAI?
По странице тарифов оценочная стоимость составляет 0,0045 доллара за минуту для gpt-transcribe, 0,006 доллара за минуту для gpt-4o-transcribe и 0,003 доллара за минуту для gpt-4o-mini-transcribe. Тарифы меняются, поэтому расчёт бюджета стоит сверять с текущей страницей цен.
Расшифровывает ли ChatGPT record русскую речь?
Да, но с официальной оговоркой: режим записи лучше всего работает с английским языком, а точность на других языках может отличаться. Русскую расшифровку встречи имеет смысл вычитывать перед тем, как рассылать её участникам.
Можно ли получить расшифровку с таймкодами?
Да, через модель whisper-1 и параметр timestamp_granularities: он отдаёт метки времени по словам и сегментам и поддерживается только этой моделью. Рекомендованная gpt-transcribe таймкоды не выдаёт.
Нужен ли платный тариф, чтобы расшифровать встречу в ChatGPT?
Да. Режим записи доступен в планах Plus, Enterprise, Edu, Business и Pro и только в десктопном приложении для macOS; дополнительной платы за сам режим на старте не берут.
Если хотите расширить набор инструментов вокруг чата, посмотрите обзор полезных плагинов для ChatGPT. А тем, кто расшифровывает лекции и вебинары, пригодится разбор сценариев ChatGPT в образовании.
- Освой нейросеть Perplexity и узнай, как пользоваться функционалом остальных ИИ в одном
- УЧАСТВОВАТЬ ЗА 0 РУБ.
- Расскажем, как получить подписку
- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросеть DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ