Содержание
Grok: как изменить параметры голоса
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 9 октября 2026 года; цитаты источников приведены дословно. Обновлено: октябрь 2026.
В Grok можно изменить параметры голоса как через приложение, так и через API. Первый — в голосовом режиме приложения: обзор thebizaihub описывает панель выбора голоса и скорости на телефоне. Для веб-версии и Tesla обзор описывает ограниченные возможности поведенческих личностей; наличие такой же панели выбора тембра нужно проверять отдельно. Второй — через API: в Text to Speech и Voice Agent API голос задаётся идентификатором при обращении к модели. Самый свежий список — это новая линейка из релиза x.ai: двадцать один новый голос для Grok Voice присоединился к исходной пятёрке.
Ниже — что именно доступно, где проверить доступ и как назначить нужный голос в каждом из сценариев.
Мы скачали подборку результатов веб-поиска по запросу «grok как изменить параметры голоса»: текст отдали 9 из 10.
Что именно можно настроить
Публичный релиз x.ai описывает линейку так: к пяти базовым голосам добавили двадцать один новый. Пять базовых голосов переобучены по улучшенному рецепту: пять исходных голосов обновили вместе с новыми и переобучили по улучшенной методике, поэтому темп, фразы и акценты стали естественнее. Каждый новый голос кастинговали под конкретную задачу — поддержку, персонажей, комментирование, рекламу, обучение. Это не два типа голоса, а разные рабочие сценарии внутри одной библиотеки.
Что поддаётся настройке, кроме выбора самого тембра:
| Параметр | Как задаётся | Для чего |
|---|---|---|
| Голос | Выбор из списка 21 + 5 | Тембр, задача, узнаваемость |
| Язык | Автоматически, сам голос мультиязычный | Один голос на все локали |
| Пауза | Тег [pause] в тексте |
Дыхание, акцент на фразе |
| Шёпот | Тег <whisper> в тексте |
Доверительная подача |
Первый абзац официального анонса: сегодня выпускают двадцать один новый голос в дополнение к пяти исходным, все они мультиязычные и уже доступны в realtime Voice Agent API, Text to Speech API и новом Grok Voice Agent Builder. Это граница продукта: список из 21+5 относится к API. В приложении может быть доступен другой набор.
Где проверить доступ перед выбором
Первое, что стоит сделать до поиска кнопки, — понять, какой именно продукт Grok у вас открыт. Версии Grok живут в четыре:
- Мобильное приложение (iOS и Android) — массовый вход для всех.
- Веб-версия на grok.com — для тех, кто за ноутбуком.
- Бортовая система Tesla — отдельный интерфейс.
- API и Grok Voice Agent Builder в консоли xAI — то место, где встречаются 21+5 голосов.
Обзор thebizaihub описывает базовый голосовой режим на iOS как бесплатный, а на Android связывает доступ к голосовому режиму с SuperGrok. В том же обзоре есть путь через значок микрофона и шестерёнку настроек в активном голосовом сеансе. Перед покупкой подписки проверьте наличие нужного голоса и условия в своём интерфейсе. Ведение аккаунта и ключи описаны в статье Grok API: как получить ключ и сделать первый запрос — она же поможет, если нужен доступ именно к API. Документация Google по Gemini не описывает Grok — она поможет только как ориентир по логике мобильных настроек голоса, где «количество голосов зависит от языка».
Проверка займёт пару минут: откройте меню, найдите строку с параметрами голоса, посмотрите на список — он и покажет, доступна ли нужная функция у вас. Условие входа в справке Google относится к Gemini. Для Grok проверяйте условия в его собственном интерфейсе и документации.
Документированный порядок действий
Порядок зависит от того, где вы работаете с Grok. Условные шаги ниже — из обзора thebizaihub и официального анонса x.ai; конкретные ярлыки могут отличаться у вас.
В мобильном приложении. Обзор thebizaihub предлагает открыть Grok, нажать значок микрофона внизу чата, разрешить доступ к микрофону и открыть шестерёнку настроек в активном голосовом сеансе. В этой панели можно выбрать голос и скорость речи; пункт Mode отвечает за поведенческую личность. Для Android обзор отдельно указывает условие подписки SuperGrok.
На Android, iOS и в браузере. Обзор thebizaihub описывает шаги для трёх оболочек — от мобильных до grok.com. Логика одинаковая: найти раздел с голосом, прослушать, подтвердить. Схема близка к Gemini: вы заходите в настройки, выбираете «Голос Gemini», нажимаете на имя, чтобы услышать, и подтверждаете. При этом в справке Gemini подчёркивают, что голосовые настройки Gemini пока доступны только в мобильном приложении Gemini — у Grok набор оболочек шире, включая браузер и машину.
В API. Тут два пути — переиспользовать встроенный голос или заклонировать собственный. Для первого вам нужен идентификатор: voice_id передаётся в любую конечную точку TTS или используется с Voice Agent API для разговорных агентов в реальном времени. Для кастомного — в консоли xAI записывают около минуты естественной речи и получают модель голоса.
Редакционный пример и критерии проверки
Критерии приёмки на своём примере:
- Голос произносит заранее заданные технические термины и имена без искажений.
- Паузы стоят в тех местах, где вы расставили теги.
- Язык переключается автоматически на второй язык вашего диалога той же моделью.
- За 30 секунд прослушивания фрагмент не «слетает» на другой тембр.
Если результат не совпал — проблема почти всегда в одном из двух: либо параметр не туда применился, либо фраза содержит теги, не поддерживаемые вашим типом вызова. Перечитайте, куда вы вставили [pause], и проверьте, что задаёте voice_id в том же самом эндпоинте.
Чем схожие продукты и варианты руки расходятся
Внутри Grok доступны четыре варианта задачи. Их удобно различать по таблице.
| Вариант | Продукт | Способ задать голос | Кому подходит |
|---|---|---|---|
| Смена голоса «на слух» | Приложение Grok | Выбор в настройках/списке | Обычный пользователь |
| Смена голоса в TTS | Text to Speech API | voice_id в запросе |
Разработчик |
| Разговорный агент | Voice Agent API | Идентификатор голоса в поле voice сессии |
Сборка бота поддержки |
| Свой голос | Custom Voices | Запись ~1 минуты в консоли | Бренд, создатель контента |
В примере китайской документации Grok для realtime значение идентификатора задаётся в session.voice сообщением session.update; в TTS используется поле voice_id.
Это разные продукты с разной логикой, и смешение сценариев ведёт к проблемам. Например, клонированный голос — это отдельная сущность: голос клонируют с короткой записи и используют его в Grok Text to Speech и Voice Agent API. Тон показательнее: пять исходных голосов переобучили — вы получите тот же голос, но более естественный темп. Смежный продукт Gemini предлагает ту же операцию проще: в мобильном приложении Gemini нужно открыть меню, затем профиль, затем настройки, затем «Голос Gemini» → нажмите на название, чтобы прослушать → подтвердить. Это не инструкция для Grok, но тип операции похож.
Что делать при типичной проблеме
В типичных ситуациях вы встретите одну из двух жалоб — они разного класса, и важен порядок проверок. Разберём четыре варианта.
«Не могу найти настройку голоса». Проверьте вход в аккаунт, затем — в каком продукте вы находитесь: в приложении голос ищется в разделе настроек голосового режима, в API — в параметрах запроса. Не ищите кнопку «Тембр» там, где задача решается параметром.
«Голос не меняется после выбора». Правило простое: параметр применился к одному режиму, а в другом остался прежним. Убедитесь, что вы находитесь в активном голосовом режиме. Настройка голоса действует во время ответа.
«Кастомный голос не проходит». Проверка двухэтапная: сначала нужно прочитать верификационную фразу вслух, а движок STT транскрибирует её и сверяет в реальном времени, затем из верификационного клипа и полной записи вычисляются speaker embeddings, чтобы подтвердить, что они принадлежат одному человеку. Отсюда жёсткое правило: нельзя клонировать голос с уже существующей записи и чужой голос. Пишите так, чтобы ваша речь при записи была живой и непрерывной — так работает сверка.
«Голос не звучит на другом языке». Анонс x.ai описывает линейку Grok Voice как мультиязычную; зависимость списка от языка указывает справка Gemini для собственного продукта. Все 21+5 голосов мультиязычны: каждый голос нативно мультиязычен и поддерживает все 25+ языков Grok Voice. По анонсу x.ai каждый голос линейки мультиязычен. Проверяйте язык текста и поддержку нужного языка выбранным API; анонс не описывает автоматический подбор тембра по языковому разделу.
Общего рецепта на все случаи нет: каждая из четырёх проблем живёт в своём слое, и проверять нужно тот слой, где вы работаете.
Готовый промпт для озвучки
Промпт, чтобы получить озвучку текста одним из выбранных голосов с контролем подачи.
Озвучь следующий текст голосом [название голоса из списка Grok Voice].
Язык: [русский].
Подача: спокойная, темп средний.
Расставь теги: [pause] после каждой вводной фразы, <whisper> для последнего предложения абзаца.
Текст:
[ваш текст]
Что менять под себя: [название голоса], [русский], [ваш текст], набор тегов и подачу. Промпт копируется в редактор запроса — как есть.
Три вариации той же задачи:
- Новостная озвучка. В первой вариации промпт просит озвучить текст голосом [X] в быстром темпе без пауз, разделяя абзацы паузой
[pause], и указывает сам текст.. - Персонаж для игры. Во второй вариации промпт просит прочитать реплику голосом [X] с ироничной подачей, добавив
<emphasis>на ударное слово и<soft>на финал, и указывает саму реплику.. - Аудиокнига. В третьей вариации промпт просит озвучить главу голосом [X], ставя паузу
[pause]после каждого абзаца и шёпот<whisper>на последних двух предложениях главы, и указывает сам текст.. - Мультиязычная презентация. В четвёртой вариации промпт просит озвучить один и тот же текст голосом [X] на русском и английском, сохранив тембр и темп, и указывает сам текст..
Требования к записи для собственного клонирования из официального релиза: в консоли xAI записывают около минуты естественной речи, а конвейер проверяет, что вы владелец голоса, обрабатывает запись и выдаёт готовую модель голоса меньше чем за две минуты. Кастомный голос наследует все возможности TTS: теги, многоязычный вывод и стриминг REST и WebSocket. Дополнительной платы за TTS и Voice Agent API с кастомными голосами нет.
Частые вопросы
Как включить голосовой режим Grok?
В мобильном приложении обзор thebizaihub предлагает нажать значок микрофона и открыть шестерёнку настроек в активном голосовом сеансе. Панель содержит выбор голоса и скорости; доступ на Android обзор связывает с SuperGrok. Для веб-версии и Tesla доступные настройки следует проверять отдельно.
Можно ли изменить голос Grok бесплатно?
В обзоре thebizaihub базовый голосовой режим на iOS описан как бесплатный, а доступ на Android связан с SuperGrok. Проверяйте актуальные условия выбранной платформы перед оплатой. Для API анонс x.ai заявляет отсутствие дополнительной платы за использование кастомных голосов в TTS и Voice Agent API.
Сколько голосов доступно в Grok?
В релизе x.ai указано 21 новый голос плюс исходная пятёрка, всего 26. Они мультиязычны и поддерживают все 25+ языков Grok Voice. Этот список относится к API и Voice Agent Builder; список потребительского приложения проверяйте отдельно.
Почему голос Grok не меняется?
Параметр применился к одному режиму, а в другом остался прежним. Проверьте, что вы в активном голосовом режиме и что voice_id задан в том же запросе, которым вы пользуетесь. Настройка голоса действует на ответ.
Можно ли клонировать свой голос для Grok?
Да, но только свой. Нужна запись около минуты в консоли xAI, верификационная фраза и подтверждение говорящего по embeddings. Клонировать голос из чужой записи или голос другого человека нельзя — это заявленное ограничение. После проверки голос работает в TTS и Voice Agent API, наследуя теги и стриминг.
