Содержание
  1. Что именно можно настроить
  2. Где проверить доступ перед выбором
  3. Документированный порядок действий
  4. Редакционный пример и критерии проверки
  5. Чем схожие продукты и варианты руки расходятся
  6. Что делать при типичной проблеме
  7. Готовый промпт для озвучки
  8. Частые вопросы
Гайды

Grok: как изменить параметры голоса

9 октября 2026 · 10 минут чтения

Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 9 октября 2026 года; цитаты источников приведены дословно. Обновлено: октябрь 2026.

В Grok можно изменить параметры голоса как через приложение, так и через API. Первый — в голосовом режиме приложения: обзор thebizaihub описывает панель выбора голоса и скорости на телефоне. Для веб-версии и Tesla обзор описывает ограниченные возможности поведенческих личностей; наличие такой же панели выбора тембра нужно проверять отдельно. Второй — через API: в Text to Speech и Voice Agent API голос задаётся идентификатором при обращении к модели. Самый свежий список — это новая линейка из релиза x.ai: двадцать один новый голос для Grok Voice присоединился к исходной пятёрке.

Ниже — что именно доступно, где проверить доступ и как назначить нужный голос в каждом из сценариев.

Мы скачали подборку результатов веб-поиска по запросу «grok как изменить параметры голоса»: текст отдали 9 из 10.

Что именно можно настроить

Публичный релиз x.ai описывает линейку так: к пяти базовым голосам добавили двадцать один новый. Пять базовых голосов переобучены по улучшенному рецепту: пять исходных голосов обновили вместе с новыми и переобучили по улучшенной методике, поэтому темп, фразы и акценты стали естественнее. Каждый новый голос кастинговали под конкретную задачу — поддержку, персонажей, комментирование, рекламу, обучение. Это не два типа голоса, а разные рабочие сценарии внутри одной библиотеки.

Что поддаётся настройке, кроме выбора самого тембра:

Параметр Как задаётся Для чего
Голос Выбор из списка 21 + 5 Тембр, задача, узнаваемость
Язык Автоматически, сам голос мультиязычный Один голос на все локали
Пауза Тег [pause] в тексте Дыхание, акцент на фразе
Шёпот Тег <whisper> в тексте Доверительная подача

Первый абзац официального анонса: сегодня выпускают двадцать один новый голос в дополнение к пяти исходным, все они мультиязычные и уже доступны в realtime Voice Agent API, Text to Speech API и новом Grok Voice Agent Builder. Это граница продукта: список из 21+5 относится к API. В приложении может быть доступен другой набор.

Где проверить доступ перед выбором

Первое, что стоит сделать до поиска кнопки, — понять, какой именно продукт Grok у вас открыт. Версии Grok живут в четыре:

  • Мобильное приложение (iOS и Android) — массовый вход для всех.
  • Веб-версия на grok.com — для тех, кто за ноутбуком.
  • Бортовая система Tesla — отдельный интерфейс.
  • API и Grok Voice Agent Builder в консоли xAI — то место, где встречаются 21+5 голосов.

Обзор thebizaihub описывает базовый голосовой режим на iOS как бесплатный, а на Android связывает доступ к голосовому режиму с SuperGrok. В том же обзоре есть путь через значок микрофона и шестерёнку настроек в активном голосовом сеансе. Перед покупкой подписки проверьте наличие нужного голоса и условия в своём интерфейсе. Ведение аккаунта и ключи описаны в статье Grok API: как получить ключ и сделать первый запрос — она же поможет, если нужен доступ именно к API. Документация Google по Gemini не описывает Grok — она поможет только как ориентир по логике мобильных настроек голоса, где «количество голосов зависит от языка».

Проверка займёт пару минут: откройте меню, найдите строку с параметрами голоса, посмотрите на список — он и покажет, доступна ли нужная функция у вас. Условие входа в справке Google относится к Gemini. Для Grok проверяйте условия в его собственном интерфейсе и документации.

Документированный порядок действий

Порядок зависит от того, где вы работаете с Grok. Условные шаги ниже — из обзора thebizaihub и официального анонса x.ai; конкретные ярлыки могут отличаться у вас.

В мобильном приложении. Обзор thebizaihub предлагает открыть Grok, нажать значок микрофона внизу чата, разрешить доступ к микрофону и открыть шестерёнку настроек в активном голосовом сеансе. В этой панели можно выбрать голос и скорость речи; пункт Mode отвечает за поведенческую личность. Для Android обзор отдельно указывает условие подписки SuperGrok.

На Android, iOS и в браузере. Обзор thebizaihub описывает шаги для трёх оболочек — от мобильных до grok.com. Логика одинаковая: найти раздел с голосом, прослушать, подтвердить. Схема близка к Gemini: вы заходите в настройки, выбираете «Голос Gemini», нажимаете на имя, чтобы услышать, и подтверждаете. При этом в справке Gemini подчёркивают, что голосовые настройки Gemini пока доступны только в мобильном приложении Gemini — у Grok набор оболочек шире, включая браузер и машину.

В API. Тут два пути — переиспользовать встроенный голос или заклонировать собственный. Для первого вам нужен идентификатор: voice_id передаётся в любую конечную точку TTS или используется с Voice Agent API для разговорных агентов в реальном времени. Для кастомного — в консоли xAI записывают около минуты естественной речи и получают модель голоса.

Редакционный пример и критерии проверки

Критерии приёмки на своём примере:

  1. Голос произносит заранее заданные технические термины и имена без искажений.
  2. Паузы стоят в тех местах, где вы расставили теги.
  3. Язык переключается автоматически на второй язык вашего диалога той же моделью.
  4. За 30 секунд прослушивания фрагмент не «слетает» на другой тембр.

Если результат не совпал — проблема почти всегда в одном из двух: либо параметр не туда применился, либо фраза содержит теги, не поддерживаемые вашим типом вызова. Перечитайте, куда вы вставили [pause], и проверьте, что задаёте voice_id в том же самом эндпоинте.

Чем схожие продукты и варианты руки расходятся

Внутри Grok доступны четыре варианта задачи. Их удобно различать по таблице.

Вариант Продукт Способ задать голос Кому подходит
Смена голоса «на слух» Приложение Grok Выбор в настройках/списке Обычный пользователь
Смена голоса в TTS Text to Speech API voice_id в запросе Разработчик
Разговорный агент Voice Agent API Идентификатор голоса в поле voice сессии Сборка бота поддержки
Свой голос Custom Voices Запись ~1 минуты в консоли Бренд, создатель контента

В примере китайской документации Grok для realtime значение идентификатора задаётся в session.voice сообщением session.update; в TTS используется поле voice_id.

Это разные продукты с разной логикой, и смешение сценариев ведёт к проблемам. Например, клонированный голос — это отдельная сущность: голос клонируют с короткой записи и используют его в Grok Text to Speech и Voice Agent API. Тон показательнее: пять исходных голосов переобучили — вы получите тот же голос, но более естественный темп. Смежный продукт Gemini предлагает ту же операцию проще: в мобильном приложении Gemini нужно открыть меню, затем профиль, затем настройки, затем «Голос Gemini» → нажмите на название, чтобы прослушать → подтвердить. Это не инструкция для Grok, но тип операции похож.

Что делать при типичной проблеме

В типичных ситуациях вы встретите одну из двух жалоб — они разного класса, и важен порядок проверок. Разберём четыре варианта.

«Не могу найти настройку голоса». Проверьте вход в аккаунт, затем — в каком продукте вы находитесь: в приложении голос ищется в разделе настроек голосового режима, в API — в параметрах запроса. Не ищите кнопку «Тембр» там, где задача решается параметром.

«Голос не меняется после выбора». Правило простое: параметр применился к одному режиму, а в другом остался прежним. Убедитесь, что вы находитесь в активном голосовом режиме. Настройка голоса действует во время ответа.

«Кастомный голос не проходит». Проверка двухэтапная: сначала нужно прочитать верификационную фразу вслух, а движок STT транскрибирует её и сверяет в реальном времени, затем из верификационного клипа и полной записи вычисляются speaker embeddings, чтобы подтвердить, что они принадлежат одному человеку. Отсюда жёсткое правило: нельзя клонировать голос с уже существующей записи и чужой голос. Пишите так, чтобы ваша речь при записи была живой и непрерывной — так работает сверка.

«Голос не звучит на другом языке». Анонс x.ai описывает линейку Grok Voice как мультиязычную; зависимость списка от языка указывает справка Gemini для собственного продукта. Все 21+5 голосов мультиязычны: каждый голос нативно мультиязычен и поддерживает все 25+ языков Grok Voice. По анонсу x.ai каждый голос линейки мультиязычен. Проверяйте язык текста и поддержку нужного языка выбранным API; анонс не описывает автоматический подбор тембра по языковому разделу.

Общего рецепта на все случаи нет: каждая из четырёх проблем живёт в своём слое, и проверять нужно тот слой, где вы работаете.

Готовый промпт для озвучки

Промпт, чтобы получить озвучку текста одним из выбранных голосов с контролем подачи.

ТЕКСТ6 строк
Озвучь следующий текст голосом [название голоса из списка Grok Voice].
Язык: [русский].
Подача: спокойная, темп средний.
Расставь теги: [pause] после каждой вводной фразы, <whisper> для последнего предложения абзаца.
Текст:
[ваш текст]

Что менять под себя: [название голоса], [русский], [ваш текст], набор тегов и подачу. Промпт копируется в редактор запроса — как есть.

Три вариации той же задачи:

  1. Новостная озвучка. В первой вариации промпт просит озвучить текст голосом [X] в быстром темпе без пауз, разделяя абзацы паузой [pause], и указывает сам текст..
  2. Персонаж для игры. Во второй вариации промпт просит прочитать реплику голосом [X] с ироничной подачей, добавив <emphasis> на ударное слово и <soft> на финал, и указывает саму реплику..
  3. Аудиокнига. В третьей вариации промпт просит озвучить главу голосом [X], ставя паузу [pause] после каждого абзаца и шёпот <whisper> на последних двух предложениях главы, и указывает сам текст..
  4. Мультиязычная презентация. В четвёртой вариации промпт просит озвучить один и тот же текст голосом [X] на русском и английском, сохранив тембр и темп, и указывает сам текст..

Требования к записи для собственного клонирования из официального релиза: в консоли xAI записывают около минуты естественной речи, а конвейер проверяет, что вы владелец голоса, обрабатывает запись и выдаёт готовую модель голоса меньше чем за две минуты. Кастомный голос наследует все возможности TTS: теги, многоязычный вывод и стриминг REST и WebSocket. Дополнительной платы за TTS и Voice Agent API с кастомными голосами нет.

Частые вопросы

Как включить голосовой режим Grok?
В мобильном приложении обзор thebizaihub предлагает нажать значок микрофона и открыть шестерёнку настроек в активном голосовом сеансе. Панель содержит выбор голоса и скорости; доступ на Android обзор связывает с SuperGrok. Для веб-версии и Tesla доступные настройки следует проверять отдельно.

Можно ли изменить голос Grok бесплатно?
В обзоре thebizaihub базовый голосовой режим на iOS описан как бесплатный, а доступ на Android связан с SuperGrok. Проверяйте актуальные условия выбранной платформы перед оплатой. Для API анонс x.ai заявляет отсутствие дополнительной платы за использование кастомных голосов в TTS и Voice Agent API.

Сколько голосов доступно в Grok?
В релизе x.ai указано 21 новый голос плюс исходная пятёрка, всего 26. Они мультиязычны и поддерживают все 25+ языков Grok Voice. Этот список относится к API и Voice Agent Builder; список потребительского приложения проверяйте отдельно.

Почему голос Grok не меняется?
Параметр применился к одному режиму, а в другом остался прежним. Проверьте, что вы в активном голосовом режиме и что voice_id задан в том же запросе, которым вы пользуетесь. Настройка голоса действует на ответ.

Можно ли клонировать свой голос для Grok?
Да, но только свой. Нужна запись около минуты в консоли xAI, верификационная фраза и подтверждение говорящего по embeddings. Клонировать голос из чужой записи или голос другого человека нельзя — это заявленное ограничение. После проверки голос работает в TTS и Voice Agent API, наследуя теги и стриминг.

Читайте также

3 материала