Содержание
  1. Что такое промт по картинке и зачем он нужен
  2. Как получить промт по картинке: пять способов
  3. Сравнение инструментов для промта по картинке
  4. Как написать промт по картинке: пошагово
  5. Разбор картинки по слотам: из чего собирается промт
  6. Примеры написания промта
  7. Почему промт по картинке не повторяет оригинал
  8. Советы по промптингу
  9. Частые вопросы
ГайдыОбновлено · 08.2026

Как написать промт по картинке

13 июня 2024 · 15 минут чтения

Промт по картинке получают двумя путями: через встроенный реверс-промт самого генератора (в Midjourney это инструмент Describe, он возвращает четыре варианта) или через vision-модель, которой изображение отдают файлом — ChatGPT, GigaChat, отдельные сервисы вроде ImagePrompt.org. Любой из них выдаёт черновик: описание того, что видно, а не готовое задание на генерацию. Рабочим промт становится после правки — ниже разобрано, где взять черновик, что в нём дописать и почему точная копия оригинала не получится.

  • Реверс-промт внутри генератора: Describe в Midjourney, четыре варианта на одну картинку.
  • Vision-модель: загрузили файл, попросили описать сцену, свет, ракурс и стиль.
  • Сервисы «изображение → промт»: быстрее всего, но упираются в дневной лимит бесплатного тарифа.
  • Открытый CLIP Interrogator: без подписки и карты, но запускать его придётся самому — в браузерном демо, Colab или у себя.
  • Автоматический результат — заготовка. Дописывать приходится задачу кадра, формат и ограничения.
  • Совпадения один в один не будет ни у одного инструмента: это заявлено в документации самих платформ.

Что такое промт по картинке и зачем он нужен

Промт — текстовый запрос, по которому нейросеть рисует изображение. Промт по картинке — тот же запрос, но собранный не с нуля, а из разбора готового референса: вы отдаёте файл, инструмент возвращает текст, этот текст вы правите и отправляете в генератор. Запрос «промт на фото» означает то же самое: для инструмента фотография — такое же изображение, как рисунок, скриншот или кадр из видео.

Здесь легко попасть в ловушку. Инструменты решают две разные задачи. Первая — описание изображения (image captioning): что за объект, где стоит, какого цвета. Вторая — промт для генерации: то же самое плюс тип съёмки, свет, объектив, стиль, композиция и ограничения. Первое отвечает на вопрос «что на фото», второе — «как это нарисовать заново». Большинство бесплатных сервисов по умолчанию отдаёт первое, и именно поэтому результат генерации выходит «похоже, но не то».

Разница видна по формату вывода. У ImagePrompt.org в интерфейсе есть отдельные режимы: «Общее описание», «Структурированный промт», «Графический дизайн», JSON, а также заточенные под конкретные модели — Flux, Midjourney и Stable Diffusion. Режим выбирается до нажатия кнопки, и от него зависит, получите вы предложение из двух строк или разложенный по параметрам блок.

Практический вывод: сначала решите, во что промт пойдёт дальше. Промт под Midjourney и промт под Stable Diffusion пишутся по-разному, и запрашивать их лучше сразу в нужном формате, а не переводить потом вручную. Если инструмент нужен ещё и для поиска исходного визуала и проверки источников, задача другая — там работают поисковые сервисы, а не генераторы промтов.

Как получить промт по картинке: пять способов

Способ 1. Describe в Midjourney

Describe в Midjourney: два пути к четырём промтам
Describe в Midjourney: два пути к четырём промтам

У Midjourney есть собственный реверс-промт — инструмент Describe. Документация описывает его так: он «анализирует загруженное изображение и предлагает слова и фразы, которые его описывают», а полученные подсказки «не скопируют изображение в точности». Отдельно оговорено, что Describe обновили — теперь он выдаёт более длинные и подробные промты под версии V8.1 и V8.2.

На сайте midjourney.com картинку перетаскивают на строку Imagine: всплывает панель «Drop image to describe», после отпускания на странице Create появляются четыре промта. Кнопка «Use Prompt» подставляет выбранный текст в строку запроса, «Run all prompts» запускает сразу все четыре. Второй путь — правый клик по любому изображению на страницах Create или Organize и пункт «Describe Image».

В Discord порядок другой: наберите «/» в поле сообщения, дождитесь списка команд, выберите /describe, укажите способ — файл с устройства (image) или ссылку (link), отправьте. Бот вернёт четыре варианта, пронумерованные кнопки запускают их по отдельности, кнопка обновления генерирует четыре новых.

Две детали из той же документации, о которых обычно узнают на практике. Повторный запуск Describe на одной и той же картинке даёт другой набор подсказок — значит, есть смысл прогнать файл дважды и собрать лучшее из двух выдач. И подсказки исчезают при обновлении страницы Create, поэтому копировать их надо сразу. Полное описание инструмента — в официальной документации Midjourney. Если промты нужны под конкретную задачу, а не «вообще», посмотрите разбор промтов Midjourney для целевых страниц.

Способ 2. Vision-режим чат-модели

Чат-модели с поддержкой изображений принимают файл прямо в диалоге и отвечают текстом любой формы: можно попросить не описание, а сразу промт под нужный генератор, на нужном языке и с нужными акцентами. Это самый гибкий путь и единственный, где вы управляете форматом вывода словами, а не выбором пресета.

Требования к файлу у OpenAI перечислены в руководстве по vision: принимаются PNG, JPEG, WEBP и неанимированный GIF; на запрос допускается до 512 МБ суммарного объёма и до 1500 изображений. Это лимиты API: ограничения загрузки в самом чате ChatGPT руководство не описывает, и переносить на браузерный интерфейс цифру 512 МБ нельзя. Отдельным пунктом идут условия к содержимому — «без водяных знаков и логотипов», «без NSFW-контента» и «достаточно чёткое, чтобы понял человек». Последнее объясняет половину неудач: скриншот из мессенджера, пересжатый до каши, разбирается плохо у любой модели.

Способ 3. GigaChat — российский сервис

GigaChat — разработка Сбера, распознавание изображений в нём описано в документации GigaChat API. Оттуда же ограничения: поддерживаются форматы jpeg, png, tiff и bmp, «максимальный размер одного изображения в запросе — 15 Мб», в одно сообщение кладётся только одна картинка, а в один запрос — «до 10 изображений, независимо от количества сообщений».

Практический смысл лимита в 10 изображений: за один заход можно отдать серию кадров и попросить общий стиль-промт для всей серии — так собирают единый визуальный язык для обложек курса или карточек товара. Как этот приём укладывается в подбор визуала под обучение, разобрано в материале о том, какие изображения работают в обучении.

Способ 4. Сервисы «изображение → промт»

Это узкоспециализированные генераторы: одна страница, поле загрузки, кнопка. Разберём класс на ImagePrompt.org — у него подробнее всех расписаны условия, и по ним видно, как устроены остальные.

Загрузка — PNG, JPG или WEBP до 4 МБ, файл можно перетащить, вставить из буфера через Ctrl+V или дать ссылкой. Язык вывода выбирается отдельно, русский в списке есть. Бесплатный тариф даёт 5 кредитов в день, обновление — ежедневное; платные планы на момент публикации стоят 14,99, 24,99 и 39,99 $ в месяц (Standard — 300 кредитов, Pro — 600, Ultimate — безлимит), годовой Ultimate — 249,9 $, то есть 20,82 $ в месяц. NSFW-загрузки блокируются, а сами файлы, по заявлению сервиса, обрабатываются временно и сразу удаляются. Тарифы сервис пересматривает — актуальные цифры держит официальная страница тарифов ImagePrompt.org: imageprompt.org/pricing.

Слабое место класса — тот самый дневной лимит: пять картинок в сутки хватает на пробу, но не на работу с серией. Второе — вывод фиксированного формата: что заложено в пресет, то и получите.

Способ 5. CLIP Interrogator — открытый код

CLIP Interrogator — открытый инструмент без тарифов и подписки: репозиторий pharmapsychotic/clip-interrogator на GitHub, лицензия MIT, пакет clip-interrogator в PyPI. Автор описывает его одной строкой — «Image to prompt with BLIP and CLIP»: связка модели CLIP от OpenAI и BLIP от Salesforce подбирает текст, который точнее всего соответствует загруженному изображению.

Запустить можно тремя путями, и подписки не требует ни один: демо-страница проекта на Hugging Face с готовым веб-интерфейсом, блокнот в Google Colab из того же репозитория и установка у себя через pip. Равными эти пути считать нельзя: демо работает на чужом хостинге и подчиняется его лимитам, а установка у себя означает, что зависимости вы собираете сами. Локальный запуск упирается в видеопамять: настройки по умолчанию требуют около 6,3 ГБ, режим низкого потребления — около 2,7 ГБ.

У инструмента есть возраст, и знать его стоит до установки: последний коммит в репозитории датирован 15 мая 2024 года, последний релиз пакета в PyPI — версия 0.6.0 от 20 марта 2023 года, README предписывает ставить clip-interrogator версии 0.5.4 и torch под CUDA 11.7, а рекомендации моделей адресованы Stable Diffusion 1.X и 2.0 — двум поколениям назад. Демо на Hugging Face при этом открывается и работает, а локальная установка на свежей машине может потребовать ручного подбора версий torch и transformers.

Модель под задачу выбирается руками: для промтов под Stable Diffusion 1.X в документации рекомендован ViT-L-14/openai, под Stable Diffusion 2.0 — ViT-H-14/laion2b_s32b_b79k. Это и есть цена бесплатности — настройка вместо кнопки. Зато нет ни подписки, ни зарубежной карты, ни дневного лимита кредитов: ограничивает ваше железо или квота бесплатного Colab.

Сравнение инструментов для промта по картинке

Инструмент Что возвращает Ограничения по файлу Бесплатный доступ
Midjourney Describe 4 варианта промта, каждый запуск — новый набор Загрузка файла или ссылка Нет, инструмент внутри платного аккаунта
Vision API OpenAI Любой формат, который попросите словами PNG, JPEG, WEBP, GIF без анимации; до 512 МБ и до 1500 изображений на запрос Нет, работа через API-ключ
ChatGPT в браузере То же самое, но диалогом Свои лимиты загрузки, руководство по API их не описывает Зависит от тарифа аккаунта
GigaChat Описание и промт на русском jpeg, png, tiff, bmp; до 15 Мб на изображение, до 10 за запрос Да, российский сервис
ImagePrompt.org Пресеты: общее описание, структурный промт, JSON, Flux, Midjourney, Stable Diffusion PNG, JPG, WEBP до 4 МБ 5 кредитов в день
CLIP Interrogator Строка-промт под Stable Diffusion, модель выбирается вручную Зависит от способа запуска: демо на Hugging Face, Colab или своя машина Да, открытый код под лицензией MIT

Как написать промт по картинке: пошагово

Маршрут: от картинки до готового промта
Маршрут: от картинки до готового промта

Шаг 1: выбор платформы

Отталкивайтесь от того, куда пойдёт промт. Рисуете в Midjourney — берите Describe, он говорит на языке своей же модели. Нужен промт под Stable Diffusion или Flux — подойдёт сервис с пресетом под конкретную модель. Работаете из России без зарубежной карты — GigaChat. Нужен полностью бесплатный вариант без подписки — CLIP Interrogator, если готовы запустить его сами. Нужен нестандартный формат вывода (таблица, JSON, промт на двух языках) — vision-модель в чате.

Шаг 2: загрузка изображения

Проверьте файл до загрузки. Лимиты жёсткие и разные: 4 МБ у ImagePrompt.org, 15 Мб на изображение у GigaChat API. Форматы тоже не совпадают — tiff и bmp принимает GigaChat, но не принимает ImagePrompt.org. Референс лучше давать в исходном разрешении: требование OpenAI «достаточно чёткое, чтобы понял человек» — не формальность, на замыленном кадре модель теряет фактуру и мелкие детали.

Шаг 3: получение чернового промта

На этом шаге вы получаете сырьё. Если инструмент даёт несколько вариантов — прогоните картинку дважды: Midjourney по документации на повторном запуске выдаёт другой набор из четырёх подсказок, и объединение двух выдач обычно точнее любой одной. В чат-модели вместо «опиши картинку» просите конкретное: «собери промт для Midjourney: объект, композиция, свет, объектив, стиль, палитра, настроение».

Шаг 4: редактирование и доработка промта

Черновик почти всегда описывает содержание и молчит про подачу. Добавьте то, чего инструмент не видит: задачу кадра (обложка, карточка товара, иллюстрация в статью), формат и пропорции, что должно остаться пустым под текст, чего быть не должно. Уберите из описания случайное — предмет на фоне, который попал в кадр, но в новой генерации не нужен.

Разбор картинки по слотам: из чего собирается промт

Восемь слотов промта: что закрывает инструмент, что человек
Восемь слотов промта: что закрывает инструмент, что человек

Чтобы понять, чего не хватает в черновике, сравните его с восемью слотами. Автоматический разбор закрывает обычно первые три, остальные дописывает человек.

Слот Что в нём Кто заполняет
Объект Кто или что в кадре, действие, поза Инструмент
Сцена и фон Место, время суток, погода, окружение Инструмент
Палитра Цвета, контраст, доминирующий оттенок Инструмент
Свет Источник, направление, жёсткость, тени Частично инструмент
Ракурс и оптика Высота камеры, план, фокусное расстояние, глубина резкости Человек
Стиль Фотография, 3D, иллюстрация, гравюра, конкретная техника Частично инструмент
Задача кадра Обложка, баннер, карточка, место под заголовок Человек
Ограничения Пропорции, чего не должно быть в кадре Человек

Пройдите по таблице сверху вниз и допишите пустое — это и есть вся доработка. Из бесплатных инструментов для такой сборки удобны те же, что и для остальной визуальной рутины: подборка бесплатных нейросетей для фото, обложек и превью закрывает соседние задачи.

РОССИЙСКИЕ НЕЙРОСЕТИ ДЛЯ ЖИЗНИ И КАРЬЕРЫ В 2025
Присоединяйся к онлайн-вебинару.
В прямом эфире разберем и потестируем лучшие на сегодняшний день отечественные ИИ!
Вы узнаете о том:
  • Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
  • Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
  • Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
Участвовать бесплатно
ОБЗОРНЫЙ ПРАКТИКУМ ПО НАШУМЕВШИМ НЕЙРОСЕТЯМ
Нейросети DEEPSEEK И QWEN
За 2 часа сделаем полный обзор новых мощных ИИ-моделей, которые бросают вызов нейросети ChatGPT
Вы узнаете:
  • Возможность получить Доступ в Нейроклуб на целый месяц
  • Как ИИ ускоряет работу и приносит деньги
  • За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Участвовать бесплатно

Примеры написания промта

Пример 1: пейзаж

Исходное изображение: закат над морем с силуэтами пальм.

Черновик, какой обычно приходит от автоматического разбора: «Закат над морем с пальмами». Три слота из восьми — объект, сцена, отчасти палитра.

Доработанный промт: «Закат над спокойным морем, силуэты высоких пальм на переднем плане, небо в оранжево-розовом градиенте, редкие облака у горизонта; съёмка с уровня воды, длинный фокус, тёплый контровой свет, лёгкая дымка; горизонтальный кадр 16:9, правая треть свободна под заголовок; без людей и лодок в кадре».

Дописано ровно то, что стояло в таблице пустым: ракурс и оптика, характер света, задача кадра и ограничения.

Пример 2: портрет

Исходное изображение: портрет девушки в красном платье на фоне осеннего парка.

Черновик: «Девушка в красном платье в парке».

Доработанный промт: «Портрет молодой женщины с длинными волосами в красном платье, осенний парк с золотой листвой на фоне, спокойная полуулыбка; поясной план, фокусное 85 мм, размытый фон, мягкий рассеянный свет пасмурного дня; вертикальный кадр 4:5, взгляд в камеру; без резких теней на лице».

Разница между двумя версиями — не в длине. Первый вариант описывает, что было; второй задаёт, как это снять заново.

Почему промт по картинке не повторяет оригинал

Ожидание «загружу картинку — получу её же» не сбывается, и это не дефект конкретного сервиса. Midjourney пишет об этом прямым текстом: Describe — инструмент, который «может направить вашу креативность, но предложенные промты не скопируют ваше изображение в точности».

Причина в том, что модель читает картинку не так, как человек. В руководстве OpenAI по vision перечислены известные ограничения, и почти каждое бьёт по задаче реверс-промта:

  • текст нелатинскими алфавитами читается хуже: «модель может работать неоптимально с изображениями, где текст набран нелатинским алфавитом, например японским или корейским» — кириллическая надпись на картинке попадает в тот же класс;
  • счёт объектов приблизительный — «модель может дать приблизительное количество объектов»;
  • повёрнутые и перевёрнутые изображения и текст распознаются с ошибками;
  • мелкий текст в кадре читается плохо, его рекомендуют увеличивать;
  • графики и линии разных стилей — сплошные, пунктирные, точечные — модель различает неуверенно;
  • точная пространственная привязка даётся тяжело: пример из документации — расстановка фигур на шахматной доске;
  • панорамные кадры и «рыбий глаз» разбираются плохо;
  • описания и подписи в отдельных случаях просто неверны.

Отсюда рабочая привычка: считаемое (сколько предметов, где именно они стоят, что написано на вывеске) проверять глазами и вписывать в промт руками. Всё остальное — свет, палитру, стиль — можно доверить автоматике. Подробности по форматам и ограничениям есть в руководстве OpenAI по работе с изображениями.

Советы по промптингу

  1. Просите формат, а не описание. «Собери промт для Stable Diffusion» и «опиши картинку» дают разный вывод при одном и том же файле.
  2. Прогоняйте картинку дважды и склеивайте выдачи: у Midjourney повторный Describe заведомо даёт другой набор из четырёх подсказок.
  3. Копируйте результат сразу. Подсказки Describe пропадают при обновлении страницы Create.
  4. Держите под рукой лимиты: 4 МБ у ImagePrompt.org, 15 Мб на изображение у GigaChat, 5 бесплатных кредитов в сутки.
  5. Убирайте из промта то, чего не должно быть в новой картинке. Автоматический разбор описывает кадр целиком, включая случайное.
  6. Сверяйте числа и текст на изображении вручную — по документации OpenAI это самая слабая зона распознавания.

Промт по картинке — это не кнопка, а два действия: получить черновик у инструмента и закрыть в нём пустые слоты. Первое занимает секунды, второе решает результат. Схема-маршрут выше собирает оба шага в один порядок, а таблица сравнения помогает выбрать инструмент под доступ и формат вывода, которые нужны именно вам.

Частые вопросы

Можно ли получить промт по картинке бесплатно? Да. ImagePrompt.org даёт 5 бесплатных кредитов в сутки, обновляются они ежедневно. GigaChat — российский сервис Сбера, распознавание изображений у него описано в документации API. Describe в Midjourney работает внутри платного аккаунта.

Какой формат и размер файла принимают инструменты? ImagePrompt.org — PNG, JPG и WEBP до 4 МБ. GigaChat API — jpeg, png, tiff, bmp, до 15 Мб на изображение и до 10 изображений за запрос. OpenAI — PNG, JPEG, WEBP и неанимированный GIF.

Почему сгенерированная по промту картинка не совпадает с оригиналом? Так работают все реверс-промты. Midjourney указывает в документации, что подсказки Describe не копируют изображение в точности, а OpenAI перечисляет ограничения распознавания: приблизительный счёт объектов, ошибки на повёрнутых кадрах и мелком тексте, слабая пространственная привязка.

Чем описание изображения отличается от промта для генерации? Описание отвечает на вопрос «что в кадре», промт — «как это нарисовать заново»: в него добавляют ракурс, оптику, характер света, задачу кадра и ограничения.

Читайте также

3 материала