Содержание
- Что такое промт по картинке и зачем он нужен
- Как получить промт по картинке: пять способов
- Сравнение инструментов для промта по картинке
- Как написать промт по картинке: пошагово
- Разбор картинки по слотам: из чего собирается промт
- Примеры написания промта
- Почему промт по картинке не повторяет оригинал
- Советы по промптингу
- Частые вопросы
Как написать промт по картинке
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Промт по картинке получают двумя путями: через встроенный реверс-промт самого генератора (в Midjourney это инструмент Describe, он возвращает четыре варианта) или через vision-модель, которой изображение отдают файлом — ChatGPT, GigaChat, отдельные сервисы вроде ImagePrompt.org. Любой из них выдаёт черновик: описание того, что видно, а не готовое задание на генерацию. Рабочим промт становится после правки — ниже разобрано, где взять черновик, что в нём дописать и почему точная копия оригинала не получится.
- Реверс-промт внутри генератора: Describe в Midjourney, четыре варианта на одну картинку.
- Vision-модель: загрузили файл, попросили описать сцену, свет, ракурс и стиль.
- Сервисы «изображение → промт»: быстрее всего, но упираются в дневной лимит бесплатного тарифа.
- Открытый CLIP Interrogator: без подписки и карты, но запускать его придётся самому — в браузерном демо, Colab или у себя.
- Автоматический результат — заготовка. Дописывать приходится задачу кадра, формат и ограничения.
- Совпадения один в один не будет ни у одного инструмента: это заявлено в документации самих платформ.
Что такое промт по картинке и зачем он нужен
Промт — текстовый запрос, по которому нейросеть рисует изображение. Промт по картинке — тот же запрос, но собранный не с нуля, а из разбора готового референса: вы отдаёте файл, инструмент возвращает текст, этот текст вы правите и отправляете в генератор. Запрос «промт на фото» означает то же самое: для инструмента фотография — такое же изображение, как рисунок, скриншот или кадр из видео.
Здесь легко попасть в ловушку. Инструменты решают две разные задачи. Первая — описание изображения (image captioning): что за объект, где стоит, какого цвета. Вторая — промт для генерации: то же самое плюс тип съёмки, свет, объектив, стиль, композиция и ограничения. Первое отвечает на вопрос «что на фото», второе — «как это нарисовать заново». Большинство бесплатных сервисов по умолчанию отдаёт первое, и именно поэтому результат генерации выходит «похоже, но не то».
Разница видна по формату вывода. У ImagePrompt.org в интерфейсе есть отдельные режимы: «Общее описание», «Структурированный промт», «Графический дизайн», JSON, а также заточенные под конкретные модели — Flux, Midjourney и Stable Diffusion. Режим выбирается до нажатия кнопки, и от него зависит, получите вы предложение из двух строк или разложенный по параметрам блок.
Практический вывод: сначала решите, во что промт пойдёт дальше. Промт под Midjourney и промт под Stable Diffusion пишутся по-разному, и запрашивать их лучше сразу в нужном формате, а не переводить потом вручную. Если инструмент нужен ещё и для поиска исходного визуала и проверки источников, задача другая — там работают поисковые сервисы, а не генераторы промтов.
Как получить промт по картинке: пять способов
Способ 1. Describe в Midjourney

У Midjourney есть собственный реверс-промт — инструмент Describe. Документация описывает его так: он «анализирует загруженное изображение и предлагает слова и фразы, которые его описывают», а полученные подсказки «не скопируют изображение в точности». Отдельно оговорено, что Describe обновили — теперь он выдаёт более длинные и подробные промты под версии V8.1 и V8.2.
На сайте midjourney.com картинку перетаскивают на строку Imagine: всплывает панель «Drop image to describe», после отпускания на странице Create появляются четыре промта. Кнопка «Use Prompt» подставляет выбранный текст в строку запроса, «Run all prompts» запускает сразу все четыре. Второй путь — правый клик по любому изображению на страницах Create или Organize и пункт «Describe Image».
В Discord порядок другой: наберите «/» в поле сообщения, дождитесь списка команд, выберите /describe, укажите способ — файл с устройства (image) или ссылку (link), отправьте. Бот вернёт четыре варианта, пронумерованные кнопки запускают их по отдельности, кнопка обновления генерирует четыре новых.
Две детали из той же документации, о которых обычно узнают на практике. Повторный запуск Describe на одной и той же картинке даёт другой набор подсказок — значит, есть смысл прогнать файл дважды и собрать лучшее из двух выдач. И подсказки исчезают при обновлении страницы Create, поэтому копировать их надо сразу. Полное описание инструмента — в официальной документации Midjourney. Если промты нужны под конкретную задачу, а не «вообще», посмотрите разбор промтов Midjourney для целевых страниц.
Способ 2. Vision-режим чат-модели
Чат-модели с поддержкой изображений принимают файл прямо в диалоге и отвечают текстом любой формы: можно попросить не описание, а сразу промт под нужный генератор, на нужном языке и с нужными акцентами. Это самый гибкий путь и единственный, где вы управляете форматом вывода словами, а не выбором пресета.
Требования к файлу у OpenAI перечислены в руководстве по vision: принимаются PNG, JPEG, WEBP и неанимированный GIF; на запрос допускается до 512 МБ суммарного объёма и до 1500 изображений. Это лимиты API: ограничения загрузки в самом чате ChatGPT руководство не описывает, и переносить на браузерный интерфейс цифру 512 МБ нельзя. Отдельным пунктом идут условия к содержимому — «без водяных знаков и логотипов», «без NSFW-контента» и «достаточно чёткое, чтобы понял человек». Последнее объясняет половину неудач: скриншот из мессенджера, пересжатый до каши, разбирается плохо у любой модели.
Способ 3. GigaChat — российский сервис
GigaChat — разработка Сбера, распознавание изображений в нём описано в документации GigaChat API. Оттуда же ограничения: поддерживаются форматы jpeg, png, tiff и bmp, «максимальный размер одного изображения в запросе — 15 Мб», в одно сообщение кладётся только одна картинка, а в один запрос — «до 10 изображений, независимо от количества сообщений».
Практический смысл лимита в 10 изображений: за один заход можно отдать серию кадров и попросить общий стиль-промт для всей серии — так собирают единый визуальный язык для обложек курса или карточек товара. Как этот приём укладывается в подбор визуала под обучение, разобрано в материале о том, какие изображения работают в обучении.
Способ 4. Сервисы «изображение → промт»
Это узкоспециализированные генераторы: одна страница, поле загрузки, кнопка. Разберём класс на ImagePrompt.org — у него подробнее всех расписаны условия, и по ним видно, как устроены остальные.
Загрузка — PNG, JPG или WEBP до 4 МБ, файл можно перетащить, вставить из буфера через Ctrl+V или дать ссылкой. Язык вывода выбирается отдельно, русский в списке есть. Бесплатный тариф даёт 5 кредитов в день, обновление — ежедневное; платные планы на момент публикации стоят 14,99, 24,99 и 39,99 $ в месяц (Standard — 300 кредитов, Pro — 600, Ultimate — безлимит), годовой Ultimate — 249,9 $, то есть 20,82 $ в месяц. NSFW-загрузки блокируются, а сами файлы, по заявлению сервиса, обрабатываются временно и сразу удаляются. Тарифы сервис пересматривает — актуальные цифры держит официальная страница тарифов ImagePrompt.org: imageprompt.org/pricing.
Слабое место класса — тот самый дневной лимит: пять картинок в сутки хватает на пробу, но не на работу с серией. Второе — вывод фиксированного формата: что заложено в пресет, то и получите.
Способ 5. CLIP Interrogator — открытый код
CLIP Interrogator — открытый инструмент без тарифов и подписки: репозиторий pharmapsychotic/clip-interrogator на GitHub, лицензия MIT, пакет clip-interrogator в PyPI. Автор описывает его одной строкой — «Image to prompt with BLIP and CLIP»: связка модели CLIP от OpenAI и BLIP от Salesforce подбирает текст, который точнее всего соответствует загруженному изображению.
Запустить можно тремя путями, и подписки не требует ни один: демо-страница проекта на Hugging Face с готовым веб-интерфейсом, блокнот в Google Colab из того же репозитория и установка у себя через pip. Равными эти пути считать нельзя: демо работает на чужом хостинге и подчиняется его лимитам, а установка у себя означает, что зависимости вы собираете сами. Локальный запуск упирается в видеопамять: настройки по умолчанию требуют около 6,3 ГБ, режим низкого потребления — около 2,7 ГБ.
У инструмента есть возраст, и знать его стоит до установки: последний коммит в репозитории датирован 15 мая 2024 года, последний релиз пакета в PyPI — версия 0.6.0 от 20 марта 2023 года, README предписывает ставить clip-interrogator версии 0.5.4 и torch под CUDA 11.7, а рекомендации моделей адресованы Stable Diffusion 1.X и 2.0 — двум поколениям назад. Демо на Hugging Face при этом открывается и работает, а локальная установка на свежей машине может потребовать ручного подбора версий torch и transformers.
Модель под задачу выбирается руками: для промтов под Stable Diffusion 1.X в документации рекомендован ViT-L-14/openai, под Stable Diffusion 2.0 — ViT-H-14/laion2b_s32b_b79k. Это и есть цена бесплатности — настройка вместо кнопки. Зато нет ни подписки, ни зарубежной карты, ни дневного лимита кредитов: ограничивает ваше железо или квота бесплатного Colab.
Сравнение инструментов для промта по картинке
| Инструмент | Что возвращает | Ограничения по файлу | Бесплатный доступ |
|---|---|---|---|
| Midjourney Describe | 4 варианта промта, каждый запуск — новый набор | Загрузка файла или ссылка | Нет, инструмент внутри платного аккаунта |
| Vision API OpenAI | Любой формат, который попросите словами | PNG, JPEG, WEBP, GIF без анимации; до 512 МБ и до 1500 изображений на запрос | Нет, работа через API-ключ |
| ChatGPT в браузере | То же самое, но диалогом | Свои лимиты загрузки, руководство по API их не описывает | Зависит от тарифа аккаунта |
| GigaChat | Описание и промт на русском | jpeg, png, tiff, bmp; до 15 Мб на изображение, до 10 за запрос | Да, российский сервис |
| ImagePrompt.org | Пресеты: общее описание, структурный промт, JSON, Flux, Midjourney, Stable Diffusion | PNG, JPG, WEBP до 4 МБ | 5 кредитов в день |
| CLIP Interrogator | Строка-промт под Stable Diffusion, модель выбирается вручную | Зависит от способа запуска: демо на Hugging Face, Colab или своя машина | Да, открытый код под лицензией MIT |
Как написать промт по картинке: пошагово

Шаг 1: выбор платформы
Отталкивайтесь от того, куда пойдёт промт. Рисуете в Midjourney — берите Describe, он говорит на языке своей же модели. Нужен промт под Stable Diffusion или Flux — подойдёт сервис с пресетом под конкретную модель. Работаете из России без зарубежной карты — GigaChat. Нужен полностью бесплатный вариант без подписки — CLIP Interrogator, если готовы запустить его сами. Нужен нестандартный формат вывода (таблица, JSON, промт на двух языках) — vision-модель в чате.
Шаг 2: загрузка изображения
Проверьте файл до загрузки. Лимиты жёсткие и разные: 4 МБ у ImagePrompt.org, 15 Мб на изображение у GigaChat API. Форматы тоже не совпадают — tiff и bmp принимает GigaChat, но не принимает ImagePrompt.org. Референс лучше давать в исходном разрешении: требование OpenAI «достаточно чёткое, чтобы понял человек» — не формальность, на замыленном кадре модель теряет фактуру и мелкие детали.
Шаг 3: получение чернового промта
На этом шаге вы получаете сырьё. Если инструмент даёт несколько вариантов — прогоните картинку дважды: Midjourney по документации на повторном запуске выдаёт другой набор из четырёх подсказок, и объединение двух выдач обычно точнее любой одной. В чат-модели вместо «опиши картинку» просите конкретное: «собери промт для Midjourney: объект, композиция, свет, объектив, стиль, палитра, настроение».
Шаг 4: редактирование и доработка промта
Черновик почти всегда описывает содержание и молчит про подачу. Добавьте то, чего инструмент не видит: задачу кадра (обложка, карточка товара, иллюстрация в статью), формат и пропорции, что должно остаться пустым под текст, чего быть не должно. Уберите из описания случайное — предмет на фоне, который попал в кадр, но в новой генерации не нужен.
Разбор картинки по слотам: из чего собирается промт

Чтобы понять, чего не хватает в черновике, сравните его с восемью слотами. Автоматический разбор закрывает обычно первые три, остальные дописывает человек.
| Слот | Что в нём | Кто заполняет |
|---|---|---|
| Объект | Кто или что в кадре, действие, поза | Инструмент |
| Сцена и фон | Место, время суток, погода, окружение | Инструмент |
| Палитра | Цвета, контраст, доминирующий оттенок | Инструмент |
| Свет | Источник, направление, жёсткость, тени | Частично инструмент |
| Ракурс и оптика | Высота камеры, план, фокусное расстояние, глубина резкости | Человек |
| Стиль | Фотография, 3D, иллюстрация, гравюра, конкретная техника | Частично инструмент |
| Задача кадра | Обложка, баннер, карточка, место под заголовок | Человек |
| Ограничения | Пропорции, чего не должно быть в кадре | Человек |
Пройдите по таблице сверху вниз и допишите пустое — это и есть вся доработка. Из бесплатных инструментов для такой сборки удобны те же, что и для остальной визуальной рутины: подборка бесплатных нейросетей для фото, обложек и превью закрывает соседние задачи.
- Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
- Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
- Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
- Возможность получить Доступ в Нейроклуб на целый месяц
- Как ИИ ускоряет работу и приносит деньги
- За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Примеры написания промта
Пример 1: пейзаж
Исходное изображение: закат над морем с силуэтами пальм.
Черновик, какой обычно приходит от автоматического разбора: «Закат над морем с пальмами». Три слота из восьми — объект, сцена, отчасти палитра.
Доработанный промт: «Закат над спокойным морем, силуэты высоких пальм на переднем плане, небо в оранжево-розовом градиенте, редкие облака у горизонта; съёмка с уровня воды, длинный фокус, тёплый контровой свет, лёгкая дымка; горизонтальный кадр 16:9, правая треть свободна под заголовок; без людей и лодок в кадре».
Дописано ровно то, что стояло в таблице пустым: ракурс и оптика, характер света, задача кадра и ограничения.
Пример 2: портрет
Исходное изображение: портрет девушки в красном платье на фоне осеннего парка.
Черновик: «Девушка в красном платье в парке».
Доработанный промт: «Портрет молодой женщины с длинными волосами в красном платье, осенний парк с золотой листвой на фоне, спокойная полуулыбка; поясной план, фокусное 85 мм, размытый фон, мягкий рассеянный свет пасмурного дня; вертикальный кадр 4:5, взгляд в камеру; без резких теней на лице».
Разница между двумя версиями — не в длине. Первый вариант описывает, что было; второй задаёт, как это снять заново.
Почему промт по картинке не повторяет оригинал
Ожидание «загружу картинку — получу её же» не сбывается, и это не дефект конкретного сервиса. Midjourney пишет об этом прямым текстом: Describe — инструмент, который «может направить вашу креативность, но предложенные промты не скопируют ваше изображение в точности».
Причина в том, что модель читает картинку не так, как человек. В руководстве OpenAI по vision перечислены известные ограничения, и почти каждое бьёт по задаче реверс-промта:
- текст нелатинскими алфавитами читается хуже: «модель может работать неоптимально с изображениями, где текст набран нелатинским алфавитом, например японским или корейским» — кириллическая надпись на картинке попадает в тот же класс;
- счёт объектов приблизительный — «модель может дать приблизительное количество объектов»;
- повёрнутые и перевёрнутые изображения и текст распознаются с ошибками;
- мелкий текст в кадре читается плохо, его рекомендуют увеличивать;
- графики и линии разных стилей — сплошные, пунктирные, точечные — модель различает неуверенно;
- точная пространственная привязка даётся тяжело: пример из документации — расстановка фигур на шахматной доске;
- панорамные кадры и «рыбий глаз» разбираются плохо;
- описания и подписи в отдельных случаях просто неверны.
Отсюда рабочая привычка: считаемое (сколько предметов, где именно они стоят, что написано на вывеске) проверять глазами и вписывать в промт руками. Всё остальное — свет, палитру, стиль — можно доверить автоматике. Подробности по форматам и ограничениям есть в руководстве OpenAI по работе с изображениями.
Советы по промптингу
- Просите формат, а не описание. «Собери промт для Stable Diffusion» и «опиши картинку» дают разный вывод при одном и том же файле.
- Прогоняйте картинку дважды и склеивайте выдачи: у Midjourney повторный Describe заведомо даёт другой набор из четырёх подсказок.
- Копируйте результат сразу. Подсказки Describe пропадают при обновлении страницы Create.
- Держите под рукой лимиты: 4 МБ у ImagePrompt.org, 15 Мб на изображение у GigaChat, 5 бесплатных кредитов в сутки.
- Убирайте из промта то, чего не должно быть в новой картинке. Автоматический разбор описывает кадр целиком, включая случайное.
- Сверяйте числа и текст на изображении вручную — по документации OpenAI это самая слабая зона распознавания.
Промт по картинке — это не кнопка, а два действия: получить черновик у инструмента и закрыть в нём пустые слоты. Первое занимает секунды, второе решает результат. Схема-маршрут выше собирает оба шага в один порядок, а таблица сравнения помогает выбрать инструмент под доступ и формат вывода, которые нужны именно вам.
Частые вопросы
Можно ли получить промт по картинке бесплатно? Да. ImagePrompt.org даёт 5 бесплатных кредитов в сутки, обновляются они ежедневно. GigaChat — российский сервис Сбера, распознавание изображений у него описано в документации API. Describe в Midjourney работает внутри платного аккаунта.
Какой формат и размер файла принимают инструменты? ImagePrompt.org — PNG, JPG и WEBP до 4 МБ. GigaChat API — jpeg, png, tiff, bmp, до 15 Мб на изображение и до 10 изображений за запрос. OpenAI — PNG, JPEG, WEBP и неанимированный GIF.
Почему сгенерированная по промту картинка не совпадает с оригиналом? Так работают все реверс-промты. Midjourney указывает в документации, что подсказки Describe не копируют изображение в точности, а OpenAI перечисляет ограничения распознавания: приблизительный счёт объектов, ошибки на повёрнутых кадрах и мелком тексте, слабая пространственная привязка.
Чем описание изображения отличается от промта для генерации? Описание отвечает на вопрос «что в кадре», промт — «как это нарисовать заново»: в него добавляют ракурс, оптику, характер света, задачу кадра и ограничения.
