Что такое промпт и почему он важен
Промпт — это текстовое описание, которое вы передаёте нейросети, чтобы она создала изображение. В Stable Diffusion промпт работает как кисть художника: от того, насколько точно и подробно вы опишете замысел, зависит, насколько результат совпадёт с ожиданиями. Если написать просто «cat», нейросеть выдаст кошку случайного цвета, размера и позы, возможно, с лишними элементами. Но если добавить детали — «a sleeping cat with white paws on a windowsill, soft lighting, realistic style» — результат станет предсказуемее.
Важно понимать: Stable Diffusion не понимает абстрактные понятия и не читает мысли. Если вы пишете «дедушка в комнате», нейросеть может нарисовать дедушку на полу, потому что не уточнено, где именно он находится. Лучше сформулировать: «дедушка сидит на стуле в комнате». Аналогично, фраза «девушка сидит в комнате у стены, на улице идёт дождь» не покажет дождь, потому что стена его скрывает. Правильнее: «девушка сидит на стуле у окна, за окном идёт дождь».
Промпт — это не просто список слов, а инструмент управления вниманием нейросети. Чем раньше в запросе стоит слово, тем больший вес оно имеет. Поэтому в начале ставят главный объект, затем его характеристики, окружение, стиль и детали. Например: «девушка, солнечный летний день, озеро, голубое небо, облака» — здесь девушка будет центральным элементом, а пейзаж — фоном.
Также важно избегать двусмысленностей и противоречий. Нельзя описывать предмет одновременно как «длинный и короткий» — нейросеть не сможет выбрать. Вместо «майский дождь» лучше написать «красивый пейзаж, весна, тепло, идёт дождь», потому что дождь сам по себе не имеет сезона, а весеннюю атмосферу можно передать через другие детали.
Структура хорошего промпта: от объекта до качества
Чтобы промпт был эффективным, его стоит строить по определённой схеме. Обычно выделяют несколько ключевых блоков:
- Объект — кто или что изображено: cat, girl, spaceship.
- Характеристики объекта — одежда, поза, цвет, выражение: wearing boots, smiling, red dress.
- Окружение — где происходит действие: on a table, in a forest, underwater.
- Стиль и тип изображения — digital painting, 3D render, pixel art, oil painting.
- Свет и атмосфера — dramatic lighting, fog, sunset, soft light.
- Качество — high quality, ultra detailed, 8K, masterpiece.
Начинайте с простых запросов с одним объектом, постепенно добавляя детали. Например, сначала «девушка, озеро, лето», затем «девушка в белом платье, сидит на берегу озера, солнечный день, лёгкий ветер, фотореализм, высокое качество». Так вы сможете контролировать, как каждое слово влияет на результат.
Важно помнить, что Stable Diffusion придаёт больше значения словам в начале запроса. Если вы хотите, чтобы главным был объект, ставьте его первым. Если важна атмосфера, можно начать с неё, но тогда объект может отойти на второй план. Экспериментируйте с порядком слов, чтобы найти оптимальный баланс.
Также полезно использовать готовые промпты из коллекций и адаптировать их под свои задачи. Это помогает быстрее понять, как разные формулировки влияют на результат, и избежать типичных ошибок новичков.
Веса токенов: как усилить или ослабить элементы
В Stable Diffusion каждое слово или фраза в промпте называется токеном. По умолчанию все токены имеют одинаковый вес, но вы можете управлять их важностью, чтобы подчеркнуть нужные детали или, наоборот, уменьшить влияние второстепенных.
Самый простой способ — использовать круглые скобки. Чем больше скобок вокруг слова, тем выше его приоритет:
(black boots)— +10% к важности((black boots))— +20%(((black boots)))— +30–40%
Однако перебарщивать не стоит: слишком сильное усиление может привести к искажениям или к тому, что второстепенный элемент станет доминирующим. Например, если в запросе «кот в сапогах» поставить три скобки на слове «сапоги», нейросеть может нарисовать только сапоги, забыв про кота.
Более точный способ — указать числовой вес через двоеточие: (black boots:1.3) — повышает важность, (white background:0.6) — понижает. Обычно начинают с 1.3 и редко поднимают выше 1.5, чтобы избежать деформаций. Если промпт очень длинный, можно повышать веса почти каждого токена, но это требует опыта и аккуратности.
Также существуют квадратные скобки для смешивания или ослабления. Например, [cat:dog:0.3] создаёт гибрид: сначала рисуется кот, затем на 30% процесса он превращается в собаку. Это удобно для создания химер или уникальных лиц, например [Мона Лиза:Анжелина Джоли:0.3]. Квадратные скобки без чисел, например [fog:0.4], уменьшают значимость элемента — туман будет, но не затмит главный объект.
Негативный промпт: что исключить из изображения
Негативный промпт — это список того, чего вы не хотите видеть на изображении. Он задаётся отдельно от основного запроса и помогает убрать нежелательные артефакты, такие как размытие, водяные знаки, текст, лишние объекты или искажения.
Типичные слова для негативного промпта: blurry, watermark, text, out of frame, low quality, deformed, extra limbs, bad anatomy. В зависимости от модели и задачи список можно расширять. Например, если вы генерируете портрет, стоит добавить extra fingers, missing fingers, mutated hands.
В негативном промпте также можно использовать веса и скобки, чтобы усилить исключение. Например, (((белый цвет))) в негативном промпте гарантирует, что белого цвета на изображении не будет.
Важно помнить, что негативный промпт не всегда работает идеально. Некоторые модели могут игнорировать отдельные слова, поэтому лучше комбинировать несколько синонимов. Также не стоит перегружать негативный промпт — это может ухудшить качество генерации.
Пример использования: основной промпт «парус одинокий на фоне моря голубом», негативный промпт (((белый цвет))) — и парусник будет не белым, а, например, красным или чёрным.
Стили и модели: как выбрать подходящую
Stable Diffusion имеет множество моделей, каждая из которых обучена на разных наборах данных и лучше подходит для определённых стилей. Например, SDXL Juggernaut отлично справляется с фотореалистичными изображениями и портретами, а VelaMix и DarkSushi — популярные аниме-модели.
Выбор модели зависит от вашей задачи. Если нужен реализм — выбирайте фотореалистичные модели. Для иллюстраций, комиксов или аниме — специализированные. Многие онлайн-сервисы и Telegram-боты позволяют переключать модели прямо в интерфейсе, что упрощает эксперименты.
Помимо моделей, важны стили. В промпте можно указать стиль художника или направление: by Leonardo da Vinci, in style of H.R. Giger, watercolor, impasto, surrealist. Однако для точной имитации стиля может потребоваться отключить принудительные стили, которые некоторые сервисы добавляют по умолчанию.
Также существуют LoRA (Low-Rank Adaptation) — небольшие обученные модули, которые добавляют конкретные стили, персонажей или объекты. Например, LoRA для комиксов или для реалистичной текстуры кожи. Они загружаются в модель и позволяют получать стабильные результаты без сложных промптов.
Экспериментируйте с разными моделями и стилями, чтобы найти те, которые лучше всего подходят под ваши задачи. Не бойтесь смешивать стили и техники — это часто даёт неожиданные и интересные результаты.
Практические примеры промптов для разных задач
Рассмотрим несколько примеров промптов, которые можно использовать как отправную точку.
Фотореалистичный портрет: a pretty woman dressed in a black and bright red, (black swan feather dress), glowing red eyes, beautiful female vampire, professional photo, ultra detailed, 8K
Зомби в постапокалипсисе: A terrifying Zombie, menacing pose, decaying green skin, glowing yellow eyes, patchy black hair, torn and blood-stained clothing, post-apocalyptic wasteland setting, dimly lit with flickering candles, photorealistic rendering, by H.R. Giger, ultra-HD
Ковбой в стиле вестерн: A rugged cowboy, riding pose, sun-kissed skin, blue eyes, sandy-brown hair, leather jacket, wild west setting, on top of a mountain, vintage style, golden hour lighting, watercolor format, impasto technique, by Leonardo da Vinci, high definition
Ребёнок-вампир в сюрреалистическом стиле: Vampire child, head-on view, mischievous smile, translucent skin showing playful freckles, sky-blue eyes with a hint of malice, carrot-top hair messy and short, tattered street urchin clothes, (abandoned amusement park:1.3), (surrealist:1.4), (by Dalí and Caravaggio:1.2), 24K vibrant
Охотница на вампиров: Vampire huntress, three-quarter view, dynamic combat stance, bronzed skin slight glow, glowing amber eyes, platinum blonde hair in a battle braid, leather battle attire with red accents, (rain-soaked alleyway:1.1), (crouched on a roof:1.3), (dark fantasy:1.5), (by Frazetta and Brom:1.4), 16K fine detail
Эти примеры показывают, как можно комбинировать объект, характеристики, окружение, стиль и веса для достижения нужного эффекта. Начните с них, а затем адаптируйте под свои идеи.
Частые ошибки и как их избежать
Новички часто допускают одни и те же ошибки при составлении промптов. Вот основные из них и способы их избежать.
Слишком короткий запрос. Если написать просто «девушка», нейросеть выдаст случайный результат. Решение: добавляйте детали — позу, одежду, окружение, стиль.
Абстрактные понятия. Слова вроде «красиво», «стильно», «майский дождь» нейросеть не понимает буквально. Решение: описывайте конкретные визуальные признаки — «красивый пейзаж, весна, тепло, идёт дождь».
Неоднозначность. Фраза «дедушка в комнате» может быть интерпретирована по-разному. Решение: уточняйте положение и действия — «дедушка сидит на стуле в комнате».
Игнорирование негативного промпта. Без него на изображении могут появиться водяные знаки, текст или искажения. Решение: всегда добавляйте базовый негативный промпт.
Перегрузка весами. Слишком много скобок или высокие веса приводят к деформациям. Решение: начинайте с 1.3 и повышайте только при необходимости.
Неправильный порядок слов. Если главный объект стоит в конце, он может потеряться. Решение: ставьте ключевые элементы в начало промпта.
Избегая этих ошибок, вы значительно повысите точность генераций и сэкономите время.
Инструменты и сервисы для работы с Stable Diffusion
Stable Diffusion можно использовать как локально, так и через онлайн-сервисы. Локальная установка даёт полный контроль над моделями и настройками, но требует мощного компьютера с видеокартой. Онлайн-сервисы и Telegram-боты удобны для быстрых экспериментов, но могут иметь ограничения по длине промпта и доступным моделям.
Популярные интерфейсы для локального запуска: Automatic1111 WebUI, ComfyUI. Они позволяют настраивать сэмплеры, шаги, размеры изображения, использовать LoRA и другие расширения. Для новичков проще начать с онлайн-решений, где всё настроено по умолчанию.
При выборе сервиса обратите внимание на доступные модели и стили. Некоторые боты поддерживают несколько моделей, например SDXL Juggernaut, VelaMix, DarkSushi, и позволяют переключать их в один клик. Также важна возможность задавать негативный промпт и веса токенов.
Для поиска готовых промптов и LoRA существуют сайты вроде Civitai.com, где пользователи делятся своими наработками. Это отличный источник вдохновения и готовых решений. Однако помните, что чужие промпты могут не работать идеально на вашей модели — адаптируйте их под свои задачи.
Экспериментируйте с разными инструментами, чтобы найти те, которые максимально соответствуют вашим потребностям и уровню подготовки.
Как улучшить результат: советы по итерациям
Генерация изображений — это итеративный процесс. Редко удаётся получить идеальный результат с первого раза. Вот несколько советов, как улучшать изображения.
Анализируйте результат. Сравните полученное изображение с промптом. Какие элементы удались, какие нет? Возможно, нейросеть проигнорировала какой-то токен — тогда его нужно усилить или переместить в начало.
Используйте img2img. Если у вас есть набросок или фотография, загрузите её в режим Image-to-Image. Нейросеть трансформирует её в соответствии с промптом, что даёт больше контроля над композицией.
Меняйте сэмплер и шаги. Разные сэмплеры (DPM++ 2M Karras, UniPC и др.) дают разные результаты. Увеличение числа шагов повышает детализацию, но замедляет генерацию. Экспериментируйте с этими параметрами.
Используйте LoRA. Если вы часто генерируете изображения в одном стиле, обучите или найдите LoRA, которая автоматически применяет нужный стиль. Это упрощает промпт и повышает стабильность.
Не бойтесь экспериментировать. Пробуйте разные формулировки, порядок слов, веса. Записывайте удачные промпты, чтобы использовать их в будущем.
Помните, что Stable Diffusion — это инструмент, и мастерство приходит с практикой. Чем больше вы генерируете, тем лучше понимаете, как нейросеть интерпретирует текст.
Вопросы и ответы
Почему Stable Diffusion игнорирует некоторые слова в промпте?
Нейросеть может игнорировать слова, если они имеют низкий вес или стоят в конце длинного запроса. Чтобы усилить важность, используйте круглые скобки или числовые веса, например (слово:1.3). Также проверьте, не противоречат ли слова друг другу, и попробуйте переместить ключевые элементы в начало промпта.
Что такое негативный промпт и зачем он нужен?
Негативный промпт — это список элементов, которые вы не хотите видеть на изображении. Он помогает убрать артефакты, такие как размытие, водяные знаки, текст, искажения конечностей. Обычно его задают после основного промпта через специальный разделитель. В негативном промпте также можно использовать веса для усиления исключения.
Как выбрать модель для Stable Diffusion?
Выбор модели зависит от желаемого стиля. Для фотореализма подойдут модели вроде SDXL Juggernaut, для аниме — VelaMix или DarkSushi. Если вы работаете в онлайн-сервисе, попробуйте разные модели и сравните результаты. Также можно использовать LoRA для добавления конкретных стилей без смены основной модели.
Можно ли использовать русский язык в промптах?
Да, Stable Diffusion понимает русский язык, но результаты могут быть менее точными, чем на английском, из-за особенностей обучения. Рекомендуется использовать английские термины для стилей и техник, а русский — для описания объектов и сцен. В любом случае, лучше экспериментировать и смотреть, что работает лучше.
Как избежать деформаций при использовании весов токенов?
Деформации возникают при слишком высоких весах или перегрузке промпта. Начинайте с веса 1.3 и повышайте только при необходимости, не превышая 1.5. Также следите за балансом: если усиливаете один элемент, возможно, стоит ослабить другой. Используйте негативный промпт для исключения искажений, например deformed, bad anatomy.
Что такое img2img и как он помогает?
img2img — это режим, в котором вы загружаете исходное изображение и промпт, а нейросеть создаёт новую версию на основе обоих. Это полезно для стилизации, дорисовки деталей или изменения фона. Вы можете использовать набросок, фотографию или коллаж, чтобы задать композицию, а промпт — для стиля и атмосферы.