Подавляющее большинство вообще ни разу не пробовало нейросети всерьёз. Заметная часть — пользователи бесплатных чат-ботов: разок спросили, погенерили ради интереса. И только исчезающе малая доля — те, кто платит за инструмент и использует его на полную.
Но даже внутри этой крошечной верхушки есть ещё один, более тонкий разрыв — и именно ему посвящена вся дальнейшая история. Среди тех, кто уже активно генерирует контент, есть герои истории выше: те, кто нашёл промпт, который у кого-то сработал, скопировал, порадовался результату — а дальше упёрся в тупик, потому что непонятно, что в этом промпте вообще за что отвечает.
И только единицы даже здесь — те, кто перестал полагаться на удачу и разобрался, как промпт устроен изнутри.
Заметка
Это не «нехватка таланта». Это нехватка конкретного, выучиваемого навыка — того же порядка, что монтаж или композиция кадра. Дальше в статье разберём его по частям.
02
Профессионал в той же ловушке
Один из тех, кто прошёл путь от копирования до понимания — Марина, которая сейчас ведёт у нас в школе Wow Cow направление, отвечающее за нейросети.
Это не путь за пару месяцев. Вот как он выглядел на самом деле:
2019
Приходит в мобильную анимацию с нуля — без диплома дизайнера, без студии, только телефон и желание разобраться
2019–22
Годы наработки насмотренного профессионального глаза: заказные ролики, первые бренды, первые отказы, первые пересъёмки — обычный, небыстрый путь ремесленника
к 2023
Портфолио, которому можно доверять: ВкусВилл, Магнит, Кристиан Костов, Айвазовский Оркестр, Lay Back и ещё десяток брендов и артистов
нач. 2023
Первые нейросети — уродливые, экспериментальные, больше баг, чем инструмент. Но уже видно, куда это движется
сейчас
Ведёт направление нейросетей в школе Wow Cow — но к этому моменту она пришла не за неделю, а больше чем за пять лет практики. Крупные компании сами выходят на неё за генерацией AI-роликов и баннеров — потому что видят нешаблонный, профессиональный подход, а не очередную нейросетевую заготовку
Казалось бы, с таким бэкграундом переход в нейросети должен был пойти легко — она уже понимала свет, композицию и ритм кадра лучше большинства.
Не пошло.
«Я находила промпт, который у кого-то классно сработал, вставляла — и получала что-то среднее. Не плохое, не хорошее. Просто как у всех»
— Марина
Тот самый жёлтый квадрат с картинки выше — и опытный профессионал внутри него ничем не отличался от новичка. Марина сама пролистывала точно такие же посты в чужих лентах, ни разу их не сохраняя. И прекрасно понимала: её собственный контент точно так же пролистывают.
03
Анатомия промпта
Переломный момент случился, когда Марина перестала искать «ещё более удачные» чужие промпты — и начала разбирать их на части.
Взяла один промпт, который у кого-то хорошо сработал, и стала менять в нём по одному элементу за раз: сначала описание того, что происходит в кадре, потом свет, потом ракурс, потом стилистику — и каждый раз смотрела, что именно меняется в результате.
Оказалось, что промпт — это не одна фраза, а конструкция, где у каждой части своя роль:
🎯 Что в кадре
объект, поза, действие — то, что происходит
💡 Свет и настроение
откуда идёт свет, тёплый он или холодный, какая атмосфера
📐 Ракурс и композиция
откуда смотрит камера, что в фокусе, что на периферии
🎨 Стилистика
техника отрисовки, референс по стилю, цветовое решение
Когда видишь эти части по отдельности, сразу понятно, что писать самостоятельно, а не только копировать — та самая проблема из начала статьи, где чужой промпт работал, а свой не получался. Потому что «написать что-то похожее» — это надежда, а не инструкция. А осознанный выбор конкретного значения для каждого элемента конструкции — это уже то, что нейросеть способна понять и выполнить, даже если промпт целиком ваш собственный, с нуля.
04
Это не мы придумали — реальные фреймворки промпт-инжиниринга
Чтобы показать, насколько это устоявшаяся, серьёзная область, а не «домашняя методика одной школы» — вот несколько признанных фреймворков, которыми пользуются профессиональные промпт-инженеры для текстовых нейросетей. Они решают ту же задачу, что и разбор Марины — просто для другого типа контента.
| Фреймворк | Расшифровка | Когда применяют |
| CO-STAR | Context, Objective, Style, Tone, Audience, Response | Маркетинговые и рекламные тексты — разводит стиль и тон в отдельные поля |
| RISEN | Role, Instructions, Steps, End goal, Narrowing | Многошаговые задачи: отчёты, исследования, структурированные документы |
| CRISPE | Capacity, Role, Insight, Statement, Personality, Experiment | Задачи, где важна «личность» и роль, от которой отвечает нейросеть |
| RTF | Role, Task, Format | Быстрые, простые задачи — минимальная, но рабочая структура |
| CLEAR | Concise, Logical, Explicit, Adaptive, Reflective | Не шаблон, а критерии качества — проверить уже готовый промпт |
Обратите внимание: даже здесь, в мире работы с текстом, не один универсальный фреймворк, а минимум пять — потому что задача «написать рекламный текст» и задача «собрать многошаговый отчёт» требуют разного порядка мышления. И это ещё не касаясь визуала и видео, где своя терминология и свои правила.
Заметка
Если для текстовых нейросетей существует пять разных признанных подходов под разные задачи — почему кто-то должен верить, что для картинок и видео хватит одного скопированного промпта на все случаи?
05
Как это устроено в картинках
У генераторов изображений — своя логика, но тот же принцип: конструкция, а не заклинание. Нейросеть не реагирует на абстрактные оценки вроде «красиво» или «стильно» — эти слова не связаны в её обучающих данных ни с какими конкретными визуальными признаками. Она реагирует на конкретику: источник света, план съёмки, оптику, референс стиля.
Есть и практическое ограничение, о котором мало кто задумывается: модель эффективно обрабатывает всего 3–4 ключевых элемента в одном запросе. Каждый лишний компонент забирает «вес» у остальных и ослабляет контроль над результатом. Поэтому профессионалы выстраивают иерархию — что главное, что второстепенное, что просто создаёт атмосферу, а не пытаются перечислить всё сразу.
На профессиональном уровне промпт для фото — это не одна строчка, а несколько слоёв, которые работают вместе:
Заметка
Именно поэтому шаблонная фраза вроде «красивое фото, высокое качество» не работает — она не задействует ни один из четырёх слоёв. Нейросеть получает ноль конкретики и заполняет пустоту самым усреднённым образом, какой у неё есть.
Как это выглядит на практике — разбор одного реального промпта, собранного по всем четырём слоям сразу:
❌ Шаблонный промпт
«красивое фото продукта, профессионально, высокое качество»
Абстрактные слова — нейросеть додумывает всё сама
✅ Промпт-режиссура — 4 слоя сразу
Смотрите разбор ниже →
Разбор реального промпта — эффект «мозаика» на портрете
СЦЕНА
Ультрареалистичный студийный портрет по референсу, с сохранением естественных пропорций тела. Лицо, волосы и одежда собраны из крупных квадратных плиток — как мозаика из глянцевых фрагментов разных оттенков, точно повторяющая контуры лица
КАМЕРА
Canon EOS R5, объектив 85мм f/1.4, ISO 100, f/2.0, RAW
СВЕТ
Мягкий студийный, ровное фронтально-боковое освещение, чистые блики на мозаике, нейтральное дневное настроение, premium fashion-editorial подача
РЕАЛИСТИЧНОСТЬ
Натуральная текстура кожи там, где она видна, естественный румянец, деликатное подповерхностное рассеивание света
ПОСТОБРАБОТКА
HDR, точная цветокоррекция, лёгкая зернистость плёнки, усиление контраста на мозаичных плитках, чистая коммерческая обработка
Пять слоёв на один эффект — и это только один из десятков возможных визуальных эффектов, у каждого из которых своя версия этой конструкции. Промпт для портретной фотографии и промпт для предметной съёмки построены принципиально по-разному, даже если оба — просто «фото». У портрета в приоритете эмоция и свет на лице. У предметки — материал, фактура, чистота фона.
06
Как это устроено в видео
Для видео добавляется ещё один слой — траектория камеры отдельно от того, что в кадре. И здесь у операторской работы есть своя терминология, которую нейросети «понимают» гораздо точнее, чем бытовое описание вроде «камера едет».
Dolly in / out
физическое движение камеры вперёд или назад — приближение усиливает вовлечённость, отдаление раскрывает масштаб
Pan left / right
горизонтальная панорама — для пейзажей и групповых сцен
Tilt up / down
вертикальный наклон — для высоких объектов
Orbit / circle
облёт по дуге или полный круг — лучшее движение для предметной съёмки
Crane up / down
вертикальный подъём или спуск, как на операторском журавле
Zoom in
оптическое приближение без физического движения камеры
Важное практическое правило: одно движение камеры на один клип. Если в промпте одновременно просить zoom, tilt и orbit — нейросеть путает направления, и результат становится непредсказуемым. Профессионалы выбирают один вектор движения и один смысловой фокус на клип, а сложность наращивают уже на этапе монтажа нескольких кусков.
У видео-промпта — своя пятислойная формула, отдельная от фото:
Даже облёт камеры вокруг объекта пишется по-разному в зависимости от цели ролика: если задача — показать масштаб, движение широкое и медленное, от общего плана. Если задача — задержать внимание на детали, движение короткое, почти статичное, с акцентом на одну точку. Один и тот же технический приём, но разное назначение — разная формулировка.
07
Один и тот же промпт — разный результат
Здесь Марину поджидало ещё одно открытие, неприятное на первый взгляд: промпт, который отлично сработал в одной нейросети, в другой мог дать совершенно другой результат.
Midjourney
чувствителен к весам слов и порядку
Kling / Runway
важна отдельная логика движения камеры, одно движение за раз
Sora
лучше «понимает» короткие понятные клипы, чем длинные сложные
Каждая модель по-своему «читает» структуру запроса: у одной критичен порядок слов, у другой — вес формулировок, у третьей вообще другая логика построения кадра. Тот, кто просто копирует промпт, каждый раз стартует с нуля, когда меняет инструмент. Тот, кто понимает конструкцию — переносит не текст, а логику, и адаптирует её под особенности конкретной нейросети.
✺ ✺ ✺
08
Хорошо, а какую структуру использовать?
Логичный вопрос после всего перечисленного выше: окей, вот фреймворки, вот анатомия, вот термины — значит, теперь можно взять один из этих шаблонов и подставлять в него что угодно?
Нет.
И это, возможно, самое неприятное, что можно узнать про промпты — но и самое честное. Универсальной структуры не существует. Волшебной таблетки, которая одинаково хорошо работает для любой задачи, нет — и тот, кто её продаёт, либо не понимает, о чём говорит, либо рассчитывает, что вы не заметите разницу, пока не попробуете сами.
Даже пять признанных фреймворков для текста существуют именно потому, что один на всё не работает. То же самое с картинками и видео — вот три совершенно разных типа задач бок о бок:
📷 Портрет
приоритет — эмоция и свет на лице, фон второстепенен
📦 Продукт
приоритет — материал, фактура, чистота фона
🎬 Ролик-обзор
приоритет — траектория камеры и темп монтажа
У каждой задачи меняется не только содержание промпта, но и то, какая часть конструкции вообще главная. Тот, кто пытается применить одну и ту же «удачную» формулу ко всем трём, обязательно проиграет хотя бы в одной из них — и не поймёт почему, потому что снаружи все три промпта выглядят одинаково правильно написанными.
Это и есть режиссура промпта: не запоминание готовой структуры, а осознанное решение по каждому элементу под конкретную задачу — так же, как режиссёр на площадке каждый раз заново решает, где поставить камеру, а не использует один и тот же план для любой сцены. Хорошая новость в том, что это, в отличие от «таланта» или «чувства стиля», можно выучить как навык — предсказуемо и по шагам, так же как выучиваются фреймворки CO-STAR или RISEN для текста.
09
Почему это не «ещё один навык для творческих»
Если вы делаете контент для заказчиков — брендов, экспертов, своего блога, который со временем должен приносить деньги, — разница между шаблонным и срежиссированным промптом ощущается не как «красивее / не очень красиво». Она ощущается как разница между «клиент доволен и заказывает снова» и «клиент вежливо говорит, что подумает».
Бренд, который заказывает визуал, не видит ваш промпт. Он видит результат — и либо чувствует, что это сделано под него, осмысленно, с пониманием задачи, либо видит generic-картинку, которую с тем же успехом мог сгенерировать кто угодно за пять минут. Клиенты вроде «Магнита» или артистов уровня Кристиана Костова не работают с теми, кто угадывает. Они работают с теми, кто управляет результатом.
✺ ✺ ✺
10
Результат, который уже не спишешь на удачу
Именно этот подход в итоге и привёл к результату, который не назовёшь везением. Не потому что повезло с формулировкой — а потому что каждый элемент был выстроен так же осознанно, как раньше выстраивался кадр в ролике для «Магнита» или Кристиана Костова. Вот несколько конкретных работ, собранных Мариной по этому принципу: