• Вебинар

Укрощаем картинки в нано-банане

Глеб Кудрявцев
Глеб Кудрявцев

CEO Карьерный Цех, microboard.io, ex CPO Skyeng

Разбираемся, как укрощать картинки в нейросети Nano Banana, вместе с Глебом Кудрявцевым.

Глеб – разработчик, эксперт в AI-assisted разработке, автор популярного приложения для программирования с ИИ — Shotgun (1500 звезд на гитхабе). Область интереса — программирование агентов, промпт-инженерия и подготовка контекстов (в т.ч. RAG, Knowledge graph и т.д.), b2b/b2c продукты на основе AI. Пионер и популяризатор агентского кодинга. Эксперт в решении задач с помощью AI.

Вебинар прошёл 5 марта 2026 года.

Что разбираем на вебинаре:

— Как не просто генерить веселые картинки, а получать точные и готовые к работе артефакты
— Почему для промптинга картиночной модели нужна рассуждающая
— Как экстрагировать чужие стили и сохранять свои
— Наглядная разница между обычной и pro моделями


Запись вебинара

Часть 1. Быстрый старт. Сгенерируйте картинку и получите ее текстовое описание

Откройте Gemini и попросите модель сгенерировать произвольный пейзаж. Подойдет любой запрос: горы, лес или дорожка через поле. Nano Banana сгенерирует картинку за несколько секунд.

Теперь попробуйте ее изменить — например, попросите развернуть дорожку в другую сторону или сменить время суток. Модель может справиться, а может проигнорировать часть инструкций. Причина в том, что Nano Banana сильно цепляется за исходное изображение и с трудом вносит заметные изменения в рамках одного чата. 

Чтобы обойти эту особенность, нужно получить текстовое описание картинки и дальше работать с ним вместо самого изображения. Скопируйте сгенерированный пейзаж и откройте новый чат в Gemini. Вставьте изображение и отправьте такой промпт:

Prompt

Подробно опиши содержимое и стиль данной картинки. Это описание потом пойдет в нейросеть, которая генерирует картинки. 

Gemini выдаст подробное текстовое описание: что изображено на картинке, какие цвета, какой стиль, как расположены объекты. Например, для горного пейзажа модель опишет горные вершины, извилистую тропу, освещение, цветовую палитру и общее настроение кадра. На выходе вы получите готовый промпт, который можно использовать для генерации с нуля.

Чтобы убедиться, что описание работает, скопируйте его и вставьте в новый чат с Nano Banana как промпт для генерации. Модель сгенерирует картинку, почти неотличимую от оригинала. Если результат похож на исходник, описание корректное, и с ним можно работать дальше.

Дальше вы можете вносить правки в текст описания: убирать лишние детали, добавлять нужные элементы и менять стиль. И генерировать новые картинки с нуля.

Впишите человека в сгенерированный пейзаж

Пейзаж готов, текстовое описание проверено. Теперь можно добавить в этот пейзаж конкретного человека по фотографии. Если просто написать в чате с Nano Banana «хочу, чтобы на этой картинке стоял вот этот человек», модель может сгенерировать человека в совершенно другом пейзаже. Она «видит» фотографию-референс, но теряет контекст предыдущего изображения и придумывает фон заново.

Чтобы этого избежать, нужно совместить описание пейзажа и портрет в одном промпте. Для этого откройте чат с Gemini в текстовом режиме (тот же, в котором вы получали описание пейзажа), вставьте фотографию человека и отправьте такой запрос:

Prompt

Я хочу вставить туда свой портрет. Вот исходное изображение меня. Дай промпт для генерации картинки пейзажа плюс моего портрета, при этом фотография меня будет референсом к промпту.

Gemini возьмет текстовое описание пейзажа из предыдущих сообщений, проанализирует фотографию и выдаст комбинированный промпт, в котором совместит оба элемента: место, освещение, стиль пейзажа и внешность человека. Этот промпт нужно скопировать и вставить в новый чат с Nano Banana вместе с фотографией-референсом.

Исправьте то, что не нравится, через аналитическую LLM

Допустим, вы сгенерировали картинку и получили плохой результат. Не стоит пытаться исправить его в чате — это вряд ли сработает. Нейройнка может зациклиться на одном результате и как бы вы не меняли промпт — все равно выдавать первоначальную картинку.

Чтобы это исправить, нужно открыть новый чат в Gemini, загрузить туда неудачный результат и отправить такой запрос:

Prompt

У меня есть коллаж — человек на фоне гор. Только человек тут стоит как-то неестественно. Помоги мне понять, что в нем неправильно, чтобы лучше сформулировать запрос на исправление.

Gemini разберет картинку и выдаст конкретный список проблем. На вебинаре модель указала, что освещение и тени на человеке не согласованы с окружением, а поза и перспектива не совпадают с ракурсом камеры. 

Когда поймете проблемы, попросите нейронку улучшить ваш промпт:

Prompt

Напиши мне промпт на исправление.

Gemini сформулирует детальный запрос, в котором учтет все найденные проблемы: пропишет правильное направление теней, скорректирует позу под перспективу, при необходимости укажет тип камеры и объектива. 

Готовый промпт нужно скопировать, вставить в новый чат с Nano Banana вместе с фотографией-референсом и запустить генерацию с нуля.

Сделайте инфографику красивой

Тот же аналитический подход работает и с инфографикой. Допустим, у вас есть таблица с данными и вы хотите превратить ее в визуально качественную инфографику. Можно попробовать два пути: прямой и аналитический.

Прямой путь самый быстрый. Вы загружаете таблицу в Nano Banana и просите «сделай красиво». Модель переверстает данные и создаст инфографику по собственному представлению о красоте. На вебинаре Глеб показал этот подход на таблице «От чего умирают россияне»: Nano Banana полностью переверстала таблицу, создала инфографику и при этом сохранила все цифры верными. 

Если результат прямой генерации не устраивает, стоит попробовать аналитический путь. На вебинаре зритель предложил данные медицинского исследования пептида дермаксил: 24 участницы, возраст 46 лет, результаты по уменьшению объема морщин. Глеб взял этот запрос и попробовал превратить его в инфографику прямо по ходу эфира. Первый результат от Nano Banana выглядел перегруженным — слишком много визуальных элементов, как постер начинающего ученого на конференции. Тогда спикер открыл новый чат в AI Studio и отправил в текстовую LLM такой запрос:

Prompt

Мне не нравится результат. Как будто много визуального мусора. Смотрится как постер неумелого ученого на конференции. Хочу, чтобы это выглядело дорого, как качественный дизайн. Сформулируй промпт для модели, чтобы она могла сгенерировать инфографику на эту тему, учитывая данные пожелания.

LLM проанализировала проблемы дизайна и выдала новый промпт. Результат по этому промпту выглядел заметно чище, чем при прямом запросе «сделай красиво».

Аналитическая LLM тоже не всегда схватывает задачу с первого раза. На вебинаре она выдала промпт с общими графиками, но не связала цифры с конкретными участницами исследования — в инфографике не было ни женщин, ни данных по возрасту. Спикер дописал уточнение:

Prompt

Добавь в промпт, что на инфографике должны быть иллюстрации женщин и конкретные данные исследования. 

После этого результат станет ближе к задуманному.

При работе с инфографикой модель может зацепиться за исходную картинку и воспроизвести ее почти без изменений. Глеб столкнулся с этим на вебинаре: он подложил оригинальную таблицу как визуальный референс, и Nano Banana выдала практически то же самое изображение. В таком случае стоит попробовать сгенерировать инфографику без референса только по текстовому промпту. Модель перестанет цепляться за исходный вид таблицы и отработает по описанию. 

Еще один прием, который помогает объяснить модели, что вы имеете в виду под «красиво», — референс стиля. Найдите инфографику, дизайн которой вам нравится, и загрузите ее вместе с текущим результатом. Напишите: «Сделай красиво, как здесь». Модель скопирует стилистику референса — цветовую схему, компоновку, типографику — и применит ее к вашим данным. 

Часть 2. Почему Nano Banana цепляется за исходник

Когда вы загружаете картинку в чат и просите что-то в ней изменить, модель воспринимает эту картинку как главный ориентир. Она старается сохранить максимум от исходника и вносит минимальные правки. Даже если вы напишете подробный промпт с детальным описанием изменений, модель не сможет далеко отступить от того, что уже видит. Это называется праймированием.

Nano Banana Pro, первая версия модели, праймилась особенно сильно. На вебинаре Глеб отметил, что она с трудом разворачивала дорожку на пейзаже в другую сторону. Nano Banana 2 справляется с такими задачами лучше и реже игнорирует инструкции. Но фундаментальная проблема осталась: модель по-прежнему держится за исходное изображение и с трудом вносит радикальные изменения.

При длинных цепочках правок праймирование создает еще одну проблему. Если вы дорабатываете одно изображение в рамках одного чата — сначала правите позу, потом тени, потом фон, — черты лица персонажа начинают меняться. С каждой итерацией лицо все меньше похоже на исходный референс, и к пятой-шестой правке человек на картинке может стать неузнаваемым. Мелкие искажения наслаиваются друг на друга, и модель постепенно теряет сходство.

Почему LLM формулирует промпты лучше человека

На вебинаре Глеб объяснил это так: текстовая LLM лучше знает, как общаться с генератором картинок, потому что она сама устроена похожим образом. Она понимает, какие слова и конструкции сильнее влияют на результат, какие параметры стоит указать для реалистичного освещения, как описать перспективу и тени так, чтобы генератор их правильно отработал.

Человек без художественного образования чувствует, что «что-то не так», но не может перевести это ощущение в точную инструкцию. Глеб привел в пример себя: он видел, что человек на горном пейзаже выглядит «картонно», но не мог объяснить, что именно не так с освещением или перспективой. LLM берет на себя роль переводчика: вы описываете проблему обычным языком, а она превращает ваше ощущение в промпт, который генератор картинок способен корректно отработать.

0 комментариев
Старые
Новые Популярные