Дайджесты новостей
Точечное диалоговое редактирование кадра моделью Nano Banana 2.1 с изолированной маской без изменения лица и фона.

Google Nano Banana 2.1: точечное редактирование изображений и тест в AI Studio

Каждый, кто пробовал дорабатывать сгенерированные нейросетями иллюстрации, знаком с «эффектом бабочки» диффузионных моделей. Стоит попросить сеть всего лишь сменить цвет куртки у персонажа или убрать лишний предмет со стола, как модель услужливо перерисовывает всю сцену заново: черты лица плывут, фон меняется до неузнаваемости, а пальцы и мелкие текстуры искажаются.

Инженеры Google DeepMind представили модель Nano Banana 2.1, призванную решить эту проблему без ручного рисования бинарных масок. Необычное кодовое имя, родившееся как шуточный плейсхолдер на арене LMSYS, закрепилось в качестве официального названия новой линейки высокоскоростных визуальных моделей Google. Версия 2.1 фокусируется на мультишаговом диалоговом редактировании (conversational inpainting), гарантируя сохранение геометрии и идентичности кадра.

Проблема «эффекта бабочки» в диффузионных сетях

Классические генераторы картинок рассматривают холст как единый шум, преобразуемый в пиксели за десятки диффузионных шагов. При любой текстовой правке весь латентный шум пересчитывается заново. Nano Banana 2.1 работает иначе: модель обучена распознавать границы смысловых объектов и накладывать семантическую маску исключительно на целевую область.

При приближении (зуме) или замене деталей сохраняются волокна ткани, светотеневой рисунок окружения и точные пропорции лица. Кроме того, модель поддерживает чистый рендеринг типографики внутри кадра и слияние элементов из нескольких референсных картинок без артефактов склейки.

Интерактивный тест в Google AI Studio

Для быстрого экспериментирования Google добавила Nano Banana 2.1 в выпадающий список песочницы Google AI Studio Playground. Разработчики могут проверить возможности модели в браузере, а затем перенести проверенные параметры в программный код.

Первым шагом конвейера выступает генерация базовой сцены через клиент google-genai:

from google import genai
from google.genai import types

client = genai.Client()

# Генерация базового студийного портрета
base_response = client.models.generate_images(
    model="nano-banana-2.1",
    prompt="A realistic professional studio portrait of a software engineer, neutral soft background, crisp lighting",
    config=types.GenerateImagesConfig(
        number_of_images=1,
        output_mime_type="image/jpeg",
        aspect_ratio="1:1"
    )
)

base_image = base_response.generated_images[0].image
base_image.save("base_portrait.jpg")
print("Базовое изображение успешно сгенерировано.")

Точечная модификация без перерисовки сцены

Когда базовая сцена зафиксирована, второй вызов API позволяет выполнить направленное редактирование. Мы передаем сгенерированный файл обратно в модель в качестве референса и задаем точечную инструкцию:

from PIL import Image

# Загрузка полученного ранее референса
source_img = Image.open("base_portrait.jpg")

# Точечная замена элементов гардероба с сохранением внешности
edit_response = client.models.generate_images(
    model="nano-banana-2.1",
    prompt="Keep facial features, hair, and background completely untouched. Replace only the dark t-shirt with an indigo denim jacket.",
    reference_images=[source_img],
    config=types.GenerateImagesConfig(
        number_of_images=1,
        output_mime_type="image/jpeg",
        aspect_ratio="1:1"
    )
)

edit_response.generated_images[0].image.save("final_edited_portrait.jpg")
print("Точечная модификация выполнена с сохранением композиции.")

Ограничения разрешения и производственный вердикт

В текущей версии API действует ограничение разрешения до 2048x2048 пикселей. Также стоит учитывать, что при экстремальных пространственных трансформациях (например, попытке развернуть человека спиной) модель переходит в режим достраивания деталей, и портретное сходство может снижаться.

Для создателей маркетинговых материалов и дизайн-платформ Nano Banana 2.1 устраняет необходимость привлекать дизайнеров для элементарной цветокоррекции или смены атрибутов товара. Возможность управлять правками через лаконичный текстовый промпт делает модель надежным компонентом для автоматизированных каталогов и рекламных сетей.