Чем правка отличается от генерации с нуля
Генератор изображений собирает кадр заново на каждый запрос. Поменяли в промпте одно слово — вернулась другая картинка: другой ракурс, другое лицо, другой свет. Поправить одну деталь в удачном кадре через промпт не выйдет, потому что вместе с деталью меняется всё остальное.
Kontext работает иначе: на вход идёт само изображение, а в запросе описывается только правка. Убрать предмет, заменить фон, продолжить кадр за рамкой. Маску размечать не нужно, область модель берёт из описания.