Цель проекта — обучить генеративную нейросеть на фотографиях моего пса Югги, чтобы превратить его в самостоятельного персонажа. В получившейся серии фото персонаж помещён в единую сюжетную линию — историю одного путешествия, рассказанную через последовательность сгенерированных кадров.
Пример исходных изображений
Все фотографии сделаны мной. При выборе фотографий я старалась сохранить разнообразие ракурсов, поз, вариантов окружающей среды и композиционных решений. В итоге получился датасет из 39 фотографий размером 1080×1080 px
Обучение
Для обучения использовался Stable Diffusion XL с методом DreamBooth LoRA.В датасет вошло 39 собственных фотографий моей собаки. Изображения были приведены к квадратному формату. Для фотографий автоматически создавались текстовые описания с помощью BLIP, после чего к ним добавлялся единый идентификатор персонажа — TOK dog.Модель обучалась на базе Stable Diffusion XL 1.0 в течение 500 шагов при разрешении 512 × 512 px. Итогом стал отдельный файл LoRA, содержащий обученные особенности персонажа.Обучение LoRA и первые тестовые генерации выполнялись в Google Colab. Из-за ограничения доступного GPU финальный этап генерации и доработки серии был перенесён в Kaggle, где использовалась уже обученная модель pytorch_lora_weights.safetensors
Несмотря на то, что воспроизвести внешний вид животного точь в точь как в оригинале для модели было непросто, в целом она смогла сохранить основные узнаваемые особенности персонажа: окрас, форму морды, ушей, пропорции и общий характер внешности. При этом собака была перенесена в ситуации и локации, которых не было в исходном датасете.Визуально серию объединяет эстетика любительской аналоговой фотографии: мягкий естественный свет, приглушённые оттенки и эффект случайно снятых кадров из путешествия. Разные изображения отличаются композицией, освещением, эмоциональным состоянием персонажа и масштабом кадра, но сохраняют общую стилистику и последовательность истории.
Итоговые изображения


Пример промта: «small cute happy TOK dog on the back seat of a car, looking out the window during a road trip to the station, analog film photography, 35 mm film, candid documentary style, natural light, slightly faded colors, grainy, cinematic mood»


Пример промта: «small cute happy TOK dog running along a narrow street in a small town, surrounded by low houses and quiet facades, analog film photography, 35 mm film, candid documentary style, natural daylight, slightly faded colors, film grain, cinematic travel atmosphere»


Пример промта: «small cute sleepy TOK dog curled up asleep on a neatly made bed in a stylish comfortable hotel room, photographed from a little farther away, calm and peaceful end of the journey, analog film photography, 35 mm film, candid photo, soft warm light, slightly faded colors, film grain, cinematic atmosphere»
Вывод
В результате удалось показать, что характерные особенности конкретного персонажа — внешность, окрас, пропорции и общее визуальное впечатление — могут быть перенесены в новые сцены и сюжетные ситуации. Обученная нейросеть не копирует исходные фотографии буквально, а сохраняет узнаваемость собаки, помещая её в разные этапы вымышленного путешествия.Таким образом, проект стал исследованием того, как генеративная модель может превратить реальный и при этом непростой объект в самостоятельного визуального персонажа и на его основе создать совершенно новые сюжеты.
Использованные программы и инструменты
Google Colab — подготовка среды, обучение DreamBooth LoRA и первые тестовые генерации.
Kaggle Notebooks — финальная генерация серии после обучения модели.
Stable Diffusion XL — базовая генеративная модель.
Hugging Face — загрузка моделей и работа с весами.
ChatGPT — разработка концепции проекта, сюжетной линии и корректировка промптов








