Обучение LoRA-модели для генерации изображений в стиле советских диафильмов
Описание датасета
Для обучения была использована серия изображений, вдохновлённых советскими диафильмами — особым видом изобразительного искусства, популярным в СССР с 1930-х по 1990-е годы. Диафильмы представляли собой плёнки с последовательностью кадров, которые проецировались на экран и сопровождались текстом, образуя самостоятельный жанр визуального повествования.Для диафильмов характерны узнаваемая рисованная манера, мягкая линия, ограниченная цветовая палитра и особая композиционная логика. Кадры выстраиваются вокруг персонажа, помещённого в пейзаж или интерьер, а фон и второй план часто выполнены более условно, чем главный объект. Важную роль играет плоскостность изображения: пространство строится через цветовые пятна и контур, а не через перспективу. Особую атмосферу создают приглушённые тёплые оттенки, характерная зернистость и ощущение ручной работы — следы акварели, гуаши или туши.




В работе применяется метод LoRA-дообучения на базе модели Stable Diffusion XL. Исходный набор данных включает 32 изображения (с сайтов «Национальная электронная библиотека» (НЭДБ) и «Диафильмы.рф»), отражающих характерные черты стиля: рисованную линию, сюжетность, ограниченную палитру, условный фон и литературную основу.
Описание обучения модели
Для обучения модели был подготовлен датасет из 32 изображений. Перед загрузкой все картинки были приведены к квадратному формату 1024×1024 и сохранены локально. В качестве стилевого токена использовался единый instance_prompt, описывающий жанр в целом: «a frame from a soviet diafilm, vintage hand-drawn illustration». Дополнительно задавался валидационный промпт для отслеживания прогресса обучения.Обучение проводилось методом DreamBooth LoRA на базе модели Stable Diffusion XL (stabilityai/stable-diffusion-xl-base-1.0) с использованием VAE-фикса для fp16 (madebyollin/sdxl-vae-fp16-fix). Процесс выполнялся в Google Colab на GPU Tesla T4. Для экономии видеопамяти применялись gradient checkpointing, 8-битный оптимизатор AdamW и аккумуляция градиентов с эффективным размером батча, равным 4. Итоговый LoRA-адаптер имел ранг 8, что обеспечивает компактный размер файла при сохранении выразительности стиля.
В процессе обучения модель усваивала связь между стилевым токеном и визуальными особенностями датасета: рисованной линией, сюжетной композицией, ограниченной тёплой палитрой, условным фоном и характерной повествовательной манерой. Всего было выполнено 1500 шагов оптимизации с косинусным расписанием learning rate.После завершения обучения полученная LoRA-модель использовалась для генерации новой серии изображений по текстовым промптам, в которых обязательно сохранялась стилевая фраза-токен.
Серия изображений
Во всех сгенерированных работах прослеживаются ключевые признаки стиля диафильмов: рисованная манера, приглушённая тёплая палитра, условный фон и ощущение ручной работы. Изображения объединены общей эстетикой, но при этом различаются по сюжету — от зимних пейзажей и лесных сцен до бытовых зарисовок.Модели удалось хорошо передать декоративность, линейный ритм и связь персонажа с окружением. Наиболее устойчивыми элементами стали характерная штриховая линия, ограниченная цветовая гамма и общая «плёночная» атмосфера кадра.




