Исходный размер 2480x3500

Обучение генеративной модели на основе древнекитайской письменности

Проект принимает участие в конкурсе

Концепция

Проект Оракл направлен на создание генеративной модели, которая трансформирует эстетику древних китайских оракульных костей (цзягувэнь) в современные минималистичные значки и элементы графического дизайна.

Генерация создаёт новые возможности для создания в сферах UI/UX дизайна, брендинга и айдентики быстро создавать стилизованные под древнее искусство современные образы.

Серия изображений

Для создания датасета я собрала подборку изображений — 198 квадратных изображений (1:1, 512×512 после предобработки: центр-кроп + контраст) на которых изображены элементы oracle bone script (древнекитайской письменности).

big
Исходный размер 3500x971

примеры исходных изображений

Процесс обучения

Процесс обучения начинался с проверки наличия GPU (Tesla T4) и установки необходимых библиотек (diffusers, transformers, accelerate, peft, bitsandbytes).Датасет собирался не через прямую загрузку в Colab, а через Google Drive: изображения заранее были загружены в отдельную папку на Диске, а ноутбук монтировал Google Drive и копировал их в рабочую директорию. По итогу датасет состоял из 198 изображений в стиле древнекитайской гадательной письменности на костях, которые были приведены к единому формату 512×512 (центр-кроп до квадрата + повышение контраста).Для генерации текстовых описаний к каждому изображению использовалась модель BLIP (Salesforce/blip-image-captioning-base). К каждому автоматически сгенерированному описанию спереди добавлялся фиксированный префикс-идентификатор стиля: «ancient Chinese oracle bone script symbol,» — именно этот токен связывает содержимое конкретной картинки со стилем в целом. Все пары «файл — описание» сохранялись в metadata.jsonl.Обучение проводилось методом DreamBooth + LoRA на базе Stable Diffusion 1.5 (stable-diffusion-v1-5/stable-diffusion-v1-5) с помощью официального скрипта train_dreambooth_lora.py от Hugging Face. Ключевые параметры: разрешение 512×512, train_batch_size=1 с gradient_accumulation_steps=2, learning_rate=1e-4, 480 шагов обучения с сохранением чекпоинтов каждые 120 шагов. Обучение заняло около 21 минуты на T4.После обучения LoRA-веса (файл pytorch_lora_weights.safetensors, ~3.1 МБ) сохранялись локально, архивировались и скачивались на компьютер; опционально предусмотрена выгрузка в репозиторий на Hugging Face Hub.Дополнительно был проведён ряд экспериментов: сравнение baseline (SD 1.5 без LoRA) и дообученной модели по одному промпту — для наглядной демонстрации вклада дообучения; а также двухэтапная генерация (базовое изображение объекта без LoRA → перенос стиля через img2img) как приём для сюжетов, на которых прямая генерация с LoRA теряла либо форму объекта, либо стилевую текстуру.

Исходный размер 1324x886

Было проведено расширение negative_prompt — по ходу экспериментов в него добавлялись термины, исключающие нежелательные паттерны, устойчиво «всплывавшие» при генерации: фотореалистичность, водяные знаки/следы фотостоков, керамическую/деревянную текстуру и бетонный фон;
для отдельных сюжетов (детализированные механические объекты — компьютер, камера, ноутбук) была опробована двухэтапная генерация: сначала базовое изображение объекта без LoRA (для сохранения узнаваемой формы), затем перенос стиля через img2img с умеренным значением strength — приём, частично, но не полностью решивший проблему конфликта между стилем и сложной геометрией объекта.

Итоговая серия изображений

Стиль стабильно и убедительно переносится на сюжеты, структурно близкие исходным символам: плоские силуэты фигур (человек, животное), декоративные рамки и симметричные орнаменты, последние из которых как раз удобно использовать в качестве элементов дизайна (например, иконок приложений).

Исходный размер 3500x971

«ancient Chinese oracle bone script symbol, square frame with decorative oracle patterns on edges, flower in center, symmetrical composition, minimalist style, clean lines, white background, geometric ornament»

Менее абстрактные сюжеты при генерации немного теряют узнаваемую стилистику, к ним добавляется цвет, но всё ещё остаются заметны графические элементы письменности: изгибы толстоватых чёрных линий, угловатые очерченные силуэты. Также модель считает ненадёжно точное количество заданных промтом предметов. Для попытки исправления был добавлен негативный промт.

Исходный размер 3500x971

«a person’s silhouette holding a burger"/"ancient Chinese oracle bone script symbol, laptop computer icon, engraved linework, monochrome"/"a camera with a round lens in the center and rectangular body, minimalist icon»

При этом, если задать промт расположения символов на предмете, будет сгенерирован мокап с нанесённым изображением. На примере снизу видно разницу между просто заданным абстрактным рисунком и вышеописанным вариантом.

Исходный размер 3500x971

«an open laptop with screen and keyboard, minimalist icon, white background"/"Chinese oracle bone script symbol, three bowls of noodles arranged horizontally, oracle bone style patterns on bowls, minimalist, white background, rectangular format, clean lines»

Так, модель подходит для генерации простых форм и орнамента, хорошо передаются образы человека и животных, присутствовавших в исходном датасете, которые можно видоизменять и использовать для дальнейшего размещения на носителях.

Исходный размер 3500x971

«a person’s silhouette holding a burger, minimalist, white background» /"a decorative border frame with geometric ornament"/"square frame with decorative oracle patterns on edges, flower in center, symmetrical composition, minimalist style, clean lines, white background, geometric ornament»

Использование ГенИИ

— для корректировки кода с использованием меньшего количество обучений был использован Deepseek

Обучение генеративной модели на основе древнекитайской письменности
Проект создан 26.09.2026
Мы используем файлы cookies для улучшения работы сайта и большего удобства его использования. Более подробную информац...
Показать больше