Идея проекта
Для обучения нейросети StableDiffusion я решила взять арты и скриншоты из видео аниматорки и художницы под псевдонимом vewn. Ее работы отличаются специфичной манерой рисования персонажей, искаженной перспективой пространства, обилием ярких цветов и детализацией. Мне было интересно, насколько хорошо нейросеть сможет воспроизвести все эти приемы, в особенности искажение перспективы.
Изображения
Арты для датасета были взяты со страницы художницы в tumblr, скриншоты из анимационных роликов — из Pinterest. Присутствуют изображения с разной степенью насыщенности деталями, изображения как с персонажами, так и только окружающей среды.
https://drive.google.com/drive/folders/1OTUqwyBlWTGnNcqZbyVY993XoZWay0R3?usp=drive_link




Использованные инструменты
- Stable Diffusion
- Google Colab
- Hugging Face
- ChatGPT 4 (генерация промптов)
Подготовка датасета
Подготовительный этап перед самим обучением по датасету состоял из:
- Загрузки необходимых библиотек;
- Загрузки изображений и проверки их читаемости;
- Генерации подписей для изображений;
- Введения токена Hugging Face.

Установка библиотек
Загрузка изображений (44 штуки)
Проверка читаемости файлов изображений
Создание подписей для изображений…
…и сами итоговые подписи. Визуальное наполнение артов было определено корректно.
Обучение нейросети
Далее был сгенерирован токен Hugging Face и произведен вход в систему с его помощью, после чего можно было приступать к самому обучению. Для ускорения процесса я сократила разрешение изображений до 512 пикселей, выставила максимальный шаг на 500, чекпоинт — на 250. С такими параметрами обучение по 44 изображениям заняло примерно 45 минут.
Первая итерация
Для генерации изображений в качестве промптов я сначала использовала ранее созданные подписи к артам из датасета.


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a cartoon character sleeping on a bed


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a cartoon of a woman in a messy kitchen


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a cartoon of a city with buildings and a red sky
Первоначальные генерации оказались неудовлетворительными как по содержанию изображения, так и по цветам. Было принято решение попробовать исправить ситуацию за счет коррекции самого датасета: я убрала изображения с чрезмерным количеством мелких объектов в окружении (поскольку нейросеть интерпретировала эту отличительную черту слишком буквально), а также изображения, слишком выбивающиеся из типичной цветовой гаммы vewn. По итогу в новом датасете осталось 25 изображений, и я заново запустила процесс обучения.
Вторая итерация


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a cartoon character is walking through a narrow alley


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a woman sitting at a desk with a computer


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a cartoon character sleeping on a bed


Сгенерированное изображение и арт художницы; промпт: art in VEWN style, a cartoon of a woman in a messy kitchen
Новые генерации получились получше: изображения больше не состояли из нечитаемого нагромождения фрагментов объектов, цвета перестали быть «мыльными», хотя доминирующим цветом стал розовый. Нейросеть хорошо смогла уловить такие нюансы стиля художницы, как небрежный лайн-арт и искаженная перспектива. К сожалению, на многих изображениях все еще присутствуют излишние детали, нагромождающие пространство, а также наблюдается проблема с человеческими лицами.




