home.social

#stable_diffusion — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #stable_diffusion, aggregated by home.social.

fetched live
  1. Как генерировать реалистичных людей по десяткам признаков

    Сгенерировать реалистичный портрет по одному описанию несложно. Гораздо труднее одновременно управлять десятками параметров: возраст, пол, причёска, форма лица и другие признаки. Такую задачу решал заказчик: ему нужно было генерировать набор фотореалистичных изображений людей для биометрического приложения. Предыдущие эксперименты давали изображения, которые выглядели явными рисунками, поэтому нужно было подобрать другой вариант генерации и управления атрибутами. Что-же там за вариант генерации

    habr.com/ru/articles/1068880/

    #Stable_Diffusion #генерация_изображений #генеративный_ИИ #компьютерное_зрение #ControlNet #IP_Adapter #Compel #texttoimage #imagetoimage #prompt_engineering

  2. Как я автоматизировал создание стикеров для соцсетей: локально обучаем стилевую LoRA для SD 1.5 на 30 картинках

    Генерация красивых единичных артов давно перестала быть проблемой. Но как только возникает прикладная задача — например, сделать серию консистентных иллюстраций или заготовок для стикерпака в едином стиле — обычный промпт‑инжиниринг начинает буксовать. Закрытые модели дают высокое качество, но забирают контроль и навязывают свое видение. Поэтому я решил собрать собственный контролируемый пайплайн. Базой для эксперимента была выбрана Stable Diffusion 1.5. Да, это далеко не самая новая архитектура: она хуже современных моделей понимает комплексные описания, чаще ломает анатомию и ограничена базовым разрешением 512×512. Но у неё остаются неоспоримые козыри: низкие требования к железу, гигантская экосистема (ControlNet, чекпоинты) и возможность быстро обучать и тестировать гипотезы на домашнем ПК. Суть эксперимента — обучить стилевую LoRA на обезличенной подборке стикеров из ВК. Модель должна была выучить не лицо конкретного персонажа и не манеру конкретного художника, а общие паттерны жанра: белый фон, упрощённые формы, характерный векторный контур и мультяшную выразительность эмоций.

    habr.com/ru/articles/1065580/

    #stable_diffusion #lora #comfyui #генерация_изображений #обучение_нейросети #датасет #onetrainer #стикеры #blip #sd15

  3. И треснул мир напополам: как в США и Китае развили две инженерные школы графического GenAI

    Генерация изображений в последнее время заметно продвинулась и справляется даже с тонкими задачами на высоком уровне. За последние два года я с базовыми знаниями в дизайне оформлял книги, готовил иллюстрации для статей, собирал презентации и решал графические задачи в коммерческих проектах — и вынес из этого одно: универсальной модели не существует. Каждая архитектура сильна в своей нише, а выбор инструмента стал такой же частью работы, как и сам промпт. Работая с Midjourney, DALL-E 3, FLUX, Hunyuan-DiT, Wanxiang и Seedream, я заметил: один и тот же запрос в разных системах давал принципиально разные результаты — и дело было не в стилистике. Одни модели буквально расставляли объекты по местам, как в инструкции. Другие могли проигнорировать часть описания, зато выдавали плотность деталей и сложность ракурсов, недоступную первым. Сначала я списывал это на языковой барьер — казалось, что западные и китайские системы по-разному интерпретируют запрос. Но список причин быстро расширился: датасеты, токенизаторы, глубина текстовых энкодеров. Каждая деталь что-то объясняла, но общей картины не давала. За различиями стояло нечто большее — две инженерные школы, изначально оптимизировавшие разные ресурсы, а сейчас движущиеся к конвергенции. Тут я вспомнил старый плакат из дизайн-студии нулевых: «Быстро. Дешево. Качественно. Выберите любые два». Раньше это звучало как шутка, теперь — как точное описание логики развития сложных систем. Эта статья — попытка понять сложившуюся экономику моделей через их историю: разобрать ключевые развилки последних лет, заглянуть под капот графических движков и понять, в какие ниши сегодня выстраивается конвергенция технологий.

    habr.com/ru/companies/ru_mts/a

    #генерация_изображений #искусственный_интеллект #диффузионные_модели #Midjourney #FLUX #DALLE_3 #Stable_Diffusion #ControlNet #Prompt_Engineering #ComfyUI

  4. Промпт-инжиниринг: как написать запрос для генерации изображения

    Привет, «Хабр»! Примеры запросов наглядно показывают, как нейросеть расшифровывает текст и воплощает его в графике. В одном промпте можно задать абсолютно всё: от стиля и освещения до общего настроения, ракурса, текстур и окружения. При этом даже незначительное изменение формулировки способно поменять итоговый результат. В этом гайде мы собрали примеры для разных направлений: реалистичного фото, иллюстрации, брендинга и дизайна, 3D-визуализации и т. д. Для каждого из стилей – также привели примеры результатов генерации. Приятного прочтения) Read more

    habr.com/ru/companies/gptunnel

    #промптинжиниринг #midjourney #stable_diffusion