Civitai Beginners Guide To AI Art // #1 Core Concepts

Civitai Beginners Guide To AI Art // #1 Core Concepts

Guía para el Arte AI: Introducción a la Generación de Imágenes

Conceptos Básicos y Terminología

  • Se presentará una guía sobre cómo generar imágenes AI desde cero, incluyendo la instalación de software necesario y la navegación por programas como Automatic 1111, Comfy UI o Easy Diffusion.
  • Se abordarán términos comunes y conceptos que pueden resultar abrumadores para los nuevos en el arte AI, facilitando su comprensión al interactuar con diferentes plataformas.

Tipos de Generación de Imágenes

  • Texto a Imagen: Este proceso implica tomar un texto como entrada y generar una imagen basada en ese texto. Es el método más común utilizado en la generación de imágenes AI.
  • Imagen a Imagen: Utiliza una imagen existente como referencia para crear una nueva imagen. Esto se puede hacer con un solo archivo o mediante un lote de imágenes utilizando un "control net".
  • Inpainting: Permite modificar partes específicas de una imagen usando herramientas de pintura. Funciona similar al "relleno generativo" en Photoshop, pero se realiza localmente dentro del software.
  • Texto a Video: Implica generar videos a partir de descripciones textuales o transformar videos existentes utilizando prompts específicos.
  • Prompts Negativos: Además del prompt principal que indica lo que se desea ver, los prompts negativos especifican lo que no debe aparecer en la imagen generada.

Procesos Adicionales

  • Upscaling: Consiste en aumentar la resolución de las imágenes, mejorando los píxeles existentes. Esto puede hacerse mediante modelos integrados o programas externos antes de compartir las imágenes.

Modelos y Recursos

  • Los "checkpoints", ahora más comúnmente llamados modelos, son archivos resultantes del entrenamiento con millones de imágenes. Dictan el estilo general y calidad de las imágenes generadas.
  • La elección del modelo es crucial; algunos están entrenados específicamente para estilos como anime o realismo, afectando directamente el resultado final.

Archivos y Seguridad

  • Los "checkpoints" son formatos creados por PyTorch Lightning que contienen modelos utilizados por Stable Diffusion. Estos han sido reemplazados mayormente por archivos Safe Tensor debido a su menor susceptibilidad a códigos maliciosos.

¿Qué es Stable Diffusion y sus componentes?

Introducción a Stable Diffusion

  • Se refiere a "SD 1", un modelo entrenado en 595,000 pasos con imágenes de resolución 512x512 del modelo Layon 5B. Este ha sido superado por la última versión de Stability AI, "Stable Diffusion XL".
  • La flexibilidad y la gran cantidad de recursos disponibles para SD 1 son aspectos destacados.

Modelos específicos: Laura y otros

  • "Laura" (Low Rank Adaptation) es un modelo entrenado en conjuntos de datos mucho más pequeños, enfocado en conceptos específicos como personas o estilos.
  • Las inversiones textuales y los embeddings son similares a Laura pero se entrenan en conjuntos de datos aún más pequeños, capturando conceptos como corrección de manos o rostros.

Archivos VAE

  • Los archivos VAE (Variational Autoencoder) son opcionales y mejoran el detalle en las imágenes generadas.
  • Sin un VAE, los colores pueden aparecer apagados o con menos detalles; se recomienda usar uno junto al modelo actual.

Extensiones importantes para Stable Diffusion

Control Nets

  • Control Nets permite realizar tareas más allá del simple texto a imagen, utilizando modelos entrenados para leer estructuras específicas dentro de una imagen.
  • Facilita la generación de nuevas imágenes basadas en poses específicas mediante dummies que posicionan personajes dentro de fotos.

Comunidad Deorum

  • Deorum es una comunidad dedicada al desarrollo de herramientas generativas de IA, conocida por su popular extensión "automatic 1111" que genera videos suaves a partir de prompts textuales.

Enhanced Superresolution Generative Adversarial Network (ESRGAN)

  • ESRGAN es una técnica utilizada para generar imágenes de alta resolución a partir de píxeles de baja resolución, comúnmente encontrada en interfaces estables.

Animate Diff

  • Animate diff inyecta movimiento en generaciones textuales e imagen a imagen, ampliando las capacidades creativas dentro del proceso generativo.

Conclusión sobre términos clave

Convierte cualquier video en un resumen como este

Videos de YouTube, reuniones, clases. Con transcripción, búsqueda y chat.

Video description

Welcome to the Official Civitai Beginners Guide to Stable Diffusion and AI Art! In this video we will preface our upcoming series by discussing Core Concepts and Terms that you will encounter during your time generating AI images and videos. Throughout the weeks, we will be uploading new videos to help get you started on your journey to becoming a master image generator. You can find all of the Core Concepts in this video, in the Civitai Education Hub: https://education.civitai.com/generative-ai-glossary/ Get Social with us! Instagram: https://www.instagram.com/hellocivitai/ X (Twitter): https://twitter.com/HelloCivitai Discord: https://discord.gg/civitai ---------------------------------------------------------------------- Chapters 0:00 Intro 01:28 Text2Img 01:45 Img2Img / Batch 02:25 Inpainting 02:49 Text2Vid / Vid2Vid 03:10 Prompt / Negative Prompt 03:38 Upscale 04:42 Model / Checkpoint 05:37 CKPT / SafeTensor File Types 06:31 Training Data 06:41 LAION-5B 06:57 SD 1.5 / SDXL 1.0 07:36 LoRA 08:11 Textural Inversion / Embeddings 08:27 VAE 09:35 ControlNet 10:09 DeForum 10:36 ESRGAN 10:57 AnimateDiff 11:21 Outro