Civitai Beginners Guide To AI Art // #1 Core Concepts
Guía para el Arte AI: Introducción a la Generación de Imágenes
Conceptos Básicos y Terminología
- Se presentará una guía sobre cómo generar imágenes AI desde cero, incluyendo la instalación de software necesario y la navegación por programas como Automatic 1111, Comfy UI o Easy Diffusion.
- Se abordarán términos comunes y conceptos que pueden resultar abrumadores para los nuevos en el arte AI, facilitando su comprensión al interactuar con diferentes plataformas.
Tipos de Generación de Imágenes
- Texto a Imagen: Este proceso implica tomar un texto como entrada y generar una imagen basada en ese texto. Es el método más común utilizado en la generación de imágenes AI.
- Imagen a Imagen: Utiliza una imagen existente como referencia para crear una nueva imagen. Esto se puede hacer con un solo archivo o mediante un lote de imágenes utilizando un "control net".
- Inpainting: Permite modificar partes específicas de una imagen usando herramientas de pintura. Funciona similar al "relleno generativo" en Photoshop, pero se realiza localmente dentro del software.
- Texto a Video: Implica generar videos a partir de descripciones textuales o transformar videos existentes utilizando prompts específicos.
- Prompts Negativos: Además del prompt principal que indica lo que se desea ver, los prompts negativos especifican lo que no debe aparecer en la imagen generada.
Procesos Adicionales
- Upscaling: Consiste en aumentar la resolución de las imágenes, mejorando los píxeles existentes. Esto puede hacerse mediante modelos integrados o programas externos antes de compartir las imágenes.
Modelos y Recursos
- Los "checkpoints", ahora más comúnmente llamados modelos, son archivos resultantes del entrenamiento con millones de imágenes. Dictan el estilo general y calidad de las imágenes generadas.
- La elección del modelo es crucial; algunos están entrenados específicamente para estilos como anime o realismo, afectando directamente el resultado final.
Archivos y Seguridad
- Los "checkpoints" son formatos creados por PyTorch Lightning que contienen modelos utilizados por Stable Diffusion. Estos han sido reemplazados mayormente por archivos Safe Tensor debido a su menor susceptibilidad a códigos maliciosos.
¿Qué es Stable Diffusion y sus componentes?
Introducción a Stable Diffusion
- Se refiere a "SD 1", un modelo entrenado en 595,000 pasos con imágenes de resolución 512x512 del modelo Layon 5B. Este ha sido superado por la última versión de Stability AI, "Stable Diffusion XL".
- La flexibilidad y la gran cantidad de recursos disponibles para SD 1 son aspectos destacados.
Modelos específicos: Laura y otros
- "Laura" (Low Rank Adaptation) es un modelo entrenado en conjuntos de datos mucho más pequeños, enfocado en conceptos específicos como personas o estilos.
- Las inversiones textuales y los embeddings son similares a Laura pero se entrenan en conjuntos de datos aún más pequeños, capturando conceptos como corrección de manos o rostros.
Archivos VAE
- Los archivos VAE (Variational Autoencoder) son opcionales y mejoran el detalle en las imágenes generadas.
- Sin un VAE, los colores pueden aparecer apagados o con menos detalles; se recomienda usar uno junto al modelo actual.
Extensiones importantes para Stable Diffusion
Control Nets
- Control Nets permite realizar tareas más allá del simple texto a imagen, utilizando modelos entrenados para leer estructuras específicas dentro de una imagen.
- Facilita la generación de nuevas imágenes basadas en poses específicas mediante dummies que posicionan personajes dentro de fotos.
Comunidad Deorum
- Deorum es una comunidad dedicada al desarrollo de herramientas generativas de IA, conocida por su popular extensión "automatic 1111" que genera videos suaves a partir de prompts textuales.
Enhanced Superresolution Generative Adversarial Network (ESRGAN)
- ESRGAN es una técnica utilizada para generar imágenes de alta resolución a partir de píxeles de baja resolución, comúnmente encontrada en interfaces estables.
Animate Diff
- Animate diff inyecta movimiento en generaciones textuales e imagen a imagen, ampliando las capacidades creativas dentro del proceso generativo.
Conclusión sobre términos clave
Convierte cualquier video en un resumen como este
Videos de YouTube, reuniones, clases. Con transcripción, búsqueda y chat.