Cómo generar imágenes con IA en tu propio ordenador
Montar Stable Diffusion en local no es solo "más barato que una suscripción" — es no depender de cuotas mensuales ni de que un servicio externo decida qué puedes generar. Esta guía está escrita desde una configuración real en funcionamiento, con los problemas concretos que aparecen al montarla en Windows.
Por qué en local y no en la nube
Los generadores de imagen en la nube (Pollinations, servicios basados en Gemini o similares) tienen una ventaja real: no necesitas hardware potente ni instalar nada. Pero tienen coste por imagen o límites de cuota, y dependes de la disponibilidad del servicio.
Generar en local invierte esa relación: pagas el coste del hardware una vez, y a partir de ahí cada imagen es gratis y sin límite — pero necesitas una GPU con memoria suficiente, y la instalación en Windows tiene un par de puntos donde la mayoría de tutoriales genéricos fallan.
Qué GPU necesitas de verdad
La cifra que importa es la VRAM, no la potencia bruta de la tarjeta. Es lo que determina qué modelo puedes cargar y a qué resolución, no lo rápido que genera.
Configuración real de referencia: una NVIDIA GeForce GTX 1080 Ti (11 GB de VRAM) — no es una tarjeta reciente, pero con la elección de modelo correcta genera sin problemas de memoria. Con 11 GB no cabe cómodamente Stable Diffusion XL a resolución completa; el modelo que sí funciona bien en esta tarjeta es Stable Diffusion 1.5, que pide bastante menos memoria y sigue dando resultados sólidos.
Con 12-16 GB de VRAM (ver la ficha de GPU para IA local en la sección de equipo) ya entra con más margen SDXL y resoluciones mayores. Por debajo de 8 GB, cíñete a SD 1.5 y resoluciones moderadas, o usa técnicas de ahorro de memoria como el attention slicing que se menciona más abajo.
El primer tropiezo: la versión de Python
Esto es lo que más gente pierde tiempo resolviendo, y casi ningún tutorial lo avisa por adelantado: en Windows, las versiones con soporte CUDA de PyTorch no siempre tienen wheels precompiladas para la última versión de Python. Si creas el entorno virtual con Python 3.13 recién instalado, la instalación de PyTorch con CUDA puede fallar o caer silenciosamente a la versión CPU.
La combinación que funciona de forma fiable ahora mismo es Python 3.11 o 3.12. Antes de instalar nada, comprueba tu versión:
python --version
Si tienes 3.13 o superior, instala Python 3.11 o 3.12 en paralelo (no hace falta desinstalar el que ya tengas) y crea el entorno virtual apuntando explícitamente a esa versión.
Instalación: las piezas que necesitas
Con la versión de Python correcta, el entorno se monta con tres bloques:
1. PyTorch con CUDA, usando el índice de paquetes específico de PyTorch (no el PyPI genérico, que instala la versión sin CUDA):
pip install --extra-index-url https://download.pytorch.org/whl/cu121 torch torchvision
2. La librería de difusión (diffusers),
que es la que carga el modelo y ejecuta la generación, junto a
transformers, accelerate y
safetensors como dependencias.
3. El propio modelo, que se descarga la
primera vez que lo usas (varios GB) y queda en caché local. No
hace falta descargarlo a mano: al pedirlo por nombre
(por ejemplo runwayml/stable-diffusion-v1-5), la
librería lo baja sola.
Verificación rápida de que todo está bien enlazado — esto
debería devolver True y el nombre de tu tarjeta:
python -c "import torch; print(torch.cuda.is_available()); print(torch.cuda.get_device_name(0))"
Si devuelve False, casi siempre es el problema de
la versión de Python del apartado anterior, no un problema de
drivers.
Ajustes que sí importan
Tres parámetros controlan la mayor parte del resultado y del consumo de memoria:
- Resolución — más VRAM consumida cuanto mayor. 768×1024 es un punto de partida razonable en una tarjeta de 8-11 GB; con más memoria puedes subir a 1024×1024 o más.
- Pasos de inferencia (steps) — más pasos no significa proporcionalmente mejor: hay un punto de retorno decreciente alrededor de 20-30 pasos para la mayoría de modelos.
- Guidance scale — cuánto se ciñe la imagen al texto del prompt. Valores altos (10+) generan resultados más literales pero a veces con artefactos; valores más bajos (5-7) dejan más margen creativo al modelo.
Si te quedas sin memoria (error de tipo CUDA out of
memory), la opción más simple antes de bajar resolución
es activar attention slicing en la librería
diffusers: procesa la atención del modelo por
partes en vez de de golpe, a cambio de algo de velocidad.
Cuándo NO montar esto en local
Sé honesto contigo mismo con el cálculo: si generas pocas imágenes al mes, el coste de una GPU nueva no se amortiza frente a usar un servicio en la nube gratuito o de pago por uso. Local compensa cuando generas con volumen y regularidad, o cuando necesitas control total sobre el modelo y sin límites de terceros.
Un enfoque intermedio razonable: usar la nube por defecto y reservar la generación local para cuando falle o esté saturada, en vez de depender de una sola vía. Es exactamente el patrón que evita quedarte bloqueado sin poder generar nada si un proveedor externo cae.
Si vas a montar esto desde cero
La pieza que más veces se queda corta es la VRAM, no la marca ni el precio de la tarjeta. Tenemos una ficha con los criterios concretos a mirar antes de comprar.
Ver criterios de GPU para IA localLa versión sin fricción: ImageForge
Todo lo de arriba — elegir el modelo correcto según tu VRAM, resolver el problema de la versión de Python, instalar PyTorch con el índice correcto, ajustar resolución/steps/ guidance — es exactamente lo que automatiza ImageForge, una herramienta que hemos construido nosotros mismos a partir de esta misma configuración real, para no tener que repetir el proceso a mano cada vez.
Qué hace, en concreto:
- Detecta tu GPU sola. Al arrancar, comprueba si tienes una tarjeta NVIDIA con VRAM suficiente (a partir de 6 GB). Si la tienes, instala el backend local automáticamente, sin que ejecutes ningún comando a mano; si no, usa la nube sin más.
- Tres motores intercambiables: local (tu GPU), Pollinations (nube gratis, sin cuenta) y Gemini (nube, con tu propia clave de Google AI Studio). Cambias entre ellos desde un selector, no editando configuración.
- Mejora de prompts con IA, gratis vía Groq: escribes una idea corta y en español, y la convierte en un prompt detallado en inglés — el idioma en el que estos modelos dan mejor resultado — sin que tengas que aprender a escribir prompts tú mismo.
- Panel web y API HTTP. Puedes generar imágenes a mano desde el navegador, o hacer que cualquier otra aplicación tuya le pida imágenes por HTTP — es como generamos las imágenes que usamos nosotros mismos en nuestros propios proyectos.
Puesta en marcha, una vez publicada: descargar, ejecutar
start.bat, y listo — el propio programa decide
si puede usar tu GPU o si te conviene más la nube, según lo
que detecte.
Descarga de ImageForge
Todavía en desarrollo activo y en pruebas internas — no publicamos nada que no hayamos probado nosotros mismos primero. En cuanto esté lista, el enlace de descarga aparece aquí mismo, sin necesidad de buscarlo en otro sitio.
Descarga próximamente