Convierte fotos en ilustraciones con IA (modelo de difusión)

Ejecuta un modelo de difusión basado en Stable Diffusion dentro de tu navegador para redibujar fotos en anime, acuarela, óleo y otros estilos. Más flexible que “Estilos de ilustración y pintura”, con control mediante prompt. Las fotos nunca salen de tu dispositivo.

Esta herramienta descarga un modelo de IA (unos 2100 MB) en la primera ejecución. Por las limitaciones actuales de ancho de banda del servidor, la descarga puede tardar alrededor de 10 minutos; las siguientes ejecuciones usan la copia guardada en tu navegador. Se requiere WebGPU.

Ajustes

0.55

Cuál usar — versión ligera frente a modelo de difusión

Hay dos herramientas para convertir fotos en ilustraciones. Elige según tu dispositivo y lo que busques. Recomendamos probar primero la ligera y pasar al modelo de difusión si quieres más.

Estilos de ilustración y pintura

Método
GAN ligeras (AnimeGANv2 / fast-neural-style) que solo cambian el estilo
Requisitos
Funciona sin WebGPU, incluso en móviles y portátiles antiguos
Primera descarga
Unos 8MB por estilo, unos 50MB los 7
Tiempo por imagen
Menos de un segundo con WebGPU, unos segundos en CPU
Control del estilo
Elige entre 7 estilos fijos
Resultado
Composición, expresión y rasgos intactos; rara vez falla
Ideal para
Avatares rápidos o dispositivos modestos

Ilustración con IA (difusión)Esta página

Método
Modelo de difusión (LCM Dreamshaper v7) que repinta la foto a partir de un prompt
Requisitos
Requiere WebGPU y 4GB o más de memoria de GPU (compartida en GPU integradas)
Primera descarga
Unos 2,1GB. Ahora tarda unos 10 minutos por el ancho de banda de nuestro servidor
Tiempo por imagen
20–40 segundos en GPU integrada, unos segundos en GPU dedicada
Control del estilo
5 preajustes más prompts libres en inglés
Resultado
Resultados más ricos y pictóricos; con más intensidad se aleja del rostro original
Ideal para
PC gaming o Mac con Apple Silicon, y quien quiera controlar el estilo con detalle

Cómo se usa

  1. 1

    Añade una foto

    Suelta una foto. Se usa el cuadrado central (512×512), así que las fotos con el rostro en el centro dan mejores resultados.

  2. 2

    Elige el estilo y la intensidad

    Elige anime, acuarela, óleo, cómic o pixel art, o escribe tu propio prompt en inglés. Una intensidad mayor acentúa el estilo; una menor conserva más el rostro original.

  3. 3

    Genera y elige

    Se genera el número de imágenes solicitado y se muestran una junto a otra. Guarda las que te gusten; si vuelves a ejecutar con los mismos ajustes, obtendrás resultados distintos.

Cómo funciona y qué conviene saber antes

LCM Dreamshaper v7 (licencia MIT), convertido a ONNX en fp16, se ejecuta en onnxruntime-web con WebGPU. La foto se codifica a un espacio latente, se le añade ruido y el modelo la redibuja en 4 pasos siguiendo el prompt (img2img). La intensidad es la cantidad de ruido; en torno a 0,5 cambia el estilo manteniendo reconocible a la persona.

Los modelos suman 2,1 GB, así que la primera descarga lleva un rato. Por el ancho de banda actual del servidor (el enlace de subida del proxy principal) puede tardar alrededor de 10 minutos; mejorará con un cambio de infraestructura. Las siguientes ejecuciones usan la copia guardada en tu navegador. Se requieren WebGPU y unos 4 GB de memoria de GPU (memoria compartida en las GPU integradas); cada imagen tarda de 20 a 40 s en una GPU integrada o unos segundos en una dedicada.

Preguntas frecuentes

¿Mis fotos se envían a un servidor?

No. Los modelos se descargan en tu navegador y la generación se ejecuta en la GPU de tu dispositivo.

La descarga es lenta

El ancho de banda del servidor está limitado actualmente a unos 4–5 MB/s, así que 2,1 GB tardan alrededor de 10 minutos. Está prevista una ampliación del ancho de banda. La descarga se hace una sola vez; las siguientes ejecuciones usan la copia guardada.

El rostro ya no se parece a la persona

El img2img por difusión se aleja más de la foto cuanto mayor es la intensidad. Bájala a 0,4–0,5 para conservar el parecido. Si los detalles del rostro se deshacen, pasa el resultado por “Restaurar rostros con IA”.

¿En qué se diferencia de “Estilos de ilustración y pintura”?

Esa herramienta usa GAN ligeras que conservan la composición y solo cambian el acabado (segundos, modelos de 8 MB). Esta redibuja la imagen con un modelo de difusión, así que es más flexible y se guía por el prompt, pero el modelo es grande y se requiere WebGPU.

Ayúdanos a mejorar el servicio

Cuando una conversión falla, enviarnos las circunstancias nos ayuda a encontrar la causa. Saber qué dispositivos y formatos fallan más, y cuánto tarda el procesamiento, nos permite revisar los formatos admitidos y corregir los errores. Si no te importa, dejarlo activado nos ayuda mucho.

Qué se envía

La herramienta usada y los ajustes elegidos (formato de salida, calidad, etc.), las características del dispositivo (GPU, memoria, número de núcleos), el formato de entrada con su tamaño aproximado, cuántos archivos tuvieron éxito o fallaron y cuánto tardó, y el tipo y los detalles del error cuando algo falla.

Qué no se envía nunca

Los archivos en sí, los nombres de archivo, el texto, los subtítulos o las indicaciones que añades a un vídeo, y las direcciones IP. Los datos van únicamente al servidor de este sitio, nunca a un servicio de terceros.

Herramientas relacionadas