Guía
Extracción de prendas con IA y eliminación del fondo: cómo funcionan
Outfello usa la extracción de prendas con IA para convertir fotos de outfits en prendas recortadas independientes, y procesa la mayoría de los recortes de una sola prenda en su propio hardware. La extracción de prendas con IA tiene tres fases: la detección localiza y etiqueta cada prenda, la segmentación y el matting la separan del fondo, y un paso de generación puede redibujar las prendas que quedan parcialmente ocultas.
Fotografía un conjunto, pide a una app de armario que lo “importe” y, unos segundos después, tendrás una serie de prendas ordenadas sobre fondos lisos: una chaqueta, una camiseta, unos vaqueros, unas zapatillas. Ese proceso se llama extracción de prendas con IA. Parece un único truco, pero son varios problemas distintos resueltos uno tras otro, y saber qué hace cada fase explica la mayoría de los resultados raros que vayas a ver.
Esta guía recorre las fases en términos generales y después explica de dónde vienen los casos difíciles y cómo hacer fotos que los eviten.
Las tres fases de la extracción de prendas con IA
Casi todos los sistemas que extraen ropa de fotos dividen el trabajo en tres fases:
- Detección: localizar cada prenda en la foto, trazar una región aproximada a su alrededor y etiquetar qué es.
- Segmentación y matting: determinar exactamente qué píxeles pertenecen a esa prenda, hasta los bordes, y eliminar todo lo demás.
- Limpieza o reconstrucción: dejar el resultado como un recorte utilizable y, en los casos más difíciles, redibujar las partes que la cámara no pudo ver.
Después viene un paso más ligero en el que cada prenda recibe nombre, categoría y etiquetas de color para poder archivarla. Las fases pueden ser modelos separados o partes de un modelo más grande, pero las tareas son las mismas.
Detección: localizar cada prenda
Un modelo de visión analiza la imagen completa y propone regiones que contienen prendas. Cada región lleva una etiqueta (camisa, chaqueta, pantalón, zapatillas, bolso) y una puntuación de confianza. Los detectores de objetos clásicos lo hacen con cuadros delimitadores; los modelos de visión y lenguaje más recientes también pueden recibir la petición en lenguaje natural de encontrar “todas las prendas de ropa” y describir lo que encuentran.
Dos cosas hacen que la ropa sea más difícil que, por ejemplo, detectar coches:
- La ropa cambia de forma. Una camisa se ve distinta extendida, en una percha, metida por dentro o abierta bajo un abrigo. El modelo tiene que reconocer la categoría en todos esos casos.
- Las prendas están unas junto a otras. Un top termina donde empieza una falda, una chaqueta va sobre una camisa y un pañuelo cruza ambas. Las regiones se solapan, y el modelo tiene que decidir qué píxeles pertenecen a cada prenda.
La detección es también de donde salen la categoría y una primera estimación del color. El color es más complicado de lo que parece: el mismo jersey azul marino fotografiado con luz cálida de interior y con luz natural fría da valores de píxel distintos. Los sistemas suelen tomar el color de los propios píxeles de la prenda una vez eliminado el fondo, y por eso la etiqueta puede mejorar cuando termina la segmentación.
Segmentación y matting: eliminar el fondo
Una vez conocida la región de una prenda, la segmentación decide, píxel a píxel, si cada punto pertenece a la prenda. El resultado es una máscara: una imagen en blanco y negro en la que el blanco significa “prenda”. Para la ropa que lleva puesta una persona, una técnica relacionada llamada análisis semántico del cuerpo (human parsing) etiqueta cada píxel del cuerpo como piel, pelo, ropa de arriba, ropa de abajo, calzado, etc., lo que ayuda a separar la prenda del brazo o la pierna que hay dentro.
Una máscara de bordes duros no basta del todo. Las prendas de punto tienen bordes difusos, los tejidos transparentes dejan ver el fondo, y el pelo o los flecos se superponen al contorno. El matting refina la máscara hasta convertirla en un canal alfa, en el que cada píxel del borde puede ser parcialmente transparente. Eso es lo que evita que un jersey de mohair parezca recortado con tijeras.
La eliminación del fondo falla de formas previsibles:
| Situación | Qué sale mal | Por qué |
|---|---|---|
| La prenda y el fondo son de colores parecidos | Se pierden trozos del borde o se cuela el fondo | El modelo tiene poco contraste para separar |
| Sombras fuertes | La sombra se conserva como parte de la prenda | Una sombra oscura puede parecer tejido oscuro |
| Fondo recargado, como un edredón estampado | Sobreviven trozos del fondo | Los bordes del estampado compiten con los de la prenda |
| Tejido muy transparente o reflectante | Agujeros o transparencias extrañas | La prenda realmente deja ver lo que hay detrás |
La mayoría de estos problemas dependen más de la foto que del modelo. Cómo fotografiar ropa para obtener recortes limpios explica la iluminación, el fondo y el encuadre que los evitan.
Por qué varias prendas superpuestas son más difíciles
Una sola prenda sobre una superficie lisa es casi el caso fácil: una región, una máscara, bordes limpios. Un conjunto completo llevado por una persona es un problema mucho más difícil, por tres razones.
Oclusión. Una chaqueta tapa la mayor parte de la camisa que lleva debajo. La correa de un bolso cruza un top. Los brazos cruzados ocultan la cintura del pantalón. La segmentación solo puede conservar los píxeles que están ahí, así que un recorte directo de la camisa sale con un agujero con forma de chaqueta.
Bordes compartidos. Donde un top metido por dentro se junta con la cinturilla, o las botas con los bajos del pantalón, el modelo tiene que decidir a qué prenda pertenece cada píxel. Los pequeños errores dejan una tira de una prenda pegada a otra.
Postura y pliegues. Una prenda puesta está doblada alrededor de un cuerpo. Aunque todos los píxeles sean visibles, el resultado parece una camisa con forma de persona, no una camisa que reconocerías en una estantería.
Por eso las fotos de outfits y los selfies en el espejo son más exigentes que las fotos en plano, aunque sean mucho más cómodas de reunir.
Por qué algunas fotos las redibuja un modelo de imagen
Para sortear la oclusión y la postura, algunos sistemas no se limitan a recortar la prenda; piden a un modelo de generación de imágenes que la redibuje. El modelo recibe la foto y la región detectada y se le pide que produzca la prenda sola, completa y bien presentada, rellenando las partes que estaban ocultas.
Es la misma familia de modelos que genera imágenes a partir de texto, aquí condicionada por la prenda real en lugar de solo por una instrucción. La ventaja es una prenda completa y legible aunque la mitad estuviera bajo un abrigo. El precio es que el modelo infiere, no copia. Las partes ocultas son una suposición plausible, y los detalles pequeños de cualquier zona de la prenda pueden variar: un logotipo puede perder letras, un estampado puede desplazarse, las costuras pueden cambiar y el tono puede moverse ligeramente.
En Outfello se detectan todas las prendas del encuadre, no solo una, y cada una se recorta por separado sin el fondo y después recibe nombre, categoría y etiquetas de color. La mayoría de los recortes de una sola prenda se procesan en el propio hardware de Outfello; una foto con varias prendas a la vez la redibuja un modelo de imagen de IA. En ambos casos, nada entra directamente en el armario: cada prenda llega primero a una bandeja de revisión, donde se puede renombrar, pasar a otra categoría, tomar sus colores del propio recorte, recibir etiquetas de detalle o descartarse. La página del armario digital explica lo que ocurre después.
Hacer fotos que se extraigan bien
Conocer las fases hace que los consejos sean sencillos:
- Muestra la prenda entera si quieres recuperarla entera. Las chaquetas abiertas tapan menos que las cerradas; los brazos a los lados tapan menos que los brazos cruzados.
- Usa el contraste. Una prenda clara sobre un fondo oscuro, o al revés, facilita la segmentación.
- Usa una luz suave y uniforme para evitar sombras duras que se interpreten como tejido.
- Fotografía por separado las prendas con muchos detalles si el logotipo o el estampado importan, para que se puedan recortar en lugar de redibujarse.
- Revisa el resultado. Un vistazo rápido en la revisión detecta una categoría equivocada, un trozo de fondo perdido o un estampado alterado mientras todavía tienes la foto a mano.
Otros modelos de imagen relacionados hacen el trabajo inverso: poner una prenda sobre la foto de una persona. Cómo funciona la prueba virtual con IA explica esa otra parte.
Preguntas
Preguntas frecuentes
- ¿Por qué a mi recorte le falta una parte de la prenda?
- Normalmente porque esa parte estaba oculta en la foto, por ejemplo un top tapado por una chaqueta o cruzado por la correa de un bolso, o porque la prenda se confundía con un fondo de color parecido. Una foto con la prenda entera visible sobre un fondo que contraste da el resultado más limpio.
- ¿Por qué una prenda redibujada se ve algo distinta del original?
- Un modelo de generación de imágenes reconstruye la prenda en lugar de copiar píxeles, así que detalles pequeños como estampados, logotipos, costuras o el tono exacto pueden variar. La solución práctica es revisar cada prenda antes de guardarla y repetir la foto si un detalle importa.
- ¿La extracción de prendas con IA funciona con capturas de pantalla y páginas de producto?
- Sí, siempre que la prenda se vea con claridad. Las fotos de producto sobre fondo liso suelen ser la entrada más fácil de todas, porque la detección y la segmentación apenas tienen nada que separar.
- ¿Puedo corregir la categoría o el color que eligió la IA?
- En Outfello, sí. Cada prenda detectada espera en una bandeja de revisión donde se puede renombrar, pasar a otra categoría, tomar sus colores del propio recorte o descartar, y esos mismos campos se pueden editar más adelante.
Relacionado
Sigue leyendo
- Caso de usoUna app de armario digital creada a partir de tus fotos de outfitsUsa Outfello como app de armario digital: importa ropa desde tus fotos de outfits, obtén cada prenda recortada y etiquetada por color, y filtra tu armario por categoría.
- GuíaCómo fotografiar ropa para obtener recortes limpiosCómo fotografiar ropa para que la eliminación del fondo funcione: luz suave, un fondo que contraste, la prenda entera en el encuadre, sin solapamientos y sin fotos movidas.
- GuíaCómo la prueba virtual con IA pone una prenda sobre tu fotoCómo funciona la prueba virtual con IA: tu foto y la imagen de una prenda guían a un modelo de imagen. Qué conserva (postura, cuerpo, cara), dónde falla y qué foto usar.