Guide

Extraction de vêtements par IA : comment fonctionne le détourage

Outfello utilise l’extraction de vêtements par IA pour transformer des photos de tenues en pièces détourées distinctes, et réalise la plupart des détourages d’un vêtement seul sur son propre matériel. L’extraction de vêtements par IA comporte trois étapes : la détection repère et nomme chaque vêtement, la segmentation et le matting le séparent de l’arrière-plan, et une étape de génération peut redessiner les pièces en partie cachées.

Photographiez une tenue, demandez à une application de garde-robe de l’« importer », et quelques secondes plus tard vous obtenez un ensemble de vêtements bien nets sur fond uni : une veste, un T-shirt, un jean, des baskets. C’est ce qu’on appelle l’extraction de vêtements par IA. On dirait un seul tour de magie, mais il s’agit de plusieurs problèmes distincts résolus à la suite, et comprendre ce que fait chaque étape explique la plupart des résultats étranges que vous pourrez rencontrer.

Ce guide présente ces étapes de façon générale, puis explique d’où viennent les cas difficiles et comment prendre des photos qui les évitent.

Les trois étapes de l’extraction de vêtements par IA

Presque tous les systèmes qui extraient des vêtements de photos découpent le travail en trois étapes :

  1. Détection : repérer chaque vêtement sur la photo, tracer une zone approximative autour et indiquer de quoi il s’agit.
  2. Segmentation et matting : déterminer précisément quels pixels appartiennent à ce vêtement, jusqu’aux bords, et supprimer tout le reste.
  3. Nettoyage ou reconstruction : transformer le résultat en une pièce détourée utilisable et, dans les cas plus difficiles, redessiner les parties que l’appareil photo n’a pas pu voir.

Vient ensuite une étape plus légère : nommer chaque pièce, la classer dans une catégorie et lui attribuer une étiquette couleur pour pouvoir la ranger. Ces étapes peuvent être confiées à des modèles distincts ou à différentes parties d’un modèle plus vaste, mais les tâches restent les mêmes.

La détection : repérer chaque vêtement

Un modèle de vision examine l’image entière et propose des zones qui contiennent des vêtements. Chaque zone s’accompagne d’un libellé (chemise, veste, pantalon, baskets, sac) et d’un score de confiance. Les détecteurs d’objets classiques le font avec des cadres englobants ; les modèles vision-langage plus récents peuvent aussi recevoir une consigne en langage courant, comme trouver « chaque vêtement », et décrire ce qu’ils trouvent.

Deux choses rendent les vêtements plus difficiles à détecter que, par exemple, des voitures :

  • Les vêtements changent de forme. Une chemise n’a pas le même aspect posée à plat, sur un cintre, rentrée dans un pantalon ou portée ouverte sous un manteau. Le modèle doit reconnaître la catégorie dans tous ces cas.
  • Les vêtements se touchent. Un haut s’arrête là où commence une jupe, une veste recouvre une chemise, une écharpe passe sur les deux. Les zones se chevauchent et le modèle doit décider quels pixels appartiennent à quel vêtement.

C’est aussi de la détection que viennent la catégorie et une première estimation de la couleur. La couleur est plus délicate qu’il n’y paraît : le même pull marine photographié sous une lumière intérieure chaude et sous la lumière froide du jour donne des valeurs de pixels différentes. Les systèmes prélèvent généralement la couleur sur les pixels du vêtement lui-même, une fois l’arrière-plan supprimé, ce qui explique que l’étiquette puisse s’améliorer une fois la segmentation faite.

La segmentation et le matting : supprimer l’arrière-plan

Une fois la zone d’un vêtement connue, la segmentation décide, pixel par pixel, si chaque point appartient au vêtement. Le résultat est un masque : une image en noir et blanc où le blanc signifie « vêtement ». Pour un vêtement porté, une technique voisine appelée analyse humaine (human parsing) attribue à chaque pixel d’un corps une étiquette (peau, cheveux, haut, bas, chaussures, etc.), ce qui aide à séparer le vêtement du bras ou de la jambe qu’il contient.

Un masque aux bords francs ne suffit pas tout à fait. La maille a des contours duveteux, les tissus transparents laissent voir l’arrière-plan, et les cheveux ou les franges débordent sur la silhouette. Le matting affine le masque en un canal alpha, où chaque pixel du bord peut être partiellement transparent. C’est ce qui évite qu’un pull en mohair ait l’air découpé aux ciseaux.

La suppression de l’arrière-plan échoue de façon prévisible :

SituationCe qui se passePourquoi
Vêtement et arrière-plan de couleurs prochesLes bords sont rognés ou l’arrière-plan débordeLe modèle a peu de contraste pour séparer les deux
Ombres marquéesL’ombre est conservée comme une partie du vêtementUne ombre sombre peut ressembler à un tissu foncé
Arrière-plan chargé, comme une housse de couette à motifsDes morceaux d’arrière-plan subsistentLes contours du motif concurrencent ceux du vêtement
Tissu très transparent ou réfléchissantTrous ou transparence étrangeLe vêtement laisse réellement voir ce qu’il y a derrière

La plupart de ces problèmes tiennent à la photo plutôt qu’au modèle. Comment photographier ses vêtements pour des détourages nets détaille l’éclairage, le fond et le cadrage qui permettent de les éviter.

Pourquoi plusieurs vêtements superposés compliquent la tâche

Un vêtement seul sur une surface unie est presque le cas facile : une zone, un masque, des bords nets. Une tenue complète portée par une personne pose un problème bien plus difficile, pour trois raisons.

L’occultation. Une veste cache l’essentiel de la chemise qu’elle recouvre. La bandoulière d’un sac traverse un haut. Des bras croisés masquent la taille du pantalon. La segmentation ne peut garder que les pixels présents : un détourage direct de la chemise sort donc avec un trou en forme de veste.

Les bords partagés. Là où un haut rentré rejoint une ceinture, ou là où des bottines rencontrent l’ourlet d’un pantalon, le modèle doit décider à quel vêtement appartient chaque pixel. De petites erreurs laissent un éclat d’une pièce collé à une autre.

La pose et les plis. Un vêtement porté épouse un corps. Même quand chaque pixel est visible, le résultat ressemble à une chemise en forme de personne, pas à une chemise que vous reconnaîtriez sur une étagère.

C’est pourquoi les photos de tenues et les selfies dans le miroir sont plus exigeants que les photos à plat, même s’ils sont bien plus pratiques à rassembler.

Pourquoi certaines photos sont redessinées par un modèle d’image

Pour contourner l’occultation et la pose, certains systèmes ne se contentent pas de détourer le vêtement ; ils demandent à un modèle de génération d’images de le redessiner. Le modèle reçoit la photo et la zone détectée, et doit produire le vêtement seul, complet et proprement étalé, en complétant les parties cachées.

Il s’agit de la même famille de modèles que ceux qui génèrent des images à partir de texte, conditionnés ici par le vrai vêtement plutôt que par une simple consigne. L’avantage : un vêtement entier et lisible, même quand la moitié se trouvait sous un manteau. Le prix à payer : le modèle déduit au lieu de copier. Les parties cachées sont une supposition plausible, et de petits détails peuvent dériver n’importe où sur la pièce : un logo peut perdre des lettres, un imprimé se décaler, des coutures changer, et la nuance bouger légèrement.

Dans Outfello, chaque vêtement présent dans le cadre est détecté, pas un seul, et chacun est détouré séparément, fond supprimé, puis nommé, classé dans une catégorie et étiqueté par couleur. La plupart des détourages d’un vêtement seul sont réalisés sur le propre matériel d’Outfello ; une photo contenant plusieurs pièces à la fois est redessinée par un modèle d’image IA. Dans les deux cas, rien n’entre directement dans la garde-robe : chaque pièce arrive d’abord dans une zone de vérification, où elle peut être renommée, déplacée vers une autre catégorie, recevoir des couleurs prélevées sur la pièce détourée, obtenir des étiquettes de détail ou être écartée. La page dressing virtuel explique ce qui se passe ensuite.

Prendre des photos qui se détourent proprement

Une fois les étapes connues, les conseils vont de soi :

  • Montrez le vêtement en entier si vous voulez le récupérer en entier. Une veste ouverte cache moins qu’une veste fermée ; des bras le long du corps cachent moins que des bras croisés.
  • Jouez sur le contraste. Un vêtement clair sur un fond foncé, ou l’inverse, facilite la segmentation.
  • Utilisez une lumière douce et homogène pour éviter les ombres dures qui passent pour du tissu.
  • Photographiez seule une pièce riche en détails si le logo ou l’imprimé compte, pour qu’elle soit détourée plutôt que redessinée.
  • Vérifiez le résultat. Un rapide coup d’œil lors de la vérification repère une mauvaise catégorie, un morceau d’arrière-plan égaré ou un imprimé qui a dérivé, pendant que la photo est encore sous la main.

Des modèles d’image apparentés font le travail inverse : placer un vêtement sur la photo d’une personne. Comment fonctionne l’essayage virtuel par IA explique ce versant.

Questions

Questions fréquentes

Pourquoi manque-t-il une partie du vêtement sur mon détourage ?
Généralement parce que cette partie était cachée sur la photo, par exemple un haut couvert par une veste ou traversé par la bandoulière d’un sac, ou parce que le vêtement se confondait avec un arrière-plan de couleur proche. Une photo où la pièce est entièrement visible sur un fond contrasté donne le résultat le plus net.
Pourquoi un vêtement redessiné est-il légèrement différent de l’original ?
Un modèle de génération d’images reconstruit la pièce au lieu de copier les pixels, si bien que de petits détails comme les imprimés, les logos, les coutures ou la nuance exacte peuvent dériver. Vérifier chaque pièce avant son enregistrement, et reprendre la photo si un détail compte, est la solution pratique.
L’extraction de vêtements par IA fonctionne-t-elle sur les captures d’écran et les pages produit ?
Oui, tant que le vêtement est bien visible. Les photos produit sur fond uni sont même souvent l’entrée la plus facile, car la détection et la segmentation ont peu de choses à séparer.
Puis-je corriger la catégorie ou la couleur choisie par l’IA ?
Dans Outfello, oui. Chaque pièce détectée attend dans une zone de vérification où elle peut être renommée, déplacée vers une autre catégorie, recevoir des couleurs prélevées sur la pièce détourée ou être écartée, et ces mêmes champs restent modifiables par la suite.

Commencer

Tout commence par une photo.

Importez la tenue que vous portez aujourd’hui et regardez-la se décomposer en pièces que vous pouvez vraiment parcourir.