AI, pourquoi dessines-tu toujours de belles femmes ?

📅 2026-10-05

Résumé :

Au début du mois de mai de cette année, une vidéo de cinq secondes de X est devenue virale. Il s'agit d'une émission de la Ligue professionnelle coréenne de baseball, les Hanwha Eagles jouent contre les Doosan Bears. La caméra s'est tournée vers une femme dans les gradins portant un haut blanc et un jean, les jambes croisées. À un moment donné, elle a semblé soupirer et a détourné le regard, l’air insatisfaite du jeu.


La légende de la vidéo est "Femmes coréennes ordinaires". Au moment de la publication de cet article, la vidéo a été visionnée 15,25 millions de fois|Source vidéo : X @kangminlee

Mais bientôt, un groupe de fans seniors a réalisé que quelque chose n'allait pas. Le tableau d'affichage indiquait que le frappeur était Cho Inseong, mais Cho Inseong a pris sa retraite en 2017 et est maintenant entraîneur à Doosan.

De plus, le slogan d'encouragement dans les tribunes contient un mot de plus que le slogan officiel des Doosan Bears, qui semble être une traduction brutale et littérale par AI. Quant à cette émission, le commentaire était avec un accent américain standard, ce qui était également très suspect.

Cette femme n'existe pas, elle a été générée par l'IA. Mais la vidéo n’a pas disparu après sa diffusion. Au lieu de cela, c’est devenu un modèle. Tout le monde a mis son visage sur le même écran de diffusion, créant une image d'eux-mêmes capturée par la caméra du stade, qui est rapidement devenue populaire sur les réseaux sociaux.


« Moi-même capturé par la caméra du stade » est rapidement devenu un modèle populaire|Source photo : RADII

Chaque fois que les capacités d'image de l'IA sont améliorées, il y aura presque toujours un succès populaire. Par exemple, en mars 2025, GPT-4o était capable de dessiner des images, et l'écran était rempli de photos redessinées dans le style des animations Ghibli ; fin août, la Nano Banana de Google a été lancée. La façon préférée de tous de jouer était de transformer des selfies en personnages placés sur le bureau de l’ordinateur. Les utilisateurs ont généré plus de 200 millions de photos en deux semaines.

Les objets populaires changent à chaque fois, et la plupart d'entre eux sont basés sur le gameplay « mettez-vous dedans ». Mais cette fois sur le terrain, une séquence qui n'était pas si évidente auparavant a été révélée : d'abord, une beauté inexistante a trompé des dizaines de millions de personnes, puis a développé un modèle que tout le monde peut jouer.

La beauté n'est pas un second rôle qui apparaît accidentellement dans la scène, elle s'apparente plutôt à une valeur par défaut

.

Cette valeur par défaut est antérieure d'un demi-siècle à l'IA. En 1973, au début de la numérisation des images, un groupe d’ingénieurs a voulu tester une nouvelle technologie d’image et a également choisi une belle femme.

01

La Première Dame d'Internet

Lena Soderberg a commencé sa carrière en tant que mannequin à Chicago, dans l'Illinois. Elle avait auparavant quitté la Suède pour émigrer aux États-Unis en tant que fille au pair. En 1972, elle pose pour la page centrale du numéro de novembre du magazine Playboy. Ce numéro de Playboy s'est vendu à plus de 7,16 millions d'exemplaires, ce qui en fait le numéro le plus vendu du magazine.

La plupart des personnes qui ont étudié le traitement d'images numériques l'ont vue : portant un chapeau à larges bords, les épaules nues et regardant la caméra de côté. Au fil des décennies, d’innombrables algorithmes de compression et de traitement d’images ont été testés sur ce visage.


Lena Soderberg est la première dame du cyber | Source de l'image : BASE DE DONNÉES D'IMAGES SIPI

En 1973, des chercheurs du Signal Image and Processing Institute de l'Université de Californie du Sud se démenaient pour trouver une nouvelle image pour un document de recherche. Ils ont épuisé leur stock habituel d’images de test. À ce moment-là, un collègue serait arrivé avec le numéro de novembre 1972 de Playboy. Voyant la situation difficile des chercheurs, il a déchiré une bande de 5,12 pouces du haut de l'insert central et l'a introduite dans leur scanner.

Depuis,

cette image a été largement utilisée dans la communauté du traitement d'images et est même devenue l'image de test par défaut de l'industrie

.

En 1996, David Munson, rédacteur en chef de IEEE Transactions on Image Processing, a écrit un court article expliquant comment cette image numérisée de manière aléatoire est devenue une norme industrielle. Il a donné deux raisons. Le premier est technique. Cette image contient tous les détails, zones plates, ombres et textures, elle convient donc aux algorithmes de test. Le deuxième article est plus conforme à la nature humaine :

C'est une photo d'une jolie femme. Il n'est pas surprenant qu'un cercle de recherche dominé par les hommes y soit attiré.

.

Compte tenu de l'origine de cette image, son utilisation n'a pas été sans controverse. En 1991, Playboy a découvert l'image sur la couverture d'une revue universitaire, a envoyé une lettre revendiquant le droit d'auteur et a finalement abandonné l'image, lui permettant ainsi de continuer à être utilisée dans la recherche. Le vice-président des nouveaux médias de l'entreprise a déclaré que puisque c'est devenu un phénomène, il vaut mieux en profiter.

Différentes voix s'expriment également au sein de la communauté de recherche en traitement d'images. Ils ont noté que les ingénieurs ne devraient pas utiliser de matériel provenant d'une publication qui pourrait être considéré comme humiliant pour les femmes.

Même Lena elle-même a déclaré dans le documentaire "Losing Lena" qu'elle espérait arrêter d'utiliser cette photo.


Dans le documentaire, Lena elle-même brandit la célèbre photo d'elle prise il y a plus de 50 ans | Source de l'image : IMDB

Par conséquent, à compter du 1er avril 2024, l'IEEE Computer Society n'acceptera plus les articles utilisant cette image.

Cinquante et un ans se sont écoulés depuis cette analyse

.

02

Visage moyen

Maintenant, les questions des tests dans le cercle technique ont depuis longtemps été modifiées.

L'IA ne peut pas boire un verre plein de vin rouge. Le niveau de liquide dans le verre s'arrête toujours au milieu. Lorsque l’IA dessine une horloge, les aiguilles s’arrêtent toujours à 10h10. La raison est la même : la plupart des photos de vins rouges sur Internet ne sont pas des verres pleins, et la convention dans les publicités horlogères est de les afficher à 10h10. Le modèle répliquera la distribution des données d'entraînement et ne pourra pas se débarrasser de l'inertie des données.


L'explication la plus courante expliquant pourquoi les publicités s'arrêtent toujours à 10h10 est qu'elles ressemblent à un « sourire joyeux », mais avant les années 1950, il était plus courant de s'arrêter à 8h20 | Source de l'image : Reddit

Le vin rouge et les horloges sont la preuve que « les modèles ne sont pas assez bons ». Mais lorsqu’il s’agit de belles femmes, la situation est différente. « Son » inertie s’aligne sur l’esthétique des gens.

En 1990, les psychologues Judith Langlois et Lori Roggman ont mené une expérience : elles ont calculé mathématiquement la moyenne d'un lot de visages pour synthétiser un nouveau visage, puis ont demandé aux gens de l'évaluer. En conséquence, le visage synthétique est plus attrayant que presque tous les visages réels impliqués dans la synthèse, et plus il y a de visages impliqués dans la moyenne, plus le visage synthétique est beau. Cet effet est vrai aussi bien pour les visages masculins que féminins, ainsi que pour différents groupes ethniques.

Le titre de l'article s'intitule simplement

"Les visages attrayants ne sont que moyens"

.

Des observations similaires ont eu lieu plus tôt. En 1877, quelqu'un écrivit à Darwin et lui dit qu'en superposant deux portraits de femme à l'aide d'un stéréoscope, le visage obtenu serait à chaque fois nettement plus beau.

L'essence du modèle génératif est en fait d'apprendre une distribution de données, puis d'échantillonner à proximité du centre de la distribution. En d’autres termes, le modèle est programmé pour dessiner des visages moyens, et les visages moyens sont ce que les humains considèrent comme beaux.

La psychologie humaine combinée aux principes des machines est devenue le fondement technique de la beauté comme valeur par défaut de l'IA

.

Une étude de 2023 de l'Université nationale australienne a poussé cette collision à l'extrême. Les psychologues ont découvert que les visages blancs générés par l’IA étaient plus souvent jugés comme « réels » par les participants expérimentaux que les vrais visages blancs. Les chercheurs appellent cela «l'hyperréalisme de l'IA», expliquant que les données d'entraînement concernent principalement des personnes blanches et que les visages générés par le modèle sont plus proches de la moyenne de ce groupe et seront perçus comme plus typiques et ressemblant davantage à de vraies personnes.

Après la publication de l'expérience de Langlois, il a reçu une critique : le visage synthétique n'est beau que parce que les taches et les imperfections de la peau s'effacent facilement lors de la moyenne. Cette critique était méthodologique en 1990.

Mais aujourd’hui, cela ressemble à une prophétie.

La caractéristique la plus typique des beautés IA est une peau excessivement lisse. Plus de trois décennies plus tard, les organismes de vérification des faits apprennent aux gens à identifier les images de l’IA, et l’un des défauts répertoriés est une peau trop lisse. Cet artefact statistique que les critiques ont souligné il y a plus de trois décennies caractérise les beautés de l'IA de 2025.

03

Œuf de gypse

Lena a été sélectionnée dans un laboratoire. La valeur par défaut d'aujourd'hui est issue des données.

Fin 2022, la fonction "Magic Avatar" de l'application de retouche photo Lensa est soudainement devenue populaire : téléchargez quelques selfies, et l'IA générera pour vous une centaine de portraits de styles différents. Melissa Heikkilä, journaliste IA au MIT Technology Review, l'a également utilisé pour générer 100 avatars d'elle-même, dont 16 seins nus et 14 avec des vêtements minimes et des poses sexy. Et ses collègues masculins ont tous eu des astronautes, des explorateurs et des inventeurs. Aucun d’entre eux n’a donné d’indices au modèle au cours de ce processus.


Image générée par Melissa via Lensa|Source de l'image : MIT TECHNOLOGE REVIEW

Melissa a expliqué dans son article que le modèle à l'origine de cet article s'est formé à partir de photos capturées sur Internet, et

Internet regorge déjà de photos de femmes légèrement vêtues. Cela amène le modèle à générer des "femmes légèrement vêtues" comme valeur par défaut

.

Ensuite, l'inertie comportementale des utilisateurs continuera à alimenter cette tendance. Chaque génération, épargne et transmission est un vote. Une étude de 2025 a recensé les changements de contenu sur la communauté d'images IA Civitai : la proportion d'images NSFW (orientées vers les adultes) est passée de 41 % en janvier 2023 à 80 % en décembre 2024.

Enfin, le fabricant inscrira ces votes dans le modèle. Afin de permettre au modèle d'image de générer des images plus agréables, les fabricants formeront un « marqueur », qui est techniquement appelé modèle de récompense ou marqueur esthétique. Son travail consiste à apprendre quelles images les gens trouvent belles, puis à utiliser cette norme pour entraîner le modèle : aller davantage dans la direction avec un score élevé et moins dans la direction avec un score faible.

L'un des scores les plus couramment utilisés s'appelle PickScore. Ses données de formation proviennent d'une application Web : l'utilisateur écrit un mot d'invite, le système donne deux images et l'utilisateur choisit celle qu'il préfère.

Ces données seront examinées et les utilisateurs qui génèrent du contenu NSFW seront éliminés, mais il y a encore beaucoup de mots d'invite NSFW mélangés. Un article de 2024 étudiant les modèles de récompense a révélé qu'en utilisant PickScore pour affiner le modèle,

même si les mots d'invite n'ont rien à voir avec le sexe, le modèle dessinera plus d'images NSFW

.

Une image apparaît alors : le réviseur de contenu à la réception intercepte, mais le correcteur en backend se retire. Les démos officielles du fabricant ne présentent jamais les beautés NSFW et la politique de génération est très stricte. Mais comme nous le savons tous, les grands modèles actuels ne sont pas entièrement contrôlables. Il a été formé par le goût de l'utilisateur, et le goût de l'utilisateur est allé très loin dans l'inertie.

Dans les années 1930, l'éthologue néerlandais Niko Tinbergen a observé une espèce de mouette. Cet oiseau pond de petits œufs bleu pâle avec des taches grises. Mais lorsqu’il plaçait d’énormes œufs factices en plâtre bleu vif à pois noirs à côté du nid, les oiseaux abandonnaient leurs propres œufs et grimpaient sur les œufs en plâtre pour les faire éclore. Il a appelé ces imitations exagérées, plus attrayantes que la réalité, « stimulation supranormale ».


Niko Tinbergen peint des œufs lors d'une expédition en plein air | milieu universitaire

Le visage humain est également doté d'une stimulation extraordinaire, et il pousse encore plus loin le concept « la moyenne est la plus belle ». En 1994, David Perrett et d’autres ont publié une étude dans Nature : un groupe des plus beaux visages a été synthétisé pour être plus sympathique que le visage moyen de tous les gens ; et si la différence entre celui-ci et le visage moyen était amplifiée de 50 %, le score serait encore plus élevé. Les sujets japonais et les sujets blancs ont choisi la même direction.

Parmi les principales sociétés d'IA, au moins une a directement transformé cette psychologie en fonctionnalité de produit. La génération d'images de Grok comporte quatre modes, dont l'un est appelé Spicy. Lorsqu'il est activé, le filtrage du contenu sera assoupli, permettant la génération de contenu suggestif et de nudité partielle, et n'est ouvert qu'aux utilisateurs payants.

En janvier 2026, les utilisateurs ont découvert qu'ils pouvaient télécharger des photos de n'importe qui pour « déshabiller numériquement » Grok. Parmi les victimes figuraient des enfants, et de nombreux gouvernements sont intervenus pour faire pression. X a répondu en limitant globalement la génération d’images à une fonctionnalité payante.

Le porte-parole du Premier ministre britannique a déclaré : Il s’agit simplement d’une fonction de génération d’images illégales, transformée en service payant.

L'IA prend la forme du groupe de personnes qui appuient le plus souvent sur "J'aime"

. En 1973, ce groupe était majoritairement masculin. Aujourd’hui, ce sont les utilisateurs qui cliquent le plus, transfèrent le plus et économisent le plus. La préférence des gens pour la beauté a effectivement une base biologique. Dès l’âge de deux ou trois mois, les bébés regarderont plus longtemps les visages jugés attrayants par les adultes.

Lena, la Première Dame d'Internet, était un accident. La valeur par défaut actuelle est que le modèle se développe à partir du centre des données. Les clics de l'utilisateur l'ont poussé de plus en plus loin, et finalement quelqu'un y a mis un prix.

Les caractéristiques statistiques du modèle de génération d'IA, les préférences esthétiques humaines pour le « visage moyen », ainsi que les clics des utilisateurs et les incitations commerciales forment une boucle de rétroaction. Ils sont indépendants les uns des autres, mais ensemble, ils vont dans la même direction, devenant ainsi notre option par défaut pour la consommation de contenu aujourd'hui.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire