{"id":2135,"date":"2025-06-02T13:38:50","date_gmt":"2025-06-02T13:38:50","guid":{"rendered":"https:\/\/leyton.majjane.agency\/ca\/post\/generation-dimages-personnalisee-a-partir-de-texte-par-renforcement\/"},"modified":"2026-07-26T17:00:49","modified_gmt":"2026-07-26T15:00:49","slug":"generation-dimages-personnalisee-a-partir-de-texte-par-renforcement","status":"publish","type":"article","link":"https:\/\/leyton.com\/ca\/insights\/articles\/generation-dimages-personnalisee-a-partir-de-texte-par-renforcement\/","title":{"rendered":"G\u00e9n\u00e9ration d\u2019images personnalis\u00e9e \u00e0 partir de texte par renforcement"},"content":{"rendered":"
La g\u00e9n\u00e9ration d\u2019images personnalis\u00e9e \u00e0 partir de texte<\/strong> conna\u00eet un r\u00e9volution gr\u00e2ce \u00e0 l’apprentissage par renforcement. Ces mod\u00e8les permettent aux utilisateurs de g\u00e9n\u00e9rer des images<\/a><\/strong> dans divers styles \u00e0 partir d\u2019une description textuelle et d\u2019un ensemble d\u2019images de r\u00e9f\u00e9rence.<\/p>\n Bien que les mod\u00e8les de g\u00e9n\u00e9ration bas\u00e9s sur la diffusion<\/a><\/strong> aient obtenu des r\u00e9sultats impressionnants, ils alt\u00e8rent souvent la structure visuelle et les d\u00e9tails de l\u2019objet durant le processus de diffusion. <\/p>\n Ce probl\u00e8me survient car ces mod\u00e8les utilisent un objectif de reconstruction<\/strong> simple pendant l’entra\u00eenement. Ce qui peine \u00e0 maintenir la coh\u00e9rence structurelle entre les images g\u00e9n\u00e9r\u00e9es et les images de r\u00e9f\u00e9rence.<\/p>\n Pour rem\u00e9dier \u00e0 ce d\u00e9fi, un nouveau cadre d\u2019apprentissage par renforcement<\/strong> a \u00e9t\u00e9 con\u00e7u. Ceci utilise la m\u00e9thode du gradient de politique d\u00e9terministe<\/strong> pour la g\u00e9n\u00e9ration d’images personnalis\u00e9es<\/strong> \u00e0 partir de texte.<\/p>\n Ce cadre permet l’incorporation de divers objectifs, qu’ils soient diff\u00e9rentiables <\/strong>ou non<\/strong>–diff\u00e9rentiables<\/strong>, pour guider les mod\u00e8les de diffusion dans l’am\u00e9lioration de la qualit\u00e9 des images g\u00e9n\u00e9r\u00e9es. <\/p>\n Les r\u00e9sultats exp\u00e9rimentaux <\/a><\/strong>sur des ensembles de donn\u00e9es de r\u00e9f\u00e9rence pour la g\u00e9n\u00e9ration d’images personnalis\u00e9e \u00e0 partir de texte<\/strong> montrent que cette approche surpasse consid\u00e9rablement les m\u00e9thodes de pointe actuelles en termes de fid\u00e9lit\u00e9 visuelle tout en maintenant l’alignement avec la description textuelle. <\/p>\n Les avanc\u00e9es r\u00e9centes dans la g\u00e9n\u00e9ration <\/a>d’images personnalis\u00e9e \u00e0 partir de texte<\/strong> ont d\u00e9montr\u00e9 une capacit\u00e9 remarquable \u00e0 cr\u00e9er des images de haute qualit\u00e9. <\/p>\n Ces mod\u00e8les sont robustes, capables de produire des images couvrant des concepts vari\u00e9s dans divers contextes et arri\u00e8re-plans. Ouvrant ainsi de nouvelles perspectives de recherche et d’innovation.<\/p>\n Cependant, une limitation demeure dans la nature non contr\u00f4l\u00e9e<\/strong> de ces mod\u00e8les de g\u00e9n\u00e9ration. Ces mod\u00e8les ne peuvent pas encore synth\u00e9tiser des concepts personnalis\u00e9s bas\u00e9s sur des exp\u00e9riences personnelles<\/strong>.<\/p>\n Par exemple, il n’est pas encore possible de g\u00e9n\u00e9rer et de modifier des images d’animaux de compagnie sp\u00e9cifiques, d’amis ou d’objets personnels, en ajustant leurs poses, emplacements, styles ou arri\u00e8re-plans selon les demandes de l’utilisateur<\/strong>. <\/p>\n Pour permettre une telle personnalisation<\/strong>, certaines approches existantes utilisent un m\u00e9canisme de r\u00e9glage contr\u00f4l\u00e9.<\/strong> Ce m\u00e9canismeint\u00e8gre de nouveaux concepts dans des mod\u00e8les de diffusion texte-en-image pr\u00e9-entra\u00een\u00e9s<\/strong>. <\/p>\n La Text-Inversion<\/strong>, personnalise la g\u00e9n\u00e9ration d’images<\/strong> en apprenant un identifiant textuel unique<\/strong> \u00e0 partir d\u2019images donn\u00e9es pendant le r\u00e9glage. Cela permet au mod\u00e8le de g\u00e9n\u00e9rer de nouvelles variations du concept d’entr\u00e9e en utilisant des instructions qui incluent l’identifiant appris. De m\u00eame, DreamBooth affine l’ensemble du mod\u00e8le de diffusion pour apprendre des concepts personnalis\u00e9s. En utilisant des images de super-classes <\/strong>pour r\u00e9gulariser le processus<\/strong> et maintenir les priorit\u00e9s sp\u00e9cifiques \u00e0 la classe<\/strong>.<\/p>\n Une autre m\u00e9thode, Custom Diffusion<\/strong>, am\u00e9liore l’efficacit\u00e9 computationnelle en ajustant les param\u00e8tres des cl\u00e9s dans chaque couche d’attention crois\u00e9e. Cependant, ces m\u00e9thodes bas\u00e9es sur la diffusion reposent souvent sur un objectif de reconstruction simple. Ce qui peut avoir du mal \u00e0 maintenir une coh\u00e9rence visuelle<\/strong> appropri\u00e9e entre les images g\u00e9n\u00e9r\u00e9es<\/strong> et les images de r\u00e9f\u00e9rence<\/strong>. Les avanc\u00e9es des mod\u00e8les de g\u00e9n\u00e9ration d’images personnalis\u00e9e \u00e0 partir de texte<\/p>\n Les mod\u00e8les de g\u00e9n\u00e9ration d’images bas\u00e9s sur la diffusion<\/strong> ont r\u00e9cemment connu des avanc\u00e9es rapides et impressionnantes. Initialement, DDPM <\/strong>a introduit un processus de diffusion du bruit<\/strong> pendant la passe avant et a utilis\u00e9 un processus de d\u00e9bruitage dans un processus de Markov<\/strong>. Par la suite, DDIM <\/strong>a am\u00e9lior\u00e9 cela en adoptant une estimation implicite pour acc\u00e9l\u00e9rer l\u2019\u00e9chantillonnage dans la g\u00e9n\u00e9ration d\u2019images<\/strong>.<\/p>\n Des progr\u00e8s significatifs ont \u00e9galement \u00e9t\u00e9 r\u00e9alis\u00e9s dans la g\u00e9n\u00e9ration d’images \u00e0 partir de texte, avec des mod\u00e8les tels que : Imagen, GLIDE, Parti, Stable Diffusion et DALL\u00b7E. Obtenant des r\u00e9sultats remarquables lors de la g\u00e9n\u00e9ration d’images \u00e0 partir de descriptions textuelles. Notamment, Stable Diffusion am\u00e9liore l’efficacit\u00e9 de l’entra\u00eenement et de l’\u00e9chantillonnage en effectuant le processus de diffusion dans l’espace latent. <\/p>\n La g\u00e9n\u00e9ration d\u2019images personnalis\u00e9es<\/strong> \u00e0 partir de texte se concentre sur l\u2019adaptation de mod\u00e8les pr\u00e9-entra\u00een\u00e9s pour apprendre des concepts personnalis\u00e9s \u00e0 partir d\u2019un petit ensemble d\u2019images, g\u00e9n\u00e9ralement 4 \u00e0 6, permettant des modifications de pose, de style ou de contexte. <\/p>\n Le Text Inversion<\/strong> personnalise la g\u00e9n\u00e9ration d\u2019images<\/strong> en apprenant un identifiant textuel unique<\/strong> \u00e0 partir des images fournies pendant le r\u00e9glage. Permettant ainsi au mod\u00e8le de g\u00e9n\u00e9rer de nouvelles variations en utilisant des instructions <\/strong>qui incluent l\u2019identifiant appris<\/strong>.<\/p>\n P+ am\u00e9liore cette m\u00e9thode d\u2019inversion<\/strong> en injectant l\u2019identifiant appris<\/strong> dans chaque couche d\u2019attention du U-Net<\/strong> de d\u00e9bruitage<\/strong>. Tandis que NeTI <\/strong>renforce cela en introduisant un cartographe neuronal<\/strong> pour fusionner le temps d’\u00e9tape du processus de d\u00e9bruitage<\/strong>. <\/p>\n En revanche, DreamBooth ajuste <\/strong>l\u2019ensemble du mod\u00e8le de diffusion <\/strong>pour apprendre des concepts personnalis\u00e9s<\/strong>. Ce mod\u00e8le est r\u00e9gularis\u00e9 par des images de super-classes<\/strong> pour pr\u00e9server les priorit\u00e9s sp\u00e9cifiques \u00e0 la classe<\/strong>. Custom-Diffusion<\/strong> augmente l’efficacit\u00e9 computationnelle<\/strong> en ajustant <\/strong>uniquement les param\u00e8tres cl\u00e9s et de valeur<\/strong> dans les couches d’attention crois\u00e9e<\/strong>. ELITE mappe directement les concepts visuels<\/strong> dans les embeddings textuels<\/strong> via un encodeur apprenable<\/strong>. De plus, certaines approches visent \u00e0 cr\u00e9er des g\u00e9n\u00e9rateurs texte-en-image sp\u00e9cifiques<\/strong> \u00e0 un domaine en utilisant un encodeur de personnalisation<\/strong>.<\/p>\n Ces mod\u00e8les g\u00e9n\u00e8rent des images dans un domaine de classe sp\u00e9cifique<\/strong> \u00e0 partir d’une seule image et d’une instruction<\/strong>. Et ce, sans avoir besoin de r\u00e9gler les param\u00e8tres sur de nouvelles entr\u00e9es. Dans ce contexte, la t\u00e2che de la g\u00e9n\u00e9ration d\u2019images personnalis\u00e9es \u00e0 partir de texte est revisit\u00e9e en utilisant l\u2019apprentissage par renforcement. Reformant le paradigme d\u2019apprentissage <\/strong>dans un cadre de gradient de politique d\u00e9terministe (DPG)<\/strong>. <\/p>\n Pour r\u00e9pondre \u00e0 ce d\u00e9fi, un nouveau cadre est propos\u00e9 pour la personnalisation texte-en-image utilisant l\u2019apprentissage par renforcement. Ce cadre incorpore divers objectifs, qu\u2019ils soient diff\u00e9rentiables <\/strong>ou non diff\u00e9rentiables<\/strong>.<\/p>\n Bien que les m\u00e9thodes de g\u00e9n\u00e9ration <\/strong>d’images \u00e0 partir de texte <\/strong>existantes aient utilis\u00e9 l’apprentissage par renforcement avec des retours humains <\/strong>pour am\u00e9liorer la qualit\u00e9 des images <\/strong>ou l’alignement du texte<\/strong>. Ces approches sont moins efficaces dans des contextes personnalis\u00e9s, o\u00f9 seul un petit ensemble d’images est disponible pour repr\u00e9senter les concepts personnalis\u00e9s<\/strong>.<\/p>\n Contrairement \u00e0 ces m\u00e9thodes traditionnelles, le nouveau cadre explore plusieurs strat\u00e9gies de personnalisation<\/strong> texte-en-image<\/strong>. Il fournit un mod\u00e8le de r\u00e9compense adapt\u00e9<\/strong> pour capturer la coh\u00e9rence visuelle \u00e0 long terme<\/strong> des sujets personnalis\u00e9s<\/strong> dans les mod\u00e8les de diffusion, soutenu par des signaux de supervision riches<\/strong>. <\/p>\n Cette \u00e9tude introduit un cadre prenant en charge diverses formes de supervision pour la g\u00e9n\u00e9ration d\u2019images personnalis\u00e9es<\/strong> \u00e0 partir de texte<\/strong>. Le cadre utilise l\u2019algorithme du gradient de politique d\u00e9terministe (DPG)<\/strong> pour ajuster les mod\u00e8les de diffusion<\/strong>. Tout en incorporant une fonction de r\u00e9compense diff\u00e9rentiable<\/strong> sp\u00e9cifique aux concepts personnalis\u00e9s<\/strong>. De plus, deux nouvelles pertes sont introduites pour assurer une coh\u00e9rence visuelle \u00e0 long terme<\/strong> et am\u00e9liorer la fid\u00e9lit\u00e9 visuelle<\/strong> des images personnalis\u00e9es<\/strong>.<\/p>\n Les r\u00e9sultats exp\u00e9rimentaux montrent que cette approche surpasse significativement les m\u00e9thodes de pointe existantes sur plusieurs benchmarks. Et ce pour la g\u00e9n\u00e9ration d\u2019images personnalis\u00e9es \u00e0 partir de texte<\/strong>, en particulier dans la pr\u00e9servation de la fid\u00e9lit\u00e9 visuelle<\/strong>. <\/p>\n Dans certains cas, le cadre \u00e9quip\u00e9 de certains baselines (par exemple, DreamBooth) peut accorder trop d\u2019importance \u00e0 la fid\u00e9lit\u00e9 visuelle<\/strong>. Ce probl\u00e8me peut \u00eatre att\u00e9nu\u00e9 en utilisant un encodeur de texte plus puissant<\/strong> ou des baselines qui \u00e9quilibrent l’alignement entre l’image et le texte. De plus, la r\u00e9compense d\u2019alignement du texte<\/strong> sera encore affin\u00e9e dans le cadre DPG<\/strong> pour am\u00e9liorer cet alignement. <\/p>\n Les m\u00e9thodes d\u00e9velopp\u00e9es<\/a><\/strong> peuvent synth\u00e9tiser de fausses images <\/strong>avec des sujets personnalis\u00e9s<\/strong>. Tels que des visages humains ou des animaux de compagnie priv\u00e9s. Ceci peut augmenter le risque de fuite de donn\u00e9es priv\u00e9es <\/strong>et de falsification de portraits<\/strong>. Par cons\u00e9quent, les utilisateurs souhaitant utiliser cette technique devraient obtenir l’autorisation<\/strong> d’utiliser les images personnalis\u00e9es concern\u00e9es<\/strong>. Malgr\u00e9 ces pr\u00e9occupations, l\u2019approche peut \u00e9galement \u00eatre utilis\u00e9e comme un outil pour l\u2019AIGC <\/strong>afin de cr\u00e9er des images imaginatives<\/strong> \u00e0 des fins de divertissement<\/strong>. Pour les professionnels op\u00e9rant dans la g\u00e9n\u00e9ration texte-en-image personnalis\u00e9e<\/strong>, les d\u00e9fis \u00e9thiques et techniques<\/strong> peuvent \u00eatre d\u00e9courageants.<\/p>\n A Leyton<\/a><\/strong>, on soutient les innovateurs en les aidant \u00e0 optimiser leurs ressources et assurer un cr\u00e9dit d’impot R&D! Leur permettant de se concentrer sur l’avancement des projets innovants<\/a><\/strong>.<\/p>\nUne approche d’apprentissage par renforcement <\/h2>\n
R\u00e9sultats exp\u00e9rimentaux et performances observ\u00e9es<\/h2>\n
Text-inversion<\/h2>\n
Custom diffusion<\/h2>\n
<\/figure>\nLes techniques de personnalisation <\/h2>\n
<\/figure>\nUn nouveau cadre pour la personnalisation<\/h2>\n
Limites et ajustements possibles de la g\u00e9n\u00e9ration d’images personnalis\u00e9e \u00e0 partir de texte<\/h2>\n
Risques et opportunit\u00e9s de la g\u00e9n\u00e9ration d’images personnalis\u00e9e \u00e0 partir de texte<\/h2>\n