En ce qui concerne les principes techniques de l'IA de génération d'images, il s'agit d'une avancée technologique vraiment étonnante. J'ai travaillé récemment sur des modèles génératifs multimodaux comme OmniGen2, et ils fonctionnent comme par magie. Au cas où vous ne me croiriez pas, ces systèmes d'IA sont désormais capables non seulement de comprendre ce que nous venons de dire, "Dessine un chat portant une couronne", mais aussi de recréer des détails magnifiques que même nous ne pouvons pas imaginer. Comment font-ils ?

Les étapes magiques du passage du texte à l'image
Imaginez que lorsque vous tapez la simple description "tournesol au coucher du soleil", l'IA passe par une série complexe de transformations internes. Tout d'abord, le codeur de texte décompose la phrase en vecteurs de caractéristiques textuelles personnalisées - oui, ces modèles ne connaissent même pas la forme littérale de "coucher de soleil" et de "tournesol", mais sont des vecteurs de caractéristiques textuelles personnalisées. Ces modèles ne reconnaissent même pas la forme littérale de "sunset" ou "sunflower", ils ont affaire à une chaîne de nombres à haute dimension que seule une machine peut comprendre. Il est intéressant de noter que l'étude a révélé que des modules de traitement de texte comme OmniGen2, qui a une échelle de paramètres de 3 milliards, peuvent même distinguer des nuances sémantiques telles que "crépuscule brillant" et "coucher de soleil doré".
Vient ensuite le mystérieux modèle de diffusion de la scène. Cette composition de 4 milliards de paramètres du système de génération d'images peut être appelée le cerveau droit des artistes de l'IA. Il élimine progressivement le bruit du bruit pur, comme s'il s'agissait de polir une sculpture, et produit finalement une image claire qui correspond à la description textuelle. L'essentiel est que chaque étape de l'élimination du bruit suive strictement la "direction créative" fournie par l'encodeur de texte. Vous vous demandez peut-être pourquoi les peintures d'IA professionnelles sont si détaillées, mais c'est parce qu'elles utilisent un extracteur de caractéristiques appelé VAE, qui préserve toutes les caractéristiques microscopiques, de la texture des pétales aux reflets de la lumière.
Ces mécanismes internes inconnus
Ce qui m'étonne le plus, c'est la capacité des IA modernes de génération d'images à s'autocontrôler. OmniGen2, par exemple, dispose d'un "mécanisme de réflexion multimodale" intégré, ce qui signifie simplement qu'elle regarde son travail nouvellement achevé comme un critique d'art. S'il trouve que la couronne du personnage principal n'est pas assez brillante ou que l'arrière-plan est disproportionné, il le redessine activement - un processus qui peut parfois être répété 5 à 6 fois jusqu'à ce qu'il atteigne une norme de qualité prédéfinie. Des tests ont montré que les images optimisées par réflexion peuvent améliorer la satisfaction des utilisateurs dans une proportion stupéfiante de 37%.
Une autre technique souvent négligée mais cruciale est l'architecture à double voie. La séparation du traitement du texte et de l'image peut sembler simple, mais elle résout en fait le problème de la "lutte gauche-droite" auquel les modèles multimodaux sont confrontés depuis longtemps. Vous pouvez considérer le module texte de 3 milliards de paramètres comme le directeur artistique et le module image de 4 milliards de paramètres comme le peintre exécutif.Les marqueurs restent synchronisés. Selon les développeurs, cette conception s'inspire de la façon dont le cortex visuel et le centre du langage du cerveau humain se répartissent leur travail.
Aujourd'hui, ces œuvres générées par l'IA sont passées des contours flous initiaux à un niveau tel que même les peintres professionnels ont du mal à distinguer le vrai du faux. Souvenez-vous de la "macrophotographie" qui est devenue virale sur les médias sociaux. Le jardin entier se reflétant dans les gouttes de rosée, le duvet des pattes de la coccinelle - des détails calculés par des modèles mathématiques, mais si réels que l'on ne pouvait s'empêcher de les toucher.
评论列表 (6条):
加载更多评论 Chargement...