Artificial Intelligence 2 λεπτά ανάγνωσης

Νέα προσέγγιση MLLM βελτιώνει παραγωγή εικόνων με διατήρηση ταυτότητας.

Η παραγωγή εικόνων καθοδηγούμενη από υποκείμενο αποσκοπεί στη σύνθεση νέων εικόνων, οι οποίες διατηρούν την ταυτότητα του δεδομένου υποκειμένου, ακολουθώντας παράλληλα κειμενικές οδηγίες. Οι υφιστάμενες προσεγγίσεις συχνά κωδικοποιούν το κείμενο και τις εικόνες αναφοράς ξεχωριστά. Αυτό περιορίζει τις διατροπικές ικανότητες συλλογιστικής και προκαλεί αντικείμενα τύπου αντιγραφής-επικόλλησης. Πρόσφατα πλαίσια που συνδέουν πολυτροπικά μοντέλα με μοντέλα διάχυσης βελτιώνουν την ακολουθία οδηγιών, αλλά σε μεγάλο βαθμό παραβλέπουν τη διατήρηση της ταυτότητας.

Για την αντιμετώπιση αυτών των περιορισμών, τα μοντέλα διάχυσης εξαρτώνται από Πολυτροπικά Μεγάλα Γλωσσικά Μοντέλα (MLLMs), τα οποία κωδικοποιούν από κοινού κείμενο και εικόνες αναφοράς. Επιπλέον, η προσέγγιση ενισχύεται με συνθήκη ταυτότητας βασισμένη σε VAE. Ένα καινοτόμο αρθρωτό σύστημα Διπλής Επίπεδης Συγκέντρωσης (DLA) έχει σχεδιαστεί για τη συγκέντρωση χαρακτηριστικών MLLM πολλαπλών επιπέδων, με σκοπό τη βέλτιστη συνθήκη. Μια στρατηγική αποθορυβοποίησης πολλαπλών σταδίων εφαρμόζεται για τη σταδιακή εξισορρόπηση της σημασιολογικής πληροφορίας από το MLLM και της ταυτότητας λεπτομερειών από το VAE κατά τη διάρκεια της εξαγωγής συμπερασμάτων.

Εκτεταμένα πειράματα καταδεικνύουν ότι η προτεινόμενη μέθοδος εναρμονίζει την πολυτροπική κατανόηση με τη διατήρηση της ταυτότητας, μετριάζει τα προβλήματα αντιγραφής-επικόλλησης και επιτυγχάνει ανώτερη απόδοση όσον αφορά την ανθρώπινη προτίμηση στην παραγωγή εικόνων καθοδηγούμενη από υποκείμενο.

Περισσότερες πληροφορίες είναι διαθέσιμες στην ιστοσελίδα του έργου: https://zsh2000.github.io/squeeze-mllm-subject-gen/ και στην δημοσίευση arXiv:2605.26111v1.