Παρά τις εντυπωσιακές επιδόσεις που έχουν επιτευχθεί στην παραγωγή βίντεο από κείμενο για σύντομα κλιπ, η αξιολόγηση της δημιουργίας βίντεο μεγάλης διάρκειας με σύνθετες κειμενικές εισόδους εξακολουθεί να αποτελεί σημαντική πρόκληση.
Ανταποκρινόμενοι σε αυτή την πρόκληση, παρουσιάζεται το LoCoT2V-Bench, ένα σημείο αναφοράς για τη δημιουργία βίντεο μεγάλης διάρκειας (LVG). Αυτό περιλαμβάνει προτροπές πολλαπλών σκηνών με ιεραρχικά μεταδεδομένα, όπως ρυθμίσεις χαρακτήρων και συμπεριφορές κάμερας, και έχει κατασκευαστεί από συλλεγμένα βίντεο πραγματικού κόσμου.
Επιπλέον, προτείνεται το LoCoT2V-Eval, ένα πολυδιάστατο πλαίσιο αξιολόγησης. Αυτό καλύπτει την αντιληπτική ποιότητα, την ευθυγράμμιση κειμένου-βίντεο, την χρονική ποιότητα, τη δυναμική ποιότητα και τον Βαθμό Υλοποίησης Ανθρώπινων Προσδοκιών (HERD), με έμφαση σε πτυχές όπως η λεπτομερής ευθυγράμμιση κειμένου-βίντεο και η χρονική συνέπεια των χαρακτήρων.
Πειράματα που διεξήχθησαν σε 17 αντιπροσωπευτικά μοντέλα LVG αποκάλυψαν σημαντικές διαφορές στις δυνατότητες μεταξύ των διαστάσεων αξιολόγησης. Παρατηρήθηκε ισχυρή αντιληπτική ποιότητα και συνέπεια φόντου, αλλά αισθητά ασθενέστερη λεπτομερής ευθυγράμμιση κειμένου-βίντεο και συνέπεια χαρακτήρων.
Αυτά τα ευρήματα υποδεικνύουν ότι η βελτίωση της πιστότητας των προτροπών και η διατήρηση της ταυτότητας παραμένουν βασικές προκλήσεις για την παραγωγή βίντεο μεγάλης διάρκειας.
Ο κώδικας και τα δεδομένα είναι διαθέσιμα στη διεύθυνση https://github.com/XqZeppelinhead0702/LoCoT2V-Bench.
Πηγή: ARXIV