Artificial Intelligence 2 λεπτά ανάγνωσης

Μελέτη: Ροή οπτικοακουστικών δεδομένων σε AVLLMs και βελτιστοποίηση απόδοσης

Τα Πολυτροπικά Μεγάλα Γλωσσικά Μοντέλα (ΠΜΓΜ) διαθέτουν την ικανότητα να επεξεργάζονται ακουστικά και οπτικά δεδομένα. Ωστόσο, ο τρόπος με τον οποίο τα ακουστικά και οπτικά σήματα διασχίζουν το δίκτυο για τη διαμόρφωση μιας απάντησης παραμένει ένα ερώτημα.

Παρά τον αυξανόμενο ρόλο τους στην έρευνα και σε πρακτικές εφαρμογές, οι εσωτερικές διαδρομές μέσω των οποίων τα ακουστικά και οπτικά tokens επηρεάζουν την τελική πρόβλεψη δεν έχουν γίνει πλήρως κατανοητές.

Η παρούσα μελέτη διερευνά τη ροή οπτικοακουστικών πληροφοριών εντός των Οπτικοακουστικών Μεγάλων Γλωσσικών Μοντέλων (ΟΑΜΓΜ), παρακολουθώντας πώς αυτά τα μοντέλα δρομολογούν, αξιοποιούν και ενσωματώνουν ακουστικές και οπτικές πληροφορίες σε δύο διαφορετικές διαμορφώσεις εισόδου: οπτικοακουστικό βίντεο και πολλαπλά εναλλασσόμενα οπτικοακουστικά στοιχεία.

Διαπιστώθηκε ότι στην περίπτωση του οπτικοακουστικού βίντεο, τα ΟΑΜΓΜ ακολουθούν την ακολουθιακή διαδρομή ροής πληροφοριών που έχει καθιερωθεί για τα VLMs και VideoLLMs. Η συνεισφορά των ακουστικών και οπτικών δεδομένων σε αυτή τη διαδρομή είναι ανάλογη με την εξάρτηση της εκάστοτε εργασίας από κάθε τροπικότητα. Σε περιβάλλοντα με πολλαπλά εναλλασσόμενα οπτικοακουστικά στοιχεία, η δρομολόγηση αυτή μετατοπίζεται σε διαφορετικές παράλληλες ροές.

Επιπλέον, η έρευνα καταδεικνύει ότι οι οπτικοακουστικοί και άλλοι τύποι tokens μπορούν να απορριφθούν μόλις οι πληροφορίες τους μεταφερθούν στο LLM. Αυτό έχει ελάχιστο αντίκτυπο στην πρόβλεψη του μοντέλου, ή ακόμη και οδηγεί σε μικρή βελτίωση, γενικεύοντας σε πολλαπλές εργασίες και σύνολα δεδομένων, επιτρέποντας έτσι πιο αποδοτική εξαγωγή συμπερασμάτων.

Τα ευρήματα αυτά ισχύουν σε διάφορα μοντέλα και κλίμακες, συγκεκριμένα στα Qwen2.5-Omni και Video-SALMONN2 Plus σε κλίμακες 3B και 7B, οδηγώντας σε υποθέσεις σχετικά με τους λόγους εμφάνισης αυτών των δομών ροής.

Συνολικά, αυτά τα αποτελέσματα παρέχουν την πρώτη συνεκτική εικόνα του τρόπου με τον οποίο τα ΟΑΜΓΜ ενορχηστρώνουν τον ήχο και την όραση εντός του δικτύου, θέτοντας τις βάσεις για την επόμενη γενιά προόδων στην ερμηνευσιμότητα, τον σχεδιασμό και την αποδοτικότητα στα οπτικοακουστικά και ευρύτερα ΠΜΓΜ.

Πηγή: arXiv:2606.10147v1 (Ανακοίνωση Τύπου: νέα)