Πρόσφατα πολυτροπικά μεγάλα γλωσσικά μοντέλα (LLMs) επεξεργάζονται κυρίως τον ήχο ως μονοφωνικά σήματα, συμπεριλαμβανομένου του χωρικού ήχου για εντοπισμό πηγών, συλλογιστική χωρικών σχέσεων και κατανόηση χωρικών σκηνών.
Προτείνεται η μέθοδος Spatial-Omni, μια ελαφριά προσέγγιση που εφαρμόζει τον κωδικοποιητή SO-Encoder για την εισαγωγή χωρικού ήχου First-Order Ambisonics (FOA) σε υφιστάμενα Omni LLMs ως ανεξάρτητη τροπικότητα. Αυτή η διαδικασία πραγματοποιείται χωρίς την τροποποίηση των αρχικών κωδικοποιητών ήχου των μοντέλων.
Ο SO-Encoder παρέχει χωρικά διακριτικά με περιορισμένο πρόσθετο κόστος πλαισίου και βελτιώνει την κατανόηση του χωρικού ήνου μέσω αποτελεσματικής σταδιακής εκπαίδευσης.
Για την υποστήριξη της εκπαίδευσης και της αξιολόγησης, δημιουργήθηκαν τα σύνολα δεδομένων SO-Dataset, SO-QA και SO-Bench. Αυτά προέρχονται από δεδομένα ανοιχτού κώδικα, πραγματικές ηχογραφήσεις και προσομοιώσεις, περιλαμβάνοντας 400.000 κλιπ χωρικού ήχου FOA και 2,1 εκατομμύρια ζεύγη ερωτήσεων-απαντήσεων χωρικού περιεχομένου.
Το SO-Bench καλύπτει 16 υπο-εργασίες κατανόησης χωρικού ήχου, όπως βασική ανίχνευση και εκτίμηση θέσης, κατανόηση χωρικών σχέσεων και σύνθετη χωρική συλλογιστική.
Πειράματα καταδεικνύουν ότι το Spatial-Omni υπερέχει έναντι υφιστάμενων ανοιχτού κώδικα Μεγάλων Μοντέλων Ήχου-Γλώσσας (LALMs) και μοντέλων Omni LLM σε εργασίες κατανόησης χωρικού ήχου, διατηρώντας παράλληλα ένα ικανοποιητικό επίπεδο γενικής κατανόησης ήχου.
Ο κώδικας και τα δεδομένα είναι διαθέσιμα στη διεύθυνση https://github.com/dieKarotte/Spatial-Omni.