Artificial Intelligence 1 λεπτό ανάγνωσης

OW-SED: Προηγμένη Ανίχνευση Ηχητικών Γεγονότων σε Ανοιχτό Περιβάλλον

Η Ανίχνευση Ηχητικών Γεγονότων (SED) κατέχει κεντρική θέση στην κατανόηση του ήχου, με εφαρμογές σε επιτήρηση, έξυπνες πόλεις, υγειονομική περίθαλψη και ευρετηρίαση πολυμέσων. Ωστόσο, τα συμβατικά συστήματα SED λειτουργούν υπό την παραδοχή ενός κλειστού κόσμου, περιορίζοντας την αποτελεσματικότητά τους σε πραγματικά περιβάλλοντα όπου συχνά εμφανίζονται νέα ακουστικά γεγονότα.

Εμπνευσμένο από την εκμάθηση σε ανοιχτό κόσμο στην όραση υπολογιστών, εισάγεται το παράδειγμα της Ανίχνευσης Ηχητικών Γεγονότων Ανοιχτού Κόσμου (OW-SED). Τα μοντέλα καλούνται να ανιχνεύουν γνωστά, να αναγνωρίζουν άγνωστα και να μαθαίνουν σταδιακά από αυτά.

Για την αντιμετώπιση των μοναδικών προκλήσεων του OW-SED, όπως τα επικαλυπτόμενα και αμφίβολα γεγονότα, προτείνεται μια αρχιτεκτονική 1D Deformable. Αυτή αξιοποιεί την παραμορφώσιμη προσοχή για προσαρμοστική εστίαση σε σημαντικές χρονικές περιοχές.

Επιπλέον, σχεδιάστηκε το καινοτόμο πλαίσιο Open-World Deformable Sound Event Detection Transformer (WOOT). Αυτό ενσωματώνει αποσύνδεση χαρακτηριστικών για διαχωρισμό αναπαραστάσεων (ειδικών και ανεξάρτητων από την κλάση), στρατηγική αντιστοίχισης ένα-προς-πολλά, και απώλεια ποικιλομορφίας προς ενίσχυση της αναπαραστατικής ποικιλομορφίας.

Τα πειραματικά αποτελέσματα καταδεικνύουν ότι η μέθοδός μας επιτυγχάνει οριακά ανώτερη απόδοση σε σύγκριση με τις υφιστάμενες κορυφαίες τεχνικές σε ρυθμίσεις κλειστού κόσμου και βελτιώνεται σημαντικά έναντι των υφιστάμενων βασικών γραμμών σε σενάρια ανοιχτού κόσμου.