Artificial Intelligence 2 λεπτά ανάγνωσης

Νέο πλαίσιο BarrierSteer ενισχύει την ασφάλεια των μεγάλων γλωσσικών μοντέλων

Τα μεγάλα γλωσσικά μοντέλα (LLMs) επιδεικνύουν ισχυρές επιδόσεις σε ποικίλες εργασίες, ωστόσο η ευπάθειά τους σε επιθέσεις αντιπάλων και η παραγωγή μη ασφαλούς περιεχομένου συνιστούν σημαντικό εμπόδιο στην ανάπτυξή τους, ιδίως σε περιβάλλοντα υψηλού κινδύνου. Η αντιμετώπιση αυτής της πρόκλησης απαιτεί μηχανισμούς ασφαλείας που να είναι τόσο πρακτικά αποτελεσματικοί όσο και θεωρητικά θεμελιωμένοι.

Σε πρόσφατη δημοσίευση, παρουσιάζεται το BarrierSteer, ένα καινοτόμο πλαίσιο που λειτουργεί κατά τον χρόνο εξαγωγής συμπερασμάτων και βελτιώνει την ασφάλεια των αποκρίσεων απευθείας στον λανθάνοντα χώρο αναπαράστασης του μοντέλου. Το BarrierSteer αντιμετωπίζει τους ταξινομητές ασφαλείας κρυφής κατάστασης ως Συναρτήσεις Φραγμού Ελέγχου (CBFs), επιτρέποντας την καθοδηγούμενη από περιορισμούς κατεύθυνση μη ασφαλών λανθανουσών τροχιών κατά τη δημιουργία. Μέσω της αποτελεσματικής συγχώνευσης περιορισμών, χωρίς την τροποποίηση των υποκείμενων παραμέτρων των LLM, το BarrierSteer διατηρεί την χρησιμότητα του μοντέλου.

Παρέχονται θεωρητικά αποτελέσματα που καταδεικνύουν ότι η εφαρμογή των CBFs στον λανθάνοντα χώρο προσφέρει μια αρχική, αρθρωτή και υπολογιστικά αποδοτική προσέγγιση για την καθοδήγηση σε σχέση με τις εκμαθημένες δεσμεύσεις ασφαλείας, με εγγυήσεις υπό την προϋπόθεση ότι οι εκμαθημένοι φραγμοί συλλαμβάνουν την επιδιωκόμενη ιδιότητα ασφαλείας. Εκτεταμένα πειραματικά αποτελέσματα, σε πολλαπλές οικογένειες μοντέλων και σύνολα δεδομένων, αποδεικνύουν ότι το BarrierSteer μειώνει σημαντικά τα ποσοστά επιτυχίας των επιθέσεων αντιπάλων και τις μη ασφαλείς γενιές, υπερβαίνοντας την υπάρχουσα μέθοδο. Ο κώδικας είναι διαθέσιμος στο αποθετήριο GitHub των δημιουργών.