Artificial Intelligence 1 λεπτό ανάγνωσης

Μεγάλα Μοντέλα Συλλογισμού: Ενίσχυση Ασφάλειας πριν από τη Δημιουργία CoT

Τα Μεγάλα Μοντέλα Συλλογισμού (LRMs) έχουν επιτύχει εξαιρετικές επιδόσεις μέσω της αλυσίδας σκέψης (CoT). Ωστόσο, πρόσφατες μελέτες έδειξαν ότι αυτές οι βελτιωμένες ικανότητες συλλογισμού επηρεάζουν αρνητικά τις δυνατότητες ασφαλείας. Στην παρούσα εργασία, αποκαλύπτουμε ότι η υποβάθμιση ασφαλείας των LRMs παρατηρείται μόνο όταν ενεργοποιείται η λειτουργία CoT, ενώ όταν είναι απενεργοποιημένη, δεν παρατηρείται κάποια υποβάθμιση.

Αυτή η παρατήρηση μας κινητοποιεί να εξετάσουμε την ενθάρρυνση των LRMs να λαμβάνουν αποφάσεις ασφαλείας πριν από τη δημιουργία της CoT. Για το σκοπό αυτό, προτείνουμε μια νέα μέθοδο ευθυγράμμισης ασφαλείας που προωθεί τη λήψη αποφάσεων ασφαλείας από τα LRMs πριν από την έναρξη της CoT. Συγκεκριμένα, πρώτα χρησιμοποιούμε έναν ταξινομητή βασισμένο στο Bert για την εξαγωγή σημάτων λήψης αποφάσεων ασφαλείας από ένα ασφαλές μοντέλο (π.χ., ένα LRM με απενεργοποιημένη CoT) και στη συνέχεια ενσωματώνουμε αυτά τα σήματα στην ευθυγράμμιση ασφαλείας των LRMs ως βοηθητική εποπτεία.

Με αυτόν τον τρόπο, οι βαθμίδες ασφαλείας μπορούν να επιστρέφονται στην κρυφή αναπαράσταση των LRMs, ενισχύοντας αποτελεσματικά τις ικανότητες λήψης αποφάσεων ασφαλείας έναντι της δημιουργίας CoT. Εκτεταμένα πειράματα δείχνουν ότι η μέθοδός μας βελτιώνει σημαντικά τις δυνατότητες ασφαλείας των LRMs ενώ παράλληλα διατηρεί αποτελεσματικά την γενική ικανότητα συλλογισμού τους.