Οι Αραιοί Αυτοκωδικοποιητές (SAEs) μπορούν να εξάγουν κατανοητά χαρακτηριστικά από μεγάλα γλωσσικά μοντέλα (LLMs) χωρίς επίβλεψη. Ωστόσο, η αποτελεσματικότητά τους σε εργασίες καθοδήγησης είναι περιορισμένη λόγω της μεγάλης αποθήκευσης ενεργοποιήσεων. Για την αντιμετώπιση αυτών των περιορισμών, προτείνεται το CorrSteer, το οποίο επιλέγει ενεργοποιήσεις χαρακτηριστικών από τα παραγόμενα tokens κατά το χρόνο πρόβλεψης. Αυτή η προσέγγιση χρησιμοποιεί μόνο τις ενεργοποιήσεις χρόνου πρόβλεψης για την εξαγωγή πιο σχετικών χαρακτηριστικών, αποκτώντας συντελεστές καθοδήγησης από τις μέσες ενεργοποιήσεις, αυτοματοποιώντας ολόκληρη τη διαδικασία.
Η μέθοδος μας δείχνει βελτιωμένη απόδοση σε εργασίες ερωταπαντήσεων, μετριασμού προκαταλήψεων, πρόληψης παραβίασης και λογικών ελέγχων σε Gemma-2 2B και LLaMA-3.1 8B, επιτυγχάνοντας αξιοσημείωτη βελτίωση +3.3% στην απόδοση MMLU με 4000 δείγματα και +27.2% βελτίωση στο HarmBench με μόλις 108 δείγματα. Τα επιλεγμένα χαρακτηριστικά δείχνουν σημασιολογικά σημαντικά πρότυπα ευθυγραμμισμένα με τις απαιτήσεις κάθε εργασίας, αποκαλύπτοντας τις υποκείμενες ικανότητες που οδηγούν στην απόδοση.
Η εργασία μας καθιερώνει την επιλογή βάσει συσχέτισης ως μια αποτελεσματική και κλιμακούμενη προσέγγιση για την αυτοματοποιημένη καθοδήγηση SAE σε εφαρμογές γλωσσικών μοντέλων.