Η ενισχυτική μάθηση (Reinforcement Learning) έχει οδηγήσει σε πρόσφατες προόδους όσον αφορά τις ικανότητες συλλογιστικής και πρακτόρων των Μεγάλων Γλωσσικών Μοντέλων (LLM). Ωστόσο, οι τρέχουσες προσεγγίσεις αντιμετωπίζουν δυσκολίες τόσο στην εξερεύνηση όσο και στην εκμετάλλευση.
Προκλήσεις στην Ενισχυτική Μάθηση για LLM
Η εξερεύνηση χαρακτηρίζεται από χαμηλά ποσοστά επιτυχίας σε δύσκολες εργασίες και υψηλό κόστος επαναλαμβανόμενων εκτελέσεων από την αρχή. Η εκμετάλλευση αντιμετωπίζει προβλήματα αδρής κατανομής πίστωσης και αστάθειας στην εκπαίδευση: οι ανταμοιβές σε επίπεδο τροχιάς τιμωρούν έγκυρα προθέματα για μεταγενέστερα σφάλματα, ενώ οι ομάδες που κυριαρχούνται από αποτυχίες υπερκαλύπτουν τα λίγα θετικά σήματα, αφήνοντας τη βελτιστοποίηση χωρίς εποικοδομητική κατεύθυνση.
Πρόταση R$^3$L: Ενισχυτική Μάθηση με Ανάκλαση και Επανάληψη
Προς αντιμετώπιση αυτών των προκλήσεων, προτείνεται η R$^3$L, ήτοι η Ενισχυτική Μάθηση με Ανάκλαση και Επανάληψη (Reflect-then-Retry Reinforcement Learning). Αυτή η μέθοδος περιλαμβάνει Γλωσσικά Καθοδηγούμενη Εξερεύνηση, Κατανομή Πίστωσης με Σημείο Καμπής και Θετική Ενίσχυση.
Γλωσσικά Καθοδηγούμενη Εξερεύνηση: Ανάκλαση και Επανάληψη
Για τη σύνθεση τροχιών υψηλής ποιότητας, η R$^3$L μετατοπίζεται από τη στοχαστική δειγματοληψία στην ενεργή σύνθεση μέσω της διαδικασίας ανάκλασης και επανάληψης. Αξιοποιεί τη γλωσσική ανατροφοδότηση για τη διάγνωση σφαλμάτων, μετασχηματίζοντας αποτυχημένες προσπάθειες σε επιτυχημένες και μειώνοντας το κόστος των εκτελέσεων.
Κατανομή Πίστωσης με Σημείο Καμπής
Με τη διάγνωση και τον εντοπισμό των σφαλμάτων, η Κατανομή Πίστωσης με Σημείο Καμπής ενημερώνει μόνο το αποκλίνον επίθημα όπου υπάρχουν αντιθετικά σήματα, εξαιρώντας το κοινό πρόθεμα από την ενημέρωση κλίσης.
Θετική Ενίσχυση
Δεδομένου ότι οι αποτυχίες κυριαρχούν σε δύσκολες εργασίες και η ανάκλαση-επανάληψη παράγει δεδομένα εκτός πολιτικής, διακινδυνεύοντας την αστάθεια της εκπαίδευσης, η Θετική Ενίσχυση αναβαθμίζει τις επιτυχημένες τροχιές για να διασφαλίσει ότι τα θετικά σήματα καθοδηγούν τη διαδικασία βελτιστοποίησης.
Πειραματικά Αποτελέσματα και Σταθερότητα
Πειράματα σε εργασίες πρακτόρων και συλλογιστικής καταδεικνύουν σχετικές βελτιώσεις από 5% έως 52% σε σχέση με τις βασικές γραμμές, διατηρώντας παράλληλα τη σταθερότητα της εκπαίδευσης. Ο κώδικας της μεθόδου είναι διαθέσιμος στη διεύθυνση https://github.com/shiweijiezero/R3L.