Η παρούσα εργασία εξετάζει την εκμάθηση αποχής των μεγάλων γλωσσικών μοντέλων (LLM), χρησιμοποιώντας ειδικότερα τριμερή ανταμοιβή, η οποία ενθαρρύνει την αλήθεια σε αυτά. Η ιδέα αυτή επεκτείνεται σε μια αναπροσαρμογή πλεονεκτήματος βάσει τροχιάς (Trajectory-Informed advantage reweighting – TIAR), η οποία αναπροσαρμόζει δυναμικά την ανταμοιβή αποχής κατά την εκπαίδευση με τη Βελτιστοποίηση Σχετικής Πολιτικής Ομάδας (Group Relative Policy Optimization – GRPO).
Ο στόχος αυτής της μελέτης επικεντρώνεται στην εκμάθηση αποχής, αντί στη βελτίωση της αλήθειας, λειτουργώντας ως διερεύνηση για τη μείωση των παραισθήσεων. Η καινοτομία της εργασίας έγκειται στην μεθοδολογική καινοτομία, στην αναπροσαρμογή του πλεονεκτήματος και στην επιλογή του σημείου αναφοράς.
Αξιοποιώντας τις πολλαπλές τροχιές του GRPO ως ένα φυσικό σήμα αποχής, αυτή η μέθοδος χρησιμοποιεί ένα σήμα ανταμοιβής για να εξερευνήσει τα όρια της γνώσης και να ενθαρρύνει τη συνέπεια. Χρησιμοποιούμενες ως δείκτης εμπιστοσύνης της πολιτικής σε σχέση με το ερώτημα, αυτές οι τροχιές χρησιμοποιούνται στη συνέχεια για τον δυναμικό υπολογισμό του πλεονεκτήματος αποχής.
Το AbstentionBench χρησιμοποιείται ως σημείο αναφοράς αξιολόγησης, καθώς η παρούσα εργασία στοχεύει να συμβάλει στον τομέα της εκμάθησης αποχής. Όλα τα σύνολα δεδομένων του σημείου αναφοράς δοκιμάστηκαν έναντι αυτής της μεθόδου και διαφόρων βασικών γραμμών. Τα εμπειρικά αποτελέσματα καταδεικνύουν ότι το TIAR επιτυγχάνει κορυφαία σκορ F1 στην αποχή σε πέντε από τις έξι κατηγορίες αξιολόγησης, υπερτερώντας της στατικής τριμερούς βασικής γραμμής σε 17 από τα 31 σύνολα δεδομένων του σημείου αναφοράς, διατηρώντας παράλληλα πλήρως την ακρίβεια της βασικής γραμμής.