Οι γλωσσικές μονάδες ενσωματώνουν εγγενώς σημαντική αξιολογική γνώση από τη φάση προ-εκπαίδευσής τους. Ωστόσο, οι επικρατούσες μέθοδοι μετα-εκπαίδευσης βασίζονται σε εξωτερική επίβλεψη – όπως ανθρώπινες σημειώσεις, ιδιόκτητα μοντέλα ή επαληθεύσιμες ανταμοιβές – για την παραγωγή των απαραίτητων σημάτων. Κάθε μία από αυτές τις προσεγγίσεις παρουσιάζει περιορισμούς: η ανθρώπινη κρίση αδυνατεί να επιβλέψει ικανότητες που υπερβαίνουν τις δικές της, τα ιδιόκτητα API δημιουργούν εξαρτήσεις, και οι επαληθεύσιμες ανταμοιβές καλύπτουν μόνο τομείς με δεδομένες αλήθειες. Η αυτοβελτίωση, η οποία προέρχεται από την αξιολογική ικανότητα του ίδιου του μοντέλου, αποτελεί μια κλιμακούμενη πηγή ανταμοιβής που παραμένει σε μεγάλο βαθμό αναξιοποίητη. Το EVOLM είναι μια καινοτόμος μέθοδος μετα-εκπαίδευσης που δομεί αυτή την εγγενή ικανότητα σε σαφείς, διακριτικές ρουμπρίκες, χρησιμοποιώντας τες αποτελεσματικά ως σήμα εκπαίδευσης.
Το EVOLM εφαρμόζει μια εναλλασσόμενη εκπαίδευση δύο ικανοτήτων εντός μιας ενιαίας γλωσσικής μονάδας: (1) έναν γεννήτορα ρουμπρίκων, ο οποίος παράγει κριτήρια αξιολόγησης ειδικά για κάθε περίπτωση, βελτιστοποιημένα για διακριτική χρησιμότητα, μεγιστοποιώντας την ικανότητα ενός μικρού, σταθερού κριτή να διακρίνει προτιμώμενες από μη προτιμώμενες απαντήσεις· και (2) μια πολιτική, η οποία εκπαιδεύεται χρησιμοποιώντας αυτές τις βαθμολογίες των ρουμπρίκων ως ανταμοιβή. Είναι σημαντικό ότι όλα τα σήματα προτίμησης δημιουργούνται αποκλειστικά από τις εξόδους της πολιτικής μέσω χρονικής αντίθεσης με προηγούμενα σημεία ελέγχου, εξαλείφοντας την ανάγκη για ανθρώπινη σημείωση ή οποιαδήποτε εξωτερική επίβλεψη.
Σε εκτεταμένες δοκιμές, το EVOLM εκπαίδευσε ένα μοντέλο Qwen3-8B, με τις παραγόμενες ρουμπρίκες να υπερτερούν του GPT-4.1 στο RewardBench-2 κατά 25,7%. Η συνεκπαιδευμένη πολιτική του πέτυχε έναν εντυπωσιακό μέσο όρο 69,3% στη σουίτα OLMo3-Adapt, ξεπερνώντας τις πολιτικές που εκπαιδεύτηκαν με ρουμπρίκες του GPT-4.1 κατά 3,9% και το κορυφαίο μοντέλο ανταμοιβής 8B SkyWork-RM κατά 16%. Συνολικά, το EVOLM αποδεικνύει περίτρανα ότι η δόμηση της αξιολογικής ικανότητας ενός μοντέλου σε συν-εξελισσόμενες διακριτικές ρουμπρίκες επιτρέπει την αποτελεσματική αυτοβελτίωση χωρίς την ανάγκη εξωτερικής επίβλεψης.