Οι γλωσσικές μονάδες ενσωματώνουν σημαντική αξιολογική γνώση από την προ-εκπαίδευση. Ωστόσο, οι τρέχουσες μέθοδοι μετα-εκπαίδευσης βασίζονται σε εξωτερική επίβλεψη – όπως ανθρώπινες σημειώσεις, ιδιόκτητα μοντέλα ή κλιμακωτές ανταμοιβές – για την παραγωγή σημάτων. Κάθε μία από αυτές τις προσεγγίσεις θέτει όρια: η ανθρώπινη κρίση δεν μπορεί να επιβλέψει ικανότητες πέρα από τις δικές της, τα ιδιόκτητα API δημιουργούν εξαρτήσεις, και οι επαληθεύσιμες ανταμοιβές καλύπτουν μόνο τομείς με δεδομένες αλήθειες. Η αυτοβελτίωση, προερχόμενη από την αξιολογική ικανότητα του ίδιου του μοντέλου, αποτελεί μια κλιμακούμενη πηγή ανταμοιβής που παραμένει σε μεγάλο βαθμό αναξιοποίητη. Το EVOLM είναι μια μέθοδος μετα-εκπαίδευσης που δομεί αυτή την ικανότητα σε σαφείς διακριτικές ρουμπρίκες, χρησιμοποιώντας τες ως σήμα εκπαίδευσης.
Το EVOLM εκπαιδεύει εναλλάξ δύο ικανότητες εντός μιας ενιαίας γλωσσικής μονάδας: (1) έναν γεννήτορα ρουμπρίκων που παράγει κριτήρια αξιολόγησης ειδικά για κάθε περίπτωση, βελτιστοποιημένα για διακριτική χρησιμότητα, μεγιστοποιώντας την ικανότητα ενός μικρού, σταθερού κριτή να διακρίνει προτιμώμενες από μη προτιμώμενες απαντήσεις· και (2) μια πολιτική που εκπαιδεύεται χρησιμοποιώντας αυτές τις βαθμολογίες των ρουμπρίκων ως ανταμοιβή. Όλα τα σήματα προτίμησης δημιουργούνται από τις εξόδους της πολιτικής μέσω χρονικής αντίθεσης με προηγούμενα σημεία ελέγχου, χωρίς να απαιτείται ανθρώπινη σημείωση ή εξωτερική επίβλεψη.
Σε δοκιμές, το EVOLM εκπαίδευσε ένα μοντέλο Qwen3-8B, παράγοντας ρουμπρίκες που υπερτερούν του GPT-4.1 στο RewardBench-2 κατά 25,7%. Η συνεκπαιδευμένη πολιτική του πέτυχε μέσο όρο 69,3% στη σουίτα OLMo3-Adapt, ξεπερνώντας τις πολιτικές που εκπαιδεύτηκαν με ρουμπρίκες του GPT-4.1 κατά 3,9% και το κορυφαίο μοντέλο ανταμοιβής 8B SkyWork-RM κατά 16%. Συνολικά, το EVOLM αποδεικνύει ότι η δόμηση της αξιολογικής ικανότητας ενός μοντέλου σε συν-εξελισσόμενες διακριτικές ρουμπρίκες επιτρέπει την αυτοβελτίωση χωρίς εξωτερική επίβλεψη.