Ενώ η αυστηρή συλλογιστική είναι κρίσιμη για ορθό κώδικα, η Ενισχυτική Μάθηση (RL) για παραγωγή κώδικα συχνά παραμελεί τη βελτιστοποίηση της ποιότητας συλλογιστικής. Η ενσωμάτωση εποπτείας σε επίπεδο διαδικασίας στην RL είναι ελκυστική, αλλά αντιμετωπίζει δύο προκλήσεις: Πρώτον, η εκπαίδευση αξιόπιστων μοντέλων ανταμοιβής για τη συλλογιστική περιορίζεται από δεδομένα προτιμήσεων. Δεύτερον, η απλοϊκή ενσωμάτωση νευρωνικών ανταμοιβών μπορεί να οδηγήσει σε “reward hacking”.
Η παρούσα εργασία προτείνει το ReCode (Reasoning-Reinforced Code Generation), ένα καινοτόμο πλαίσιο εκπαίδευσης RL που περιλαμβάνει:
- Ανταγωνιστική Εκμάθηση Ανταμοιβής Διαδικασίας Συλλογιστικής (CRPL): Εκπαιδεύει ένα μοντέλο ανταμοιβής με συνθετικές, βελτιστοποιημένες και υποβαθμισμένες παραλλαγές συλλογιστικής για την αξιολόγηση της ποιότητας της διαδικασίας.
- CG-GRPO (Consistency-Gated GRPO): Ενσωματώνει το μοντέλο ανταμοιβής διαδικασίας συλλογιστικής στην RL, συνδυάζοντας τις ανταμοιβές διαδικασίας με αυστηρά αποτελέσματα εκτέλεσης, με την ορθότητα εκτέλεσης να λειτουργεί ως αυστηρό όριο για τον μετριασμό του “reward hacking”.
Για την αξιολόγηση της διακριτικής ικανότητας του μοντέλου ανταμοιβής στην ποιότητα της συλλογιστικής, εισάγεται το LiveCodeBench-RewardBench (LCB-RB). Το νέο σημείο αναφοράς περιλαμβάνει ζεύγη προτιμήσεων ανώτερων και κατώτερων διαδικασιών συλλογιστικής, ειδικά για παραγωγή κώδικα.
Πειραματικά αποτελέσματα σε HumanEval(+), MBPP(+), LiveCodeBench και BigCodeBench δείχνουν ότι ένα μοντέλο 7 δισεκατομμυρίων παραμέτρων, εκπαιδευμένο με ReCode, υπερτερεί της βασικής έκδοσης κατά 16,1% επιτυγχάνοντας επιδόσεις εφάμιλλες του GPT-4-Turbo. Η γενικευσιμότητα του ReCode αποδεικνύεται σε διάφορους τομείς.