Η τήρηση οδηγιών με πολλαπλούς περιορισμούς απαιτεί την επαλήθευση της ικανοποίησης επιμέρους απαιτήσεων από μια απάντηση. Ωστόσο, οι κριτές LLM αξιολογούνται συχνά μόνο μέσω συνολικών κρίσεων απάντησης.
Παρουσιάζεται το MCJudgeBench, ένα σημείο αναφοράς για την αξιολόγηση κριτών σε επίπεδο περιορισμού στην τήρηση οδηγιών με πολλαπλούς περιορισμούς.
Κάθε περίπτωση περιλαμβάνει οδηγία, υποψήφια απάντηση, σαφή λίστα περιορισμών, χρυσές ετικέτες ανά περιορισμό ({ναι, μερικό, όχι}) και ελεγχόμενες διαταραχές στην πλευρά της απάντησης.
Το πρωτόκολλο αξιολόγησης περιλαμβάνει επιπλέον παραλλαγές προτροπών για τον έλεγχο της σταθερότητας των κριτών.
Αξιολογούνται ιδιόκτητοι και ανοιχτού κώδικα κριτές LLM με μετρικές ορθότητας και ασυνέπειας, διαχωρίζοντας την εγγενή ασυνέπεια υπό στοχαστική αποκωδικοποίηση από την διαδικαστική ασυνέπεια υπό διαταραχές προτροπών και απαντήσεων.
Τα αποτελέσματα καταδεικνύουν ότι η αξιοπιστία των κριτών έχει πολλαπλές διαστάσεις: η ισχυρή συνολική απόδοση δεν εξασφαλίζει εξίσου αξιόπιστη ανίχνευση σε όλες τις κατηγορίες ετικετών, ιδίως για τις σπανιότερες περιπτώσεις “μερικό” και “όχι”.
Κριτές με υψηλότερη ορθότητα δεν παρουσιάζουν πάντα χαμηλότερη ασυνέπεια.
Η αξιολόγηση με συλλογισμό βελτιώνει την ορθότητα, αλλά δεν βελτιώνει ομοιόμορφα τη σταθερότητα.
Αυτά τα ευρήματα υποκινούν την αξιολόγηση των κριτών LLM σε επίπεδο περιορισμού για τη μελέτη αυτών των τρόπων αποτυχίας.