Artificial Intelligence 1 λεπτό ανάγνωσης

ACL Rolling Review: LLM Αξιολογήσεις Επιστημονικών Εργασιών και η Επίδρασή τους

Οι αξιολογήσεις επιστημονικών εργασιών που παράγονται από Μεγάλα Γλωσσικά Μοντέλα (LLM) κερδίζουν σημαντική δυναμική και δοκιμάζονται επίσημα. Υποτίθεται ότι όχι μόνο οι αξιολογητές χρησιμοποιούν τη βοήθεια των LLM, αλλά και ότι οι συγγραφείς αξιοποιούν τα LLM για την αναθεώρηση των εργασιών τους πριν την υποβολή.

Στο πλαίσιο αυτής της εργασίας, διεξήχθησαν εμπειρικά πειράματα σε επιστημονικές εργασίες από το ACL Rolling Review (ARR) του 2025. Στόχος ήταν η αξιολόγηση των αξιολογήσεων που παράγονται από LLM. Από την έρευνα, διαπιστώθηκε μια περιορισμένη ευθυγράμμιση των αξιολογήσεων των LLM με τις ανθρώπινες. Στο βέλτιστο σενάριο, η εν λόγω ευθυγράμμιση κρίνεται λογική. Ωστόσο, παρατηρήθηκε επίσης ότι η ευθυγράμμιση μεταξύ των LLM και των ανθρώπινων αξιολογήσεων παρουσιάζει σημαντικές διακυμάνσεις ανάλογα με τις χρησιμοποιούμενες προτροπές (prompts) και τα μοντέλα.

Τέλος, διερευνήθηκε το σενάριο όπου εφαρμόζεται μια διαδικασία αναθεώρησης με τη χρήση LLM, με σκοπό τη βελτίωση της υποβληθείσας εργασίας βάσει της αξιολόγησης του LLM. Διαπιστώθηκε ότι αυτή η «χειραγώγηση» των αξιολογήσεων των LLM μπορεί να αποδειχθεί αποτελεσματική σε συγκεκριμένα σενάρια, οδηγώντας σε στατιστικά σημαντική αύξηση των συνολικών βαθμολογιών για έως και 35% των εργασιών.

Ο κώδικας της εργασίας είναι διαθέσιμος στην ακόλουθη διεύθυνση: https://github.com/uhh-hcds/reviewarcade

Πηγή: arXiv