Οι πρόσφατες εξελίξεις στις δυνατότητες συλλογιστικής και χρήσης εργαλείων των μεγάλων γλωσσικών μοντέλων (LLM) έχουν οδηγήσει στην ανάπτυξη ολοένα και πιο ικανών αυτόνομων συστημάτων. Ωστόσο, τα υφιστάμενα πρότυπα αξιολόγησης παρουσιάζουν περιορισμούς ως προς την πολυπλοκότητα των εργασιών, τον ρεαλισμό και την ποικιλομορφία των τομέων. Συχνά, αδυνατούν να καταγράψουν αλληλεπιδράσεις που εκτείνονται σε πολλαπλούς τομείς, περιορίζοντας την ικανότητά τους να αξιολογούν τους αυτόνομους παράγοντες σε ρεαλιστικά περιβάλλοντα πολλαπλών βημάτων, τα οποία απαιτούν συνεχή συλλογιστική και συντονισμό.
Για την αντιμετώπιση αυτών των περιορισμών, παρουσιάζεται το T1-Bench, ένα ολοκληρωμένο πρότυπο αξιολόγησης υψηλής πιστότητας για αυτόνομα συστήματα σε ρεαλιστικά, πολυτομεακά περιβάλλοντα εξυπηρέτησης πελατών. Αυτό περιλαμβάνει διαδοχικά σενάρια που απαιτούν δομημένη συλλογιστική σε αλληλεπιδράσεις χρήστη-βοηθού πολλαπλών γύρων, αυξάνοντας σημαντικά τη συνθετική πολυπλοκότητα και την αυστηρότητα της αξιολόγησης σε 25 τομείς διαφορετικής δυσκολίας. Η αξιολόγηση του T1-Bench πραγματοποιήθηκε με 12 ιδιόκτητα και ανοιχτού κώδικα μοντέλα, παρέχοντας ένα αναπαραγώγιμο και τυποποιημένο πλαίσιο για την εκτίμηση της συμπεριφοράς των αυτόνομων παραγόντων, της χρήσης εργαλείων και της ποιότητας της συνομιλίας σε σύνθετα περιβάλλοντα πολλαπλών βημάτων. Επιπλέον, η αυτόματη αξιολόγηση συμπληρώνεται με ανθρώπινες κρίσεις για την ενίσχυση της εκτίμησης της ποιοτικής απόδοσης. Συνολικά, το T1-Bench βελτιώνει σημαντικά τα προηγούμενα πρότυπα ως προς το βάθος αλληλεπίδρασης και την κάλυψη τομέων σε προσομοιωμένα πολυτομεακά περιβάλλοντα. Για τη διευκόλυνση της μελλοντικής έρευνας στα αυτόνομα συστήματα, τα δεδομένα και ο κώδικας αξιολόγησης θα διατεθούν δημόσια ως ανοιχτού κώδικα.
Πηγή: arXiv:2606.11070v1