Μελέτη καταγράφει αντίστροφη κλιμάκωση στα Μεγάλα Γλωσσικά Μοντέλα (ΜΓΜ) σε προβλήματα πρόβλεψης χρονοσειρών με υπεργραμμική ανάπτυξη και κίνδυνο ουράς αλλαγής καθεστώτος, δομή κοινή σε χρηματοοικονομικά και επιδημιολογία.
Σε αυτές τις εργασίες, τα πιο ικανά μοντέλα παράγουν χειρότερες κατανομητικές προβλέψεις.
Το μοτίβο εμφανίζεται στο ForecastBench-Sim (FBSim), ένα νέο, απαλλαγμένο από μόλυνση, πρότυπο προσομοιωμένου κόσμου. Επιβεβαιώνεται επίσης στην πρόβλεψη συνθετικών επιδημιών SIR με γραμμικό έλεγχο και σε πραγματικά δεδομένα για COVID-19, ιλαρά, αγορές κατοικίας και υπερπληθωρισμό.
Ανάλυση ανά ποσοστημόριο δείχνει ότι η αστοχία συγκεντρώνεται στην άνω ουρά, την οποία τα πιο ικανά μοντέλα μετατοπίζουν προς τα πάνω για να παρακολουθήσουν επιθετικές εξωπολήσεις ανάπτυξης, ενώ η κάτω ουρά παραμένει σταθερή.
Ενδο-οικογενειακή μελέτη του Llama-3.1 καταδεικνύει ότι η κλίμακα του μοντέλου και η μετα-εκπαίδευση συμβάλλουν ανεξάρτητα σε αυτό το φαινόμενο.
Η γνώση τομέα δεν αποκαθιστά αξιόπιστα τη βαθμονόμηση.
Αυτή η αντίστροφη κλιμάκωση δεν εμφανίζεται σε μετρικές ενιαίου ορίου, κοινές στα πρότυπα αξιολόγησης πρόβλεψης ΜΓΜ, αντιστρέφοντας το πρόσημο της σχέσης ικανότητας-ακρίβειας σε πανομοιότυπες εξόδους.
Η βαθμολόγηση ενιαίου ορίου σε συμβατικά όρια παραβλέπει το κόστος της άνω ουράς. Η βαθμολόγηση που περιλαμβάνει την ουρά αντιστρέφει το πρόσημο της σχέσης ικανότητας-ακρίβειας στις ίδιες εξόδους.
Συνιστάται οι αξιολογήσεις πρόβλεψης των ΜΓΜ να χρησιμοποιούν συνεχείς (και απεριόριστες) μετρήσεις ακρίβειας, παράλληλα με μετρικές δυαδικού ορίου.