Τα Μεγάλα Γλωσσικά Μοντέλα (LLMs) έχουν επιδείξει σημαντικές δυνατότητες στην κατανόηση και τη συλλογιστική φυσικής γλώσσας. Ωστόσο, η ικανότητά τους να εκτελούν ακριβείς, ντετερμινιστικούς υπολογισμούς δεν έχει διευκρινιστεί πλήρως. Στο πλαίσιο αυτής της εργασίας, πραγματοποιήθηκε συστηματική αξιολόγηση πολλαπλών στρατηγικών υποβολής εντολών, συμπεριλαμβανομένων των Chain-of-Thought (CoT), Least-to-Most decomposition, Program-of-Thought (PoT) και Self-Consistency (SC), σε εργασίες που απαιτούν ακριβή και χωρίς σφάλματα αποτελέσματα. Αυτές οι εργασίες περιλάμβαναν τη δυαδική καταμέτρηση, την ανίχνευση της μεγαλύτερης υποσυμβολοσειράς και την αριθμητική αξιολόγηση.
Για την υποστήριξη αυτής της μελέτης, εισήχθη ένα συνθετικό σύνολο δεδομένων με ποικίλες οδηγίες φυσικής γλώσσας, επιτρέποντας την ελεγχόμενη αξιολόγηση των ακριβών υπολογισμών σε πολλαπλούς τύπους εργασιών. Τα αποτελέσματα καταδεικνύουν ότι οι τυπικές μέθοδοι υποβολής εντολών επιτυγχάνουν μόνο μέτρια ακρίβεια σε εργασίες βασισμένες σε ακολουθίες. Η μέθοδος CoT προσφέρει περιορισμένη βελτίωση, ενώ η Least-to-Most αντιμετωπίζει το πρόβλημα της συσσώρευσης σφαλμάτων. Αντιθέτως, η PoT επιτυγχάνει απόλυτη ακρίβεια υπολογισμού σε έναν εξωτερικό διερμηνέα. Η Self-Consistency βελτιώνει την ανθεκτικότητα μέσω ψηφοφορίας πλειοψηφίας, αλλά επιφέρει σημαντικό υπολογιστικό κόστος.
Περαιτέρω, εκπαιδεύτηκε ένα μικρό, εξειδικευμένο μοντέλο (CodeT5-small) για τη δημιουργία εκτελέσιμων προγραμμάτων, το οποίο πέτυχε απόλυτη ακρίβεια σε μη χρησιμοποιημένα συνθετικά δεδομένα δοκιμής σε όλες τις εργασίες με ελάχιστο κόστος εκπαίδευσης. Συνολικά, τα ευρήματα υποδηλώνουν ότι τα LLMs ενδέχεται να προσομοιώνουν μοτίβα συλλογιστικής αντί να εκτελούν αξιόπιστα ακριβείς συμβολικούς υπολογισμούς. Για ντετερμινιστικές εργασίες, ο συνδυασμός των LLMs με εξωτερικά εργαλεία ή η χρήση εξειδικευμένων μοντέλων προσφέρει μια πιο αξιόπιστη και αποτελεσματική λύση.
Source: arXiv:2605.03227v1 Announce Type: new