Η επιτάχυνση της αποκωδικοποίησης μεγάλων γλωσσικών μοντέλων (LLM) πραγματοποιείται μέσω της προτεινόμενης επεξεργασίας υποψήφιων τοκενς, τα οποία επαληθεύει ένα μεγαλύτερο μοντέλο-στόχος. Ένας κρίσιμος υπερπαράμετρος σε αυτή τη διαδικασία είναι το μήκος της εικασίας, $gamma$, που καθορίζει πόσα τοκενς προτείνει το μοντέλο προσχεδίου ανά βήμα. Σχεδόν όλα τα υπάρχοντα συστήματα χρησιμοποιούν σταθερό $gamma$ (συνήθως 4), αν και τα εμπειρικά στοιχεία δείχνουν ότι η βέλτιστη τιμή ποικίλλει ανάλογα με τον τύπο της εργασίας και, κυρίως, εξαρτάται από το επίπεδο συμπίεσης που εφαρμόζεται στο μοντέλο-στόχος.
Σε αυτό το άρθρο, παρουσιάζουμε το SpecKV, έναν ελαφρύ προσαρμοστικό ελεγκτή που επιλέγει το $gamma$ ανά βήμα εικασίας χρησιμοποιώντας σήματα που εξάγονται από το ίδιο το μοντέλο προσχεδίου. Προφίλάρουμε την αποκωδικοποίηση εικασίας σε 4 κατηγορίες εργασιών, 4 μήκη εικασίας και 3 επίπεδα συμπίεσης (FP16, INT8, NF4), συλλέγοντας 5,112 εγγραφές επιπέδου βήματος με ποσοστά αποδοχής ανά βήμα, εντροπία προσχεδίου και εμπιστοσύνη προσχεδίου.
Αποδεικνύουμε ότι το βέλτιστο $gamma$ μεταβάλλεται ανάλογα με τα καθεστώτα συμπίεσης και ότι η εμπιστοσύνη και η εντροπία του μοντέλου προσχεδίου είναι ισχυροί προγνωστικοί παράγοντες του ποσοστού αποδοχής (συσχέτιση $approx$ 0.56). Το SpecKV χρησιμοποιεί ένα μικρό MLP εκπαιδευμένο σε αυτά τα σήματα για να μεγιστοποιήσει τα αναμενόμενα τοκενς ανά βήμα εικασίας, επιτυγχάνοντας βελτίωση 56.0% σε σχέση με το σταθερό-$gamma=4$ βασικό μοντέλο με μόνο 0.34 ms φορτίο ανά απόφαση (<0.5% του χρόνου βήματος). Η βελτίωση είναι στατιστικά σημαντική (p < 0.001, δοκιμή bootstrap ζευγών).
Δημοσιεύουμε όλα τα δεδομένα προφίλ, τα εκπαιδευμένα μοντέλα και τα σημειωματάρια ως ανοιχτού κώδικα.