Artificial Intelligence 2 λεπτά ανάγνωσης

QKVShare: Μείωση καθυστέρησης μεταφοράς KV-cache σε συστήματα LLM άκρου

Ανακοίνωση arXiv:2605.03884v1, Τύπος: Νέα δημοσίευση.

Συστήματα LLM πολλαπλών παραγόντων σε συσκευές άκρου απαιτούν αποτελεσματική μεταβίβαση λανθάνοντος πλαισίου. Οι υφιστάμενες πρακτικές επιλογές περιλαμβάνουν δαπανηρή επαναπροφόρτωση ή μεταφορά KV πλήρους ακρίβειας.

Εξετάζεται το QKVShare, ένα πλαίσιο για κβαντισμένη μεταβίβαση κρυφής μνήμης KV μεταξύ παραγόντων. Αυτό συνδυάζει κατανομή μικτής ακρίβειας σε επίπεδο διακριτικού, μια αυτόνομη αναπαράσταση CacheCard και μια διαδρομή έγχυσης κρυφής μνήμης συμβατή με το HuggingFace.

Τα τρέχοντα αποτελέσματα υποστηρίζουν μια πιο συγκεκριμένη αλλά σαφέστερη αφήγηση από το αρχικό προσχέδιο: Σε 150 προβλήματα GSM8K, χρησιμοποιώντας το Llama-3.1-8B-Instruct, η προσαρμοστική κβάντιση διατηρεί την ανταγωνιστικότητά της υπό επαναλαμβανόμενη μεταβίβαση. Επίσης, επιδεικνύει τα πιο εμφανή της οφέλη έναντι της ομοιόμορφης κβάντισης σε ρυθμίσεις με βαθύτερες διαδοχικές μεταβιβάσεις και υψηλότερο προϋπολογισμό.

Όσον αφορά την καθυστέρηση μεταβίβασης, η διαδρομή QKVShare μειώνει τον χρόνο μέχρι το πρώτο διακριτικό (TTFT) σε σχέση με την πλήρη επαναπροφόρτωση σε κάθε δοκιμασμένο πλαίσιο. Συγκεκριμένα, από 130,7 ms έναντι 150,2 ms σε ονομαστικό πλαίσιο 1K, σε 397,1 ms έναντι 1029,7 ms σε ονομαστικό πλαίσιο 8K.

Ο χρονισμός των σταδίων καταδεικνύει ότι η παραγωγή μετά την έγχυση, και όχι η δημιουργία της κάρτας, κυριαρχεί στην τρέχουσα διαδρομή καθυστέρησης του QKVShare.

Αυτά τα ευρήματα τοποθετούν την κβαντισμένη μεταβίβαση KV ως μια πολλά υποσχόμενη κατεύθυνση για συστήματα σε συσκευές, ενώ παράλληλα υπογραμμίζουν την ανάγκη για πιο ισχυρές αφαιρέσεις ελεγκτών και συγκρίσεις χρόνου εκτέλεσης επί ίσοις όροις.