Artificial Intelligence 1 λεπτό ανάγνωσης

LLMSurgeon: Έλεγχος σύνθεσης δεδομένων προεκπαίδευσης Μεγάλων Γλωσσικών Μοντέλων

Το μείγμα δεδομένων προεκπαίδευσης των Μεγάλων Γλωσσικών Μοντέλων (LLMs) αποτελεί το “digital DNA” τους, διαμορφώνοντας τις συμπεριφορές, τις δυνατότητες και τους τρόπους αποτυχίας των μοντέλων. Ωστόσο, η σύνθεση αυτή σπάνια αποκαλύπτεται, καθιστώντας δύσκολο τον εκ των υστέρων έλεγχο του συνδυασμού ή της προέλευσης των δεδομένων.

Στην παρούσα εργασία, επισημοποιείται η Data Mixture Surgery (DMS): με βάση μόνο παραγόμενο κείμενο από ένα στοχευμένο LLM, εκτιμάται η κατανομή σε επίπεδο τομέα του σώματος προεκπαίδευσής του, υπό μια προκαθορισμένη ταξινόμηση. Προτείνεται το LLMSurgeon, ένα ισχυρό πλαίσιο που αντιμετωπίζει την DMS ως αντίστροφο πρόβλημα υπό την υπόθεση της μετατόπισης ετικέτας. Αντί της άμεσης συγκέντρωσης των εξόδων ταξινομητή, το LLMSurgeon εκτιμά έναν βαθμονομημένο soft πίνακα σύγχυσης και επιλύει ένα περιορισμένο αντίστροφο πρόβλημα για τη διόρθωση της συστηματικής σύγχυσης τομέα και την ανάκτηση της λανθάνουσας προτεραιότητας μείγματος.

Για την αξιολόγηση, εισάγεται το LLMScan, μια σουίτα αξιολόγησης επαληθεύσιμης συνταγής, δομημένη από LLMs ανοιχτού κώδικα με διαφανή μείγματα προεκπαίδευσης. Σε όλο το LLMScan, το LLMSurgeon ανακτά μείγματα τομέων με υψηλή πιστότητα υπό σταθερά πρωτόκολλα. Η εργασία μας παρουσιάζει μια πρακτική, εκ των υστέρων προσέγγιση για τον έλεγχο του ψηφιακού DNA των θεμελιωδών μοντέλων χωρίς πρόσβαση στα δεδομένα εκπαίδευσής τους.

Πηγή: ARXIV