Artificial Intelligence 2 λεπτά ανάγνωσης

ROME και ARISE: Αξιολόγηση και ενίσχυση ασφάλειας συστημάτων LLM

Τα συστήματα πρακτόρων που χρησιμοποιούν εργαλεία και τροφοδοτούνται από Μεγάλα Γλωσσικά Μοντέλα (LLMs) αναπτύσσονται όλο και περισσότερο σε περιβάλλοντα ιστού, εφαρμογών, λειτουργικών συστημάτων και συναλλαγών. Ωστόσο, τα υφιστάμενα πρότυπα ασφαλείας εξακολουθούν να δίνουν έμφαση σε ρητούς κινδύνους, πιθανώς υπερεκτιμώντας την ικανότητα ενός μοντέλου να κρίνει παραπλανητικές ή αμφίβολες πορείες.

Για την αντιμετώπιση αυτού του κενού, παρουσιάζεται το ROME (Red-team Orchestrated Multi-agent Evolution), μια ελεγχόμενη διαδικασία κατασκευής σημείων αναφοράς που μετατρέπει γνωστές μη ασφαλείς πορείες σε πιο παραπλανητικές περιπτώσεις αξιολόγησης, διατηρώντας παράλληλα τις υποκείμενες ετικέτες κινδύνου τους. Ξεκινώντας από 100 μη ασφαλείς αρχικές πορείες, το ROME δημιουργεί 300 περιπτώσεις πρόκλησης που καλύπτουν την εννοιολογική ασάφεια, τους έμμεσους κινδύνους και τη λήψη αποφάσεων μέσω συντομεύσεων.

Πειράματα καταδεικνύουν ότι αυτά τα σύνολα προκλήσεων υποβαθμίζουν σημαντικά την απόδοση κρίσης ασφαλείας, με τις περιπτώσεις κρυφών κινδύνων να παραμένουν ιδιαίτερα μη τετριμμένες ακόμη και για πρόσφατα μοντέλα αιχμής. Επιπλέον, μελετάται το ARISE (Analogical Reasoning for Inference-time Safety Enhancement), μια βελτίωση χρόνου συμπερασμού καθοδηγούμενη από ανάκτηση, η οποία ανακτά αναλογικές πορείες ασφαλείας τύπου ReAct από μια εξωτερική αναλογική βάση και τις εισάγει ως δομημένα παραδείγματα συλλογισμού.

Το ARISE βελτιώνει την ποιότητα κρίσης χωρίς επανεκπαίδευση, αλλά θεωρείται καλύτερα ως μια ενίσχυση ανθεκτικότητας ειδική για συγκεκριμένη εργασία, παρά ως αυτόνομη εγγύηση ασφαλείας. Συλλογικά, το ROME και το ARISE προσφέρουν πρακτικά εργαλεία για την εντατική δοκιμή και τη βελτίωση της κρίσης ασφαλείας των πρακτόρων υπό παραπλανητικές μετατοπίσεις κατανομής.