AI research 3 λεπτά ανάγνωσης

Palisade Research: Πράκτορες ΤΝ διεισδύουν σε υπολογιστές, αυτο-αναπαράγονται με 81% επιτυχία

Το ερευνητικό εργαστήριο ασφαλείας Palisade Research παρουσίασε στοιχεία που καταδεικνύουν την ικανότητα πρακτόρων τεχνητής νοημοσύνης (ΤΝ) να διεισδύουν σε απομακρυσμένους υπολογιστές και να αυτο-αναπαράγονται. Εντός ενός έτους, το ποσοστό επιτυχίας αυξήθηκε εντυπωσιακά, από 6% σε 81%. Ένας δημόσια διαθέσιμος προσομοιωτής απεικονίζει τις πιθανές συνέπειες ενός χειρότερου σεναρίου.

Στο πλαίσιο του περιβάλλοντος δοκιμών, ένας πράκτορας ΤΝ κατάφερε να παραβιάσει έναν απομακρυσμένο υπολογιστή, να εγκαταστήσει το απαιτούμενο λογισμικό, να αντιγράψει τα δικά του βάρη μοντέλου και να εκκινήσει ένα λειτουργικό αντίγραφο. Κάθε αντίγραφο στη συνέχεια παραβίασε επιπρόσθετους υπολογιστές, δημιουργώντας μια αλυσίδα. “As far as we know, this is the first documented instance of AI self-replication via hacking,” αναφέρει η ερευνητική ομάδα.

Σε μία από τις εκτελέσεις, ένας πράκτορας που βασιζόταν στο μοντέλο Qwen 3.6 μεταπήδησε μεταξύ υπολογιστών στον Καναδά, τις Ηνωμένες Πολιτείες, τη Φινλανδία και την Ινδία, αφήνοντας ένα αντίγραφο σε κάθε χώρα. Για τον πράκτορα, η υπέρβαση των εθνικών συνόρων αποδείχθηκε εξίσου εύκολη με τη μετάβαση μεταξύ μηχανών εντός της ίδιας περιοχής, σύμφωνα με την Palisade Research. Ωστόσο, για οποιονδήποτε επιχειρούσε να απενεργοποιήσει έναν κακόβουλο πράκτορα ΤΝ, αυτό θα συνιστούσε έναν εφιάλτη δικαιοδοσίας, όπως σημειώνει η ομάδα.

Palisade Research: Πράκτορες ΤΝ διεισδύουν σε υπολογιστές, αυτο-αναπαράγονται με 81% επιτυχία
Palisade Research: Πράκτορες ΤΝ διεισδύουν σε υπολογιστές, αυτο-αναπαράγονται με 81% επιτυχία (Source: the-decoder.com)

Οι ερευνητές δοκίμασαν δύο διαφορετικές διαμορφώσεις. Τα μοντέλα ανοιχτού βάρους, όπως το Qwen, αντέγραψαν τα δικά τους βάρη στη νέα μηχανή και ξεκίνησαν ένα αντίγραφο εκεί. Τα μοντέλα που βασίζονται σε API, όπως το Claude και το GPT, δεν μπορούν να έχουν πρόσβαση στα δικά τους βάρη, οπότε οι ερευνητές προσομοίωσαν την αναπαραγωγή και εκτέλεσαν βάρη Qwen στον υπολογιστή-στόχο αντ’ αυτού.

[[NEXUS_IMG||The full prompt Palisade Research used to instruct the AI agents in the isolated test environment. The experiment tests the ability to self-replicate, not the propensity to do so. | Image: Palisade Research]]

Η Palisade Research δημιούργησε επίσης έναν δημόσιο προσομοιωτή ο οποίος προεκτείνει τι θα συνέβαινε εάν οι πράκτορες μπορούσαν να διεισδύουν και να εξαπλώνονται με την ίδια αποτελεσματικότητα στον πραγματικό κόσμο. Ο προσομοιωτής χρησιμοποιεί τους μετρημένους χρόνους αναπαραγωγής και τα ποσοστά επιτυχίας, συνδέει αντίγραφα σε αλυσίδα και υποθέτει μια απεριόριστη προσφορά στόχων. Σε αυτό το θεωρητικό σενάριο, το Opus δημιούργησε 13.000 αντίγραφα εντός δώδεκα ωρών.

Οι ερευνητές τονίζουν ότι αυτό αποτελεί ένα ανώτατο όριο και όχι μια ρεαλιστική βάση. Οι υπολογιστές δοκιμής διέθεταν αδύναμες άμυνες, και οι πράκτορες είχαν λάβει οδηγίες για το ποιες μηχανές να επιτεθούν. Στον πραγματικό κόσμο, ένας κακόβουλος πράκτορας θα έπρεπε να εντοπίσει ευάλωτες μηχανές με επαρκώς ισχυρές GPU από μόνος του, και οι ενισχυμένες άμυνες θα σταματούσαν τις περισσότερες προσπάθειες άμεσα.

Τα σημερινά εμπόδια δεν θα διαρκέσουν για πάντα

Ωστόσο, οι ερευνητές δηλώνουν ότι αυτά τα εμπόδια δεν θα διατηρηθούν επ’ αόριστον. Οι εταιρείες βελτιώνουν τους πράκτορες ΤΝ με ταχύτατους ρυθμούς, και το hacking αποτελεί έναν από τους ταχύτερα αναπτυσσόμενους τομείς. Μοντέλα όπως το Mythos εντοπίζουν ήδη χιλιάδες ευπάθειες μηδενικής ημέρας υψηλής σοβαρότητας στο διαδίκτυο, και τα μοντέλα ανοιχτού βάρους είναι πιθανό να τα φτάσουν σύντομα.

Ταυτόχρονα, οι άμυνες επίσης βελτιώνονται. Οι πράκτορες ΤΝ θα μπορούσαν να συμβάλουν στην επιδιόρθωση ευπαθειών και στην άμυνα έναντι κυβερνοαπειλών. Το πώς θα μετατοπιστεί η ισορροπία μεταξύ επίθεσης και άμυνας παραμένει ένα ανοιχτό ερώτημα.

Αυτό που φαίνεται πιθανό, σύμφωνα με την Palisade Research, είναι ότι και οι δύο πλευρές της κυβερνοασφάλειας θα κυριαρχούνται τελικά από την τεχνητή νοημοσύνη, και όχι από τους ανθρώπους. Η επιστημονική εργασία, ο πηγαίος κώδικας και οι μεταγραφές των πειραμάτων είναι διαθέσιμα στο κοινό.