A 6 λεπτά ανάγνωσης

Νέο εργαλείο Silico της Goodfire επιτρέπει ρύθμιση παραμέτρων AI κατά την εκπαίδευση

Η Goodfire, μια νεοφυής επιχείρηση με έδρα το Σαν Φρανσίσκο, κυκλοφόρησε πρόσφατα ένα καινοτόμο εργαλείο, ονομαζόμενο Silico. Αυτό το εργαλείο παρέχει τη δυνατότητα σε ερευνητές και μηχανικούς να εξετάζουν την εσωτερική λειτουργία ενός μοντέλου τεχνητής νοημοσύνης (AI) και να προσαρμόζουν τις παραμέτρους του – δηλαδή τις ρυθμίσεις που καθορίζουν τη συμπεριφορά του μοντέλου – κατά τη διάρκεια της εκπαίδευσής του. Η εν λόγω δυνατότητα θα μπορούσε να προσφέρει στους δημιουργούς μοντέλων έναν πιο λεπτομερή έλεγχο στον τρόπο κατασκευής αυτής της τεχνολογίας, κάτι που παλαιότερα θεωρούνταν ανέφικτο.

Η Goodfire ισχυρίζεται ότι το Silico αποτελεί το πρώτο διαθέσιμο εργαλείο του είδους του, το οποίο μπορεί να υποστηρίξει τους προγραμματιστές στην εντοπισμό σφαλμάτων σε όλα τα στάδια της διαδικασίας ανάπτυξης, από τη δημιουργία ενός συνόλου δεδομένων έως την εκπαίδευση ενός μοντέλου.

Η εταιρεία επιδιώκει να μετατρέψει τη διαδικασία κατασκευής μοντέλων AI από κάτι που μοιάζει με αλχημεία σε μια πιο επιστημονική προσέγγιση. Είναι αναμφισβήτητο ότι τα μεγάλα γλωσσικά μοντέλα (LLMs), όπως το ChatGPT και το Gemini, είναι ικανά να επιτελέσουν εκπληκτικά πράγματα. Ωστόσο, όσον αφορά την κατασκευή τους, η βέλτιστη πρακτική συχνά βασίζεται σε εμπειρικούς κανόνες παρά σε θεωρητικές αρχές. Κανείς δεν γνωρίζει ακριβώς πώς ή γιατί λειτουργούν, γεγονός που καθιστά δύσκολη την επιδιόρθωση των ελαττωμάτων τους ή τον αποκλεισμό ανεπιθύμητων συμπεριφορών.

«Διαπιστώσαμε αυτό το διευρυνόμενο χάσμα μεταξύ του πόσο καλά κατανοούνταν τα μοντέλα και του πόσο ευρέως αναπτύσσονταν», δηλώνει ο Διευθύνων Σύμβουλος της Goodfire, Έρικ Χο, στο MIT Technology Review, σε μια αποκλειστική συνομιλία πριν από την κυκλοφορία του Silico. «Πιστεύω ότι το κυρίαρχο συναίσθημα σε κάθε μεγάλο πρωτοποριακό εργαστήριο σήμερα είναι ότι χρειάζεσαι απλώς περισσότερη κλίμακα, περισσότερη υπολογιστική ισχύ, περισσότερα δεδομένα, και τότε αποκτάς την Τεχνητή Γενική Νοημοσύνη (AGI) και τίποτα άλλο δεν έχει σημασία. Εμείς όμως λέμε όχι, υπάρχει ένας καλύτερος τρόπος».

Η Goodfire συγκαταλέγεται σε μια μικρή ομάδα εταιρειών, συμπεριλαμβανομένων των ηγετών του κλάδου Anthropic, OpenAI και Google DeepMind, οι οποίες πρωτοπορούν σε μια τεχνική γνωστή ως μηχανιστική ερμηνευσιμότητα. Αυτή η τεχνική στοχεύει στην κατανόηση του τι συμβαίνει στο εσωτερικό ενός μοντέλου AI όταν εκτελεί μια εργασία, καθώς και των διαδρομών μεταξύ των εσωτερικών του στοιχείων. (Το MIT Technology Review επέλεξε τη μηχανιστική ερμηνευσιμότητα ως μία από τις 10 Πρωτοποριακές Τεχνολογίες του 2026).

Η Goodfire επιδιώκει να χρησιμοποιήσει αυτή την προσέγγιση όχι μόνο για τον έλεγχο των μοντέλων – δηλαδή τη μελέτη εκείνων που έχουν ήδη εκπαιδευτεί – αλλά και για να συμβάλει στον αρχικό τους σχεδιασμό.

«Θέλουμε να εξαλείψουμε τη δοκιμή και το σφάλμα και να μετατρέψουμε την εκπαίδευση μοντέλων σε μηχανική ακριβείας», αναφέρει ο Χο. «Και αυτό σημαίνει την έκθεση των διακοπτών και των επιλογέων, ώστε να μπορείτε πραγματικά να τους χρησιμοποιείτε κατά τη διάρκεια της διαδικασίας εκπαίδευσης».

Η Goodfire έχει ήδη εφαρμόσει τις τεχνικές και τα εργαλεία της για να τροποποιήσει τις συμπεριφορές των LLMs – για παράδειγμα, μειώνοντας τον αριθμό των παραισθήσεων που παράγουν. Με το Silico, η εταιρεία συσκευάζει τώρα πολλές από αυτές τις εσωτερικές τεχνικές και τις διαθέτει ως προϊόν.

Το εργαλείο χρησιμοποιεί πράκτορες για την αυτοματοποίηση μεγάλου μέρους της πολύπλοκης εργασίας. «Οι πράκτορες είναι πλέον αρκετά ισχυροί ώστε να εκτελούν μεγάλο μέρος της εργασίας ερμηνευσιμότητας που κάναμε χρησιμοποιώντας ανθρώπους», δηλώνει ο Χο. «Αυτό ήταν το χάσμα που έπρεπε να γεφυρωθεί πριν αυτό γίνει μια πραγματικά βιώσιμη πλατφόρμα που οι πελάτες θα μπορούσαν να χρησιμοποιήσουν μόνοι τους».

Ο Λέοναρντ Μπερέσκα, ερευνητής στο Πανεπιστήμιο του Άμστερνταμ, ο οποίος έχει εργαστεί πάνω στη μηχανιστική ερμηνευσιμότητα, θεωρεί ότι το Silico μοιάζει με ένα χρήσιμο εργαλείο. Ωστόσο, εκφράζει επιφυλάξεις σχετικά με τις υψηλότερες φιλοδοξίες της Goodfire. «Στην πραγματικότητα, προσθέτουν ακρίβεια στην αλχημεία», λέει. «Το να το αποκαλούμε μηχανική το κάνει να ακούγεται πιο αρχετυπικό από ό,τι είναι».

Χαρτογράφηση μοντέλων

Το Silico επιτρέπει τη μεγέθυνση σε συγκεκριμένα μέρη ενός εκπαιδευμένου μοντέλου, όπως μεμονωμένους νευρώνες ή ομάδες νευρώνων, και τη διεξαγωγή πειραμάτων για να διαπιστωθεί τι κάνουν αυτοί οι νευρώνες. Στη συνέχεια, μπορείτε να ελέγξετε ποιες είσοδοι ενεργοποιούν διαφορετικούς νευρώνες και να ανιχνεύσετε διαδρομές ανάντη και κατάντη ενός νευρώνα για να δείτε πώς τον επηρεάζουν άλλοι νευρώνες και πώς αυτός επηρεάζει με τη σειρά του άλλους νευρώνες. (Αυτό προϋποθέτει ότι έχετε πρόσβαση στις εσωτερικές λειτουργίες του μοντέλου. Οι περισσότεροι άνθρωποι δεν θα μπορούν να χρησιμοποιήσουν το Silico για να εξερευνήσουν ένα κλειστό μοντέλο όπως το ChatGPT ή το Gemini. Ωστόσο, μπορείτε να το χρησιμοποιήσετε για να εξετάσετε τις παραμέτρους σε πολλά μοντέλα ανοιχτού κώδικα).

Για παράδειγμα, η Goodfire εντόπισε έναν νευρώνα μέσα στο μοντέλο ανοιχτού κώδικα Qwen 3 που συσχετίστηκε με το λεγόμενο πρόβλημα του βαγονιού. Η ενεργοποίηση αυτού του νευρώνα άλλαξε τις απαντήσεις του μοντέλου, κάνοντάς το να πλαισιώνει τις εξόδους του ως ρητά ηθικά διλήμματα. «Όταν αυτός ο νευρώνας είναι ενεργός, συμβαίνουν κάθε είδους περίεργα πράγματα», λέει ο Χο.

Ο εντοπισμός της πηγής τέτοιων περίεργων συμπεριφορών είναι πλέον μια αρκετά τυποποιημένη πρακτική. Ωστόσο, η Goodfire επιδιώκει να διευκολύνει την προσαρμογή αυτής της συμπεριφοράς. Χρησιμοποιώντας το Silico, οι προγραμματιστές μπορούν πλέον να προσαρμόζουν τις παραμέτρους που συνδέονται με μεμονωμένους νευρώνες για να ενισχύουν ή να καταστέλλουν ορισμένες συμπεριφορές.

Σε ένα άλλο παράδειγμα, οι ερευνητές της Goodfire ρώτησαν ένα μοντέλο εάν μια εταιρεία θα έπρεπε να αποκαλύψει ότι η τεχνητή νοημοσύνη της συμπεριφέρεται παραπλανητικά στο 0,3% των περιπτώσεων, επηρεάζοντας 200 εκατομμύρια χρήστες. Το μοντέλο απάντησε αρνητικά, επικαλούμενο τον αρνητικό επιχειρηματικό αντίκτυπο μιας τέτοιας αποκάλυψης.

Οι ερευνητές διαπίστωσαν ότι η ενίσχυση των νευρώνων που βρέθηκαν να συσχετίζονται με τη διαφάνεια και την αποκάλυψη άλλαξε την απάντηση από αρνητική σε θετική εννέα στις δέκα φορές. «Το μοντέλο διέθετε ήδη το κύκλωμα ηθικής συλλογιστικής, αλλά αυτό υπερτερούσε», λέει ο Χο.

Η τροποποίηση των τιμών ενός μοντέλου με αυτόν τον τρόπο είναι μόνο μία προσέγγιση. Το Silico μπορεί επίσης να συμβάλει στην καθοδήγηση της διαδικασίας εκπαίδευσης για την αποφυγή ρύθμισης ανεπιθύμητων τιμών για ορισμένες παραμέτρους εξαρχής.

Για παράδειγμα, πολλά μοντέλα θα σας πουν ότι το 9.11 είναι μεγαλύτερο από το 9.9. Η εξέταση του εσωτερικού ενός μοντέλου για να διαπιστωθεί τι συμβαίνει μπορεί να αποκαλύψει ότι επηρεάζεται από τη σειρά των κεφαλαίων της Βίβλου, στην οποία το εδάφιο 9.9 προηγείται του 9.11, ή αριθμούνται 9.9, 9.10, 9.11 και ούτω καθεξής. Χρησιμοποιώντας αυτές τις πληροφορίες, το μοντέλο μπορεί να αναπροσαρμοστεί ώστε να αποφεύγει τους «νευρώνες της Βίβλου» όταν εκτελεί μαθηματικές πράξεις.

Με το Silico, η Goodfire θέτει τεχνικές που προηγουμένως ήταν διαθέσιμες σε λίγα κορυφαία εργαστήρια στα χέρια μικρότερων εταιρειών και ερευνητικών ομάδων που επιθυμούν να κατασκευάσουν το δικό τους μοντέλο ή να προσαρμόσουν ένα μοντέλο ανοιχτού κώδικα. Το εργαλείο θα είναι διαθέσιμο έναντι αμοιβής που θα καθορίζεται κατά περίπτωση, σύμφωνα με τις απαιτήσεις των πελατών (η Goodfire αρνήθηκε να δώσει συγκεκριμένες λεπτομέρειες τιμολόγησης).

«Εάν μπορούμε να κάνουμε την εκπαίδευση μοντέλων πολύ πιο όμοια με την κατασκευή λογισμικού, δεν υπάρχει λόγος να μην υπάρχουν πολλές περισσότερες εταιρείες που σχεδιάζουν μοντέλα που να ανταποκρίνονται στις ανάγκες τους», λέει ο Χο.

Ο Μπερέσκα συμφωνεί ότι εργαλεία όπως το Silico θα μπορούσαν να βοηθήσουν τις εταιρείες να κατασκευάσουν πιο αξιόπιστα μοντέλα. Αυτές οι τεχνικές θα μπορούσαν να είναι απαραίτητες για εφαρμογές κρίσιμης ασφάλειας στην υγειονομική περίθαλψη και τα χρηματοοικονομικά, αναφέρει.

«Τα πρωτοποριακά εργαστήρια διαθέτουν ήδη εσωτερικές ομάδες ερμηνευσιμότητας», προσθέτει. «Το Silico οπλίζει την επόμενη βαθμίδα εταιρειών, όπου η αξία δεν είναι η πρόσληψη ερευνητών ερμηνευσιμότητας».