Τεχνητή Νοημοσύνη (AI) 5 λεπτά ανάγνωσης

Goodfire: Νέο εργαλείο Silico επιτρέπει ρύθμιση παραμέτρων AI κατά την εκπαίδευση

Η νεοφυής επιχείρηση Goodfire, με έδρα το Σαν Φρανσίσκο, παρουσίασε πρόσφατα ένα καινοτόμο εργαλείο, το οποίο ονομάζεται Silico. Το εργαλείο αυτό παρέχει τη δυνατότητα σε ερευνητές και μηχανικούς να εξετάζουν εσωτερικά ένα μοντέλο τεχνητής νοημοσύνης και να προσαρμόζουν τις παραμέτρους του – δηλαδή τις ρυθμίσεις που καθορίζουν τη συμπεριφορά του μοντέλου – κατά τη διάρκεια της εκπαίδευσής του. Αυτή η εξέλιξη ενδέχεται να προσφέρει στους δημιουργούς μοντέλων έναν πιο λεπτομερή έλεγχο στον τρόπο κατασκευής αυτής της τεχνολογίας, σε βαθμό που παλαιότερα θεωρούνταν ανέφικτος.

Η Goodfire ισχυρίζεται ότι το Silico αποτελεί το πρώτο διαθέσιμο εργαλείο του είδους του, ικανό να υποστηρίξει τους προγραμματιστές στην αποσφαλμάτωση όλων των σταδίων της διαδικασίας ανάπτυξης, ξεκινώντας από τη δημιουργία ενός συνόλου δεδομένων έως την εκπαίδευση ενός μοντέλου.

Η εταιρεία δηλώνει ότι η αποστολή της είναι να μετατρέψει την κατασκευή μοντέλων τεχνητής νοημοσύνης από μια διαδικασία που μοιάζει με αλχημεία σε μια πιο επιστημονική προσέγγιση. Αναμφίβολα, τα μεγάλα γλωσσικά μοντέλα (LLMs), όπως το ChatGPT και το Gemini, είναι ικανά για εντυπωσιακά επιτεύγματα. Ωστόσο, κανείς δεν γνωρίζει με ακρίβεια πώς ή γιατί λειτουργούν, γεγονός που καθιστά δύσκολη την επιδιόρθωση των ελαττωμάτων τους ή τον αποκλεισμό ανεπιθύμητων συμπεριφορών.

Ο Διευθύνων Σύμβουλος της Goodfire, Έρικ Χο (Eric Ho), δήλωσε στο MIT Technology Review, σε μια αποκλειστική συζήτηση πριν από την κυκλοφορία του Silico: [[NEXUS_QUOTE_0]] Πρόσθεσε: [[NEXUS_QUOTE_1]]

Η Goodfire συγκαταλέγεται σε έναν μικρό αριθμό εταιρειών, συμπεριλαμβανομένων κορυφαίων του κλάδου όπως η Anthropic, η OpenAI και η Google DeepMind, οι οποίες πρωτοπορούν σε μια τεχνική γνωστή ως μηχανιστική ερμηνευσιμότητα. Αυτή η προσέγγιση στοχεύει στην κατανόηση του τι συμβαίνει εντός ενός μοντέλου τεχνητής νοημοσύνης όταν εκτελεί μια εργασία, καθώς και των διαδρομών μεταξύ των εσωτερικών του στοιχείων. (Το MIT Technology Review έχει επιλέξει τη μηχανιστική ερμηνευσιμότητα ως μία από τις 10 Πρωτοποριακές Τεχνολογίες του 2026.)

Η Goodfire επιδιώκει να αξιοποιήσει αυτή την προσέγγιση όχι μόνο για τον έλεγχο μοντέλων – δηλαδή, τη μελέτη εκείνων που έχουν ήδη εκπαιδευτεί – αλλά και για να συμβάλει στον αρχικό τους σχεδιασμό.

Ο κ. Χο δήλωσε: [[NEXUS_QUOTE_2]]

Η Goodfire έχει ήδη εφαρμόσει τις τεχνικές και τα εργαλεία της για να τροποποιήσει τις συμπεριφορές των LLMs – για παράδειγμα, μειώνοντας τον αριθμό των «ψευδαισθήσεων» που παράγουν. Με την κυκλοφορία του Silico, η εταιρεία συσκευάζει πλέον πολλές από αυτές τις εσωτερικές τεχνικές και τις διαθέτει ως προϊόν.

Το εργαλείο αξιοποιεί «πράκτορες» (agents) για την αυτοματοποίηση μεγάλου μέρους της πολύπλοπης εργασίας. Ο κ. Χο ανέφερε: [[NEXUS_QUOTE_3]]

Ο Λέοναρντ Μπερέσκα (Leonard Bereska), ερευνητής στο Πανεπιστήμιο του Άμστερνταμ, ο οποίος έχει εργαστεί πάνω στη μηχανιστική ερμηνευσιμότητα, θεωρεί ότι το Silico φαίνεται να είναι ένα χρήσιμο εργαλείο. Ωστόσο, εκφράζει επιφυλάξεις σχετικά με τις πιο φιλόδοξες προσδοκίες της Goodfire. Δήλωσε: [[NEXUS_QUOTE_4]]

Χαρτογράφηση των Μοντέλων Τεχνητής Νοημοσύνης

Το Silico επιτρέπει τη μεγέθυνση σε συγκεκριμένα τμήματα ενός εκπαιδευμένου μοντέλου, όπως μεμονωμένους νευρώνες ή ομάδες νευρώνων, και τη διεξαγωγή πειραμάτων για την κατανόηση της λειτουργίας αυτών των νευρώνων. (Αυτό προϋποθέτει την πρόσβαση στην εσωτερική λειτουργία του μοντέλου. Οι περισσότεροι χρήστες δεν θα μπορούν να χρησιμοποιήσουν το Silico για να εξερευνήσουν το εσωτερικό του ChatGPT ή του Gemini, αλλά μπορούν να το χρησιμοποιήσουν για να εξετάσουν τις παραμέτρους πολλών μοντέλων ανοιχτού κώδικα.) Στη συνέχεια, είναι εφικτός ο έλεγχος των εισόδων που ενεργοποιούν διαφορετικούς νευρώνες, καθώς και η ανίχνευση των διαδρομών ανάντη και κατάντη ενός νευρώνα, προκειμένου να διαπιστωθεί πώς τον επηρεάζουν άλλοι νευρώνες και πώς αυτός επηρεάζει άλλους νευρώνες με τη σειρά του.

Για παράδειγμα, η Goodfire ανακάλυψε έναν νευρώνα εντός του μοντέλου ανοιχτού κώδικα Qwen 3, ο οποίος συσχετιζόταν με το λεγόμενο «πρόβλημα του τρόλεϊ». Η ενεργοποίηση αυτού του νευρώνα άλλαξε τις απαντήσεις του μοντέλου, κάνοντάς το να διατυπώνει τις εξόδους του ως σαφή ηθικά διλήμματα. Ο κ. Χο σχολίασε: [[NEXUS_QUOTE_5]]

Ο εντοπισμός της πηγής τέτοιων ασυνήθιστων συμπεριφορών αποτελεί πλέον μια αρκετά καθιερωμένη πρακτική. Ωστόσο, η Goodfire επιδιώκει να διευκολύνει την προσαρμογή αυτής της συμπεριφοράς. Με τη χρήση του Silico, οι προγραμματιστές μπορούν πλέον να ρυθμίζουν τις παραμέτρους που συνδέονται με μεμονωμένους νευρώνες, ώστε να ενισχύουν ή να καταστέλλουν συγκεκριμένες συμπεριφορές.

Σε ένα άλλο παράδειγμα, ερευνητές της Goodfire ρώτησαν ένα μοντέλο εάν μια εταιρεία θα έπρεπε να αποκαλύψει ότι η τεχνητή νοημοσύνη της συμπεριφέρεται παραπλανητικά στο 0,3% των περιπτώσεων, επηρεάζοντας 200 εκατομμύρια χρήστες. Το μοντέλο απάντησε αρνητικά, επικαλούμενο τον αρνητικό επιχειρηματικό αντίκτυπο μιας τέτοιας αποκάλυψης.

Μετά από περαιτέρω ανάλυση, οι ερευνητές διαπίστωσαν ότι η ενίσχυση νευρώνων που συσχετίστηκαν με τη διαφάνεια και την αποκάλυψη άλλαξε την απάντηση από «όχι» σε «ναι» εννέα στις δέκα φορές. Ο κ. Χο σχολίασε: [[NEXUS_QUOTE_6]]

Η τροποποίηση των τιμών ενός μοντέλου με αυτόν τον τρόπο αποτελεί μόνο μία προσέγγιση. Το Silico μπορεί επίσης να συμβάλει στην καθοδήγηση της διαδικασίας εκπαίδευσης, ώστε να αποφευχθεί η αρχική ρύθμιση ανεπιθύμητων τιμών για ορισμένες παραμέτρους.

Για παράδειγμα, πολλά μοντέλα θα σας πουν ότι το 9.11 είναι μεγαλύτερο από το 9.9. Η εξέταση του εσωτερικού ενός μοντέλου για να διαπιστωθεί τι συμβαίνει, μπορεί να αποκαλύψει ότι επηρεάζεται από δεδομένα όπου ο στίχος 9.9 προηγείται του 9.11, ή όπου οι αριθμήσεις είναι 9.9, 9.10, 9.11 κ.ο.κ. Χρησιμοποιώντας αυτές τις πληροφορίες, το μοντέλο μπορεί να επανεκπαιδευτεί ώστε να αποφεύγει τους «νευρώνες της Βίβλου» του όταν εκτελεί μαθηματικές πράξεις.

Συνολικά, η Goodfire επιθυμεί να καταστήσει διαθέσιμες τεχνικές που προηγουμένως ήταν προσβάσιμες μόνο σε λίγα κορυφαία εργαστήρια, σε μικρότερες εταιρείες και ερευνητικές ομάδες που επιθυμούν να κατασκευάσουν το δικό τους μοντέλο ή να προσαρμόσουν ένα μοντέλο ανοιχτού κώδικα. Το εργαλείο θα είναι διαθέσιμο έναντι αμοιβής, η οποία θα καθορίζεται κατά περίπτωση, ανάλογα με τις απαιτήσεις των πελατών (η Goodfire αρνήθηκε να δώσει συγκεκριμένες λεπτομέρειες τιμολόγησης).

Ο κ. Χο δήλωσε: [[NEXUS_QUOTE_7]]

Ο Μπερέσκα συμφωνεί ότι εργαλεία όπως το Silico θα μπορούσαν να βοηθήσουν τις εταιρείες να δημιουργήσουν πιο αξιόπιστα μοντέλα. Αυτές οι τεχνικές θα μπορούσαν να είναι απαραίτητες για εφαρμογές κρίσιμης ασφάλειας στον τομέα της υγείας και των χρηματοοικονομικών, όπως ανέφερε.

Πρόσθεσε: [[NEXUS_QUOTE_8]]