Τα εργαλεία Τεχνητής Νοημοσύνης (ΤΝ) που υποστηρίζουν τη λήψη αποφάσεων στον πραγματικό κόσμο οφείλουν να δημιουργούν μοντέλα προσομοίωσης, τα οποία ενημερώνουν τις συστάσεις τους και είναι ερμηνεύσιμα. Εργαλεία που αυτοματοποιούν πτυχές της πρακτικής μοντελοποίησης πρέπει να συμπληρώνουν την ανθρώπινη εμπειρογνωμοσύνη, όχι να την αντικαθιστούν.
Η Πρωτοβουλία BEAMS στοχεύει στην καθοδήγηση της ανάπτυξης εργαλείων ΤΝ για μοντελοποίηση και προσομοίωση προς υπεύθυνες και ηθικές πρακτικές. Χρησιμοποιεί ανοικτή ψηφιακή και οργανωτική υποδομή για τη συνεργατική αξιολόγηση αυτών των εργαλείων.
Το φιλοξενούμενο έργο ανοικτού κώδικα `sd ai` επιτρέπει την ευρεία κοινοποίηση συνεισφορών. Μια ομάδα καθοδήγησης επικεντρώνεται στην ιεράρχηση πιθανών σημείων αναφοράς, ενώ μια τεχνική ομάδα υλοποιεί αυτά τα σημεία αναφοράς ως αυτοματοποιημένες δοκιμές.
Δοκιμές για διάφορες διακριτές κατηγορίες αξιολόγησης έχουν υλοποιηθεί και εφαρμοστεί σε εργαλεία ΤΝ που υποστηρίζουν την ποιοτική και ποσοτική κατασκευή μοντέλων, καθώς και τη συζήτηση μοντέλων.
Αυτές περιλαμβάνουν δοκιμές για αιτιακή μετάφραση, επανάληψη μοντέλου, αιτιακή συλλογιστική, συμμόρφωση, εξήγηση συμπεριφοράς μοντέλου, προτεινόμενα βήματα κατασκευής και διορθώσεις μοντέλου.
Όταν οι μηχανές από το έργο `sd ai` συνδυάζονται με διαφορετικά Μεγάλα Γλωσσικά Μοντέλα (LLMs), η απόδοσή τους στις αξιολογήσεις αποκαλύπτει μεταβλητότητα μεταξύ των εργαλείων ΤΝ.
Οι υλοποιηθείσες αξιολογήσεις κατέδειξαν ότι τα εργαλεία μοντελοποίησης αποδίδουν καλύτερα σε συζητήσεις και βασικές ποιοτικές εργασίες, παρά στην αιτιακή συλλογιστική και την ποσοτική διόρθωση σφαλμάτων. Κανένα μεμονωμένο LLM δεν κυριαρχεί σε όλους τους τύπους μηχανών, υπογραμμίζοντας τη σημασία των ειδικών εργασιών και των συμβιβασμών μεταξύ ταχύτητας και ακρίβειας.
Οι εν εξελίξει προσπάθειες της πρωτοβουλίας στοχεύουν στην ενσωμάτωση σημείων αναφοράς που αντιμετωπίζουν ανησυχίες σχετικά με περιπτώσεις χρήσης με επίκεντρο την προκατάληψη.