Artificial Intelligence 2 λεπτά ανάγνωσης

GUI-SD: Βελτίωση ακρίβειας και αποδοτικότητας στο GUI grounding.

Η θεμελίωση γραφικής διεπαφής χρήστη (GUI grounding) αντιστοιχίζει οδηγίες φυσικής γλώσσας στις οπτικές συντεταγμένες των στοιχείων-στόχων και αποτελεί θεμελιώδη ικανότητα για αυτόνομους παράγοντες GUI. Πρόσφατες μέθοδοι ενισχυτικής μάθησης, όπως η GRPO, έχουν επιτύχει ισχυρές επιδόσεις, αλλά βασίζονται σε δαπανηρές πολλαπλές εκτελέσεις (rollouts) και αντιμετωπίζουν προβλήματα με αραιά σήματα σε δύσκολα δείγματα.

Αυτοί οι περιορισμοί καθιστούν την αυτο-απόσταξη εντός πολιτικής (OPSD), η οποία παρέχει πυκνή επίβλεψη σε επίπεδο διακριτικού (token) από μία μόνο εκτέλεση, μια πολλά υποσχόμενη εναλλακτική λύση. Ωστόσο, η εφαρμοσιμότητά της στο GUI grounding παρέμενε ανεξερεύνητη. Στην παρούσα εργασία, παρουσιάζεται το GUI-SD, το πρώτο πλαίσιο OPSD ειδικά προσαρμοσμένο για το GUI grounding.

Πρώτον, το GUI-SD κατασκευάζει ένα οπτικά εμπλουτισμένο προνομιακό πλαίσιο για τον “δάσκαλο” (teacher) χρησιμοποιώντας ένα πλαίσιο οριοθέτησης στόχου και μια μαλακή μάσκα Gaussian, προσφέροντας ενημερωτική καθοδήγηση χωρίς να αποκαλύπτει ακριβείς συντεταγμένες. Δεύτερον, χρησιμοποιεί απόσταξη καθοδηγούμενη από την εντροπία, η οποία προσαρμοστικά σταθμίζει τα διακριτικά με βάση τη σημασία των ψηφίων και την εμπιστοσύνη του “δασκάλου”, εστιάζοντας τη βελτιστοποίηση στις πιο αποτελεσματικές και αξιόπιστες θέσεις.

Εκτεταμένα πειράματα σε έξι αντιπροσωπευτικά σημεία αναφοράς GUI grounding καταδεικνύουν ότι το GUI-SD υπερτερεί σταθερά των μεθόδων που βασίζονται στην GRPO και της απλής OPSD, τόσο στην ακρίβεια όσο και στην αποδοτικότητα της εκπαίδευσης. Ο κώδικας και τα δεδομένα εκπαίδευσης είναι διαθέσιμα στη διεύθυνση: https://zhangyan-ucas.github.io/GUI-SD/