Artificial Intelligence 2 λεπτά ανάγνωσης

PGT: Βελτίωση λεπτομερούς κατανόησης MLLMs και διάγνωση σφαλμάτων αντίληψης.

Παρά την αξιοσημείωτη πρόοδο που έχει σημειωθεί στα Πολυτροπικά Μεγάλα Γλωσσικά Μοντέλα (MLLMs), αυτά τα μοντέλα εξακολουθούν να αντιμετωπίζουν δυσκολίες σε εργασίες λεπτομερούς κατανόησης.

Στην παρούσα εργασία, προτείνεται η μέθοδος των Διαδικαστικά Παραγόμενων Εργασιών (PGT), ένα απλό πλαίσιο βασισμένο σε δεδομένα, το οποίο εξυπηρετεί διπλό σκοπό: την πρόκληση λεπτομερούς οπτικής κατανόησης και τη λειτουργία ως διαγνωστικό εργαλείο χαμηλού κόστους για τον εντοπισμό της πηγής των αποτυχιών αντίληψης.

Μέσω εικόνων, οι PGT παράγουν πρόσθετη πυκνή επίβλεψη, η οποία διαχωρίζει την ικανότητα οπτικής θεμελίωσης από τις σημασιολογικές προηγούμενες γνώσεις.

Εκτεταμένα πειράματα σε σημεία αναφοράς σχεσιακής, ποσοτικής και 3D/βάθους κατανόησης καταδεικνύουν ότι οι PGT επιφέρουν αξιοσημείωτα κέρδη σε διάφορες αρχιτεκτονικές.

Η ρύθμιση οδηγιών (instruction tuning) των MLLMs στο LLaVA-v1.5-Instruct, ενισχυμένο με δεδομένα PGT, οδηγεί σε βελτιώσεις έως και +20% στο σημείο αναφοράς What’sUp και +13.3% στο CV-Bench-2D, διατηρώντας παράλληλα τις γενικές ικανότητες αντίληψης.

Επιπλέον, η λεπτομερής ρύθμιση (finetuning) των πιο προηγμένων MLLMs με δεδομένα PGT επιφέρει αυξήσεις έως και +5.5% στο What’sUp και +8.3% στο CV-Bench-2D.

Αυτά τα ευρήματα καταδεικνύουν ότι οι PGT αντιμετωπίζουν αποτελεσματικά το σημείο συμφόρησης της λεπτομερούς αντίληψης, αποκαλύπτοντας ότι πολλά ελλείμματα χωρικής συλλογιστικής προέρχονται από ανεπαρκή σήματα επίβλεψης και όχι από εγγενείς αρχιτεκτονικούς ή περιορισμούς ανάλυσης.