Τα μεγάλα γλωσσικά μοντέλα (LLMs) επιτρέπουν τη συλλογιστική σε 2D και 3D δομές. Ωστόσο, οι υφιστάμενες μέθοδοι παραμένουν ειδικές για κάθε τροπικότητα, συμπιέζοντας συνήθως δομικές εισόδους μέσω διακριτοποίησης βασισμένης σε ακολουθίες ή συνδετήρων ερωτημάτων σταθερού μήκους. Τέτοιες αρχιτεκτονικές είτε παραλείπουν την απαραίτητη γεωμετρική θεμελίωση για τον μετριασμό των δομικών ψευδαισθήσεων, είτε επιβάλλουν άκαμπτα σημεία συμφόρησης σύντηξης τροπικοτήτων. Αυτά τα σημεία συμφόρησης ταυτόχρονα υπερ-συμπιέζουν και κατανέμουν υποβέλτιστα τα δομικά tokens, εμποδίζοντας τη συλλογιστική σε επίπεδο όλων των ατόμων.
Παρουσιάζεται το Cuttlefish, ένα ενοποιημένο πολυτροπικό LLM. Αυτό το μοντέλο θεμελιώνει τη γλωσσική συλλογιστική σε γεωμετρικά στοιχεία, ενώ κλιμακώνει τα tokens τροπικότητας ανάλογα με τη δομική πολυπλοκότητα.
Πρώτον, η μέθοδος Scaling-Aware Patching χρησιμοποιεί έναν μηχανισμό πύλης που εξαρτάται από οδηγίες. Αυτός ο μηχανισμός δημιουργεί τμήματα μεταβλητού μεγέθους πάνω σε δομικά γραφήματα, κλιμακώνοντας προσαρμοστικά τον προϋπολογισμό των tokens ερωτήματος με τη δομική πολυπλοκότητα. Στόχος είναι ο μετριασμός των σημείων συμφόρησης των συνδετήρων σταθερού μήκους.
Δεύτερον, ο προσαρμογέας Geometry Grounding Adapter βελτιώνει αυτά τα προσαρμοστικά tokens μέσω διασταυρούμενης προσοχής σε ενσωματώσεις τροπικότητας. Στη συνέχεια, εισάγει τα προκύπτοντα tokens τροπικότητας στο LLM, εκθέτοντας σαφή γεωμετρικά στοιχεία για τη μείωση των δομικών ψευδαισθήσεων.
Πειράματα σε διεπιστημονικά σημεία αναφοράς σε επίπεδο όλων των ατόμων αποδεικνύουν ότι το Cuttlefish επιτυγχάνει ανώτερη απόδοση στη συλλογιστική που βασίζεται σε ετερογενείς δομές.
Code: github.com/zihao-jing/Cuttlefish