Τα Μοντέλα Όρασης-Γλώσσας (VLMs) έχουν καταστήσει εφικτό τον ερμηνεύσιμο συλλογισμό στην ιατρική διάγνωση. Ωστόσο, τα υφιστάμενα ιατρικά μοντέλα αλυσίδας σκέψης (CoT) στερούνται σαφών μηχανισμών για την αναπαράσταση και την επιβολή αιτιώδους συλλογισμού. Αυτό τα καθιστά ευάλωτα σε ψευδείς συσχετίσεις και περιορίζει την κλινική τους αξιοπιστία. Εντοπίζονται τρεις βασικές προκλήσεις στον ιατρικό συλλογισμό CoT: ο τρόπος προσαρμοστικής ενεργοποίησης της αιτιώδους διόρθωσης, η δημιουργία υψηλής ποιότητας αντιθετικών δειγμάτων αιτιώδους-ψευδούς συσχέτισης, και η διατήρηση της αιτιώδους συνέπειας σε όλες τις τροχιές συλλογισμού.
Για την αντιμετώπιση αυτών των προκλήσεων, προτείνεται το MedCausalX, ένα ολοκληρωμένο πλαίσιο που μοντελοποιεί ρητά τις αλυσίδες αιτιώδους συλλογισμού στα ιατρικά VLMs. Αρχικά, παρουσιάζεται το σύνολο δεδομένων CRMed, το οποίο παρέχει λεπτομερείς ανατομικές σημειώσεις, δομημένες αλυσίδες αιτιώδους συλλογισμού και αντιπαραδειγματικές παραλλαγές. Αυτά καθοδηγούν την εκμάθηση αιτιωδών σχέσεων πέρα από επιφανειακές συσχετίσεις.
Βασιζόμενο στο CRMed, το MedCausalX χρησιμοποιεί μια αρχιτεκτονική προσαρμοστικής ανάκλασης δύο σταδίων, εξοπλισμένη με διακριτικά $langle$causal$rangle$ και $langle$verify$rangle$. Αυτό επιτρέπει στο μοντέλο να καθορίζει αυτόνομα πότε και πώς θα εκτελέσει αιτιώδη ανάλυση και επαλήθευση. Τέλος, ένας στόχος αιτιώδους διόρθωσης σε επίπεδο τροχιάς, βελτιστοποιημένος μέσω ενισχυτικής μάθησης με απόδοση σφαλμάτων, βελτιώνει την αλυσίδα συλλογισμού. Έτσι, το μοντέλο μπορεί να διακρίνει τις γνήσιες αιτιώδεις εξαρτήσεις από τις συντομευμένες συσχετίσεις.
Εκτεταμένα πειράματα σε πολλαπλά σημεία αναφοράς καταδεικνύουν ότι το MedCausalX υπερέχει σταθερά των μεθόδων αιχμής. Συγκεκριμένα, βελτιώνει τη διαγνωστική συνέπεια κατά 5,4 μονάδες, μειώνει τις ψευδαισθήσεις κατά 10 μονάδες και επιτυγχάνει κορυφαία IoU χωρικής θεμελίωσης, προσφέροντας αιτιωδώς θεμελιωμένο ιατρικό συλλογισμό. Ο κώδικας και το σύνολο δεδομένων είναι διαθέσιμα στη διεύθυνση https://github.com/zhcz328/MedCausalX.