Artificial Intelligence 1 λεπτό ανάγνωσης

Έρευνα: Συμμετρία σε RL επιταχύνει σύγκλιση ελέγχου πτήσεων αεροσκαφών.

Η συμμετρία των δυναμικών συστημάτων δύναται να αξιοποιηθεί για την πρόβλεψη μεταβάσεων καταστάσεων και την διευκόλυνση της βελτιστοποίησης πολιτικών ελέγχου. Η παρούσα εργασία αξιοποιεί την εν λόγω συμμετρία συστημάτων για την ανάπτυξη προσεγγίσεων ενισχυτικής μάθησης (RL) εκτός σύνδεσης, οι οποίες χαρακτηρίζονται από αποδοτικότητα ως προς τα δείγματα.

Υπό την παραδοχή συμμετρίας για μια Διαδικασία Απόφασης Μάρκοφ (MDP), προτείνεται μια μέθοδος συμμετρικής επαύξησης δεδομένων. Τα επαυξημένα δείγματα ενσωματώνονται στο σύνολο δεδομένων του αλγορίθμου Deep Deterministic Policy Gradient (DDPG), με σκοπό την βελτίωση του ποσοστού κάλυψης του χώρου κατάστασης-δράσης. Επιπλέον, η αποδοτικότητα χρήσης των δειγμάτων βελτιώνεται στα επαυξημένα δείγματα, οδηγώντας στη δημιουργία μιας δομής διπλού κριτικού.

Το μοντέλο ενός αεροσκάφους επαληθεύτηκε ως συμμετρικό, ενώ προσομοιώσεις ελέγχου πτήσης καταδεικνύουν επιταχυνόμενη σύγκλιση της πολιτικής όταν χρησιμοποιούνται επαυξημένα δείγματα.

arXiv:2407.11077v4 Announce Type: replace-cross