Τα χαοτικά δυναμικά συστήματα συνιστούν μια θεμελιώδη πρόκληση για την Ενισχυτική Μάθηση (RL). Η εκθετική ευαισθησία τους στις αρχικές συνθήκες προκαλεί στόχους bootstrap υψηλής διακύμανσης και ενημερώσεις κλίσης με κακή προϋπόθεση. Χαοτικές δυναμικές εμφανίζονται σε επιστημονικούς και μηχανικούς τομείς, όπως οι ροές ρευστών, τα κλιματικά συστήματα και τα συστήματα πολλαπλών παραγόντων, όπου η αξιόπιστη εκμάθηση είναι ιδιαίτερα επιθυμητή.
Οι τυπικές μέθοδοι RL βελτιστοποιούν τις αναμενόμενες αποδόσεις μέσω βαθμωτών συναρτήσεων αξίας, κάνοντας έμμεσα μέσο όρο σε αποκλίνουσες τροχιές και συνδέοντας την αστάθεια σε επίπεδο τροχιάς με τον στόχο εκμάθησης. Υπό ήπιες υποθέσεις στατιστικής σταθερότητας, αποδεικνύεται ότι η κατανομή των αποδόσεων εξελίσσεται πιο ομαλά από τις μεμονωμένες τροχιές, όταν μετράται με τη μετρική $1$-Wasserstein. Αυτό οδηγεί σε έναν πιο ομαλό αντικειμενικό στόχο Bellman κατανομής. Μέσω αυτής της δομής επιπέδου, η διανεμητική RL προσφέρει εκμάθηση με καλύτερη προϋπόθεση. Παρέχεται μια θεμελιωμένη εξήγηση για τα πλεονεκτήματα των διανεμητικών μεθόδων σε χαοτικά συστήματα και για τις γεωμετρίες των στόχων της RL υπό συνθήκες χάους.
Πηγή: ARXIV