
Το Claude Fable 5 της Anthropic: Διπλάσιο κόστος για 5,7% αυξημένη απόδοση (Source: the-decoder.com)
Βασικά Σημεία
- Το Claude Fable 5, το πιο πρόσφατο μοντέλο τεχνητής νοημοσύνης της Anthropic, κατέκτησε την κορυφή του Δείκτη Νοημοσύνης της Artificial Analysis, ξεπερνώντας ανταγωνιστές όπως το GPT-5.5.
- Η συνολική μετρημένη αύξηση στην απόδοση, σε σύγκριση με τον προκάτοχό του, Opus 4.8, ανέρχεται σε 5,7% σε διάφορα σημεία αναφοράς.
- Αυτή η βελτίωση στην απόδοση συνοδεύεται από σημαντικό κόστος: οι τιμές των tokens έχουν διπλασιαστεί, με μια πλήρη εκτέλεση σημείου αναφοράς να προσεγγίζει πλέον τα 10.000 δολάρια, ποσό διπλάσιο από αυτό του Opus 4.8.
Το Claude Fable 5 βρίσκεται στην κορυφή του Δείκτη Νοημοσύνης της Artificial Analysis και θέτει νέα ρεκόρ σε αρκετά σημεία αναφοράς. Ωστόσο, η βελτίωση σε σχέση με τον προκάτοχό του ενδέχεται να είναι μικρή, ενώ το κόστος υπερδιπλασιάζεται.
Το Claude Fable 5, το οποίο αποτελεί το νεότερο εμβληματικό μοντέλο της Anthropic, κατέκτησε την κορυφή του Δείκτη Νοημοσύνης της Artificial Analysis, επιτυγχάνοντας βαθμολογία 64,9 μονάδων. Η διαφορά από το καλύτερο μη-Anthropic μοντέλο, το GPT-5.5, ανέρχεται σε περίπου πέντε μονάδες. Η Anthropic κατέχει πλέον τις δύο πρώτες θέσεις στον πίνακα κατάταξης.

Αυτή η πρωτιά συνεπάγεται ένα σημαντικό κόστος. Το Fable 5 τιμολογείται στα 10 δολάρια ανά εκατομμύριο tokens εισόδου και στα 50 δολάρια ανά εκατομμύριο tokens εξόδου. Αυτές οι τιμές αντιπροσωπεύουν διπλάσιο κόστος σε σύγκριση με το Opus 4.8, το οποίο χρεώνεται 5 δολάρια για τα tokens εισόδου και 25 δολάρια για τα tokens εξόδου. Μια πλήρης εκτέλεση του δείκτη φτάνει τα 9.940 δολάρια για το Fable 5, έναντι 4.970 δολαρίων για το Opus 4.8 με μέγιστη ικανότητα συλλογιστικής. Αυτή η αυξημένη τιμή προσφέρει μια βελτίωση απόδοσης της τάξης του 5,7%. Τα μοντέλα Opus 4.8 και 4.7 είχαν ήδη ακολουθήσει το ίδιο μοτίβο σε σχέση με το Opus 4.6, παρουσιάζοντας σημαντικές αυξήσεις τιμών για μικρές βελτιώσεις. Η ίδια η Anthropic είχε χαρακτηρίσει τη βελτίωση του 4.8 έναντι του 4.7 “modest but tangible.”
Ad

Οι εταιρείες οφείλουν να αξιολογήσουν προσεκτικά ποιες περιπτώσεις χρήσης δικαιολογούν πραγματικά την καταβολή διπλάσιου κόστους για περίπου πέντε τοις εκατό περισσότερη απόδοση. Οι σκεπτικιστές των σημείων αναφοράς θα επισημάνουν ότι καμία σουίτα δοκιμών δεν αποτυπώνει πλήρως την ικανότητα στον πραγματικό κόσμο. Ο Δείκτης AA, τουλάχιστον, συγκεντρώνει δέκα αξιολογήσεις, προσφέροντας έτσι μια ευρύτερη βάση από οποιοδήποτε μεμονωμένο σημείο αναφοράς.
AdDEC_D_Incontent-1

Ανάλογα με την περιοχή, ο μηνιαίος λογαριασμός για εκτεταμένη εταιρική χρήση θα μπορούσε να καλύψει το κόστος για έμπειρους προγραμματιστές. Τα δεδομένα της Artificial Analysis καθιστούν σαφές ότι η οικονομία αναδεικνύεται σε βασικό παράγοντα, όπως αναλύεται σε βάθος στην ειδική έκδοση για τους συνδρομητές μας σχετικά με “Tokeneconomics”
Κορυφαίες βαθμολογίες στα περισσότερα σημεία αναφοράς
Οι ακατέργαστοι αριθμοί των σημείων αναφοράς είναι ωστόσο αξιοσημείωτοι. Το Fable 5 καταγράφει ρεκόρ σε πέντε από τα δέκα σημεία αναφοράς του Δείκτη Νοημοσύνης. Στο AA-Omniscience, το σημείο αναφοράς για τη γνώση και τις ψευδαισθήσεις, το μοντέλο φτάνει τους 40 βαθμούς, επτά περισσότερους από τον προηγούμενο ηγέτη, Gemini 3.1 Pro Preview. Αυτό το προβάδισμα προέρχεται κυρίως από την υψηλότερη ακρίβεια και όχι από χαμηλότερο ποσοστό ψευδαισθήσεων. Όσον αφορά τις ψευδαισθήσεις, το μοντέλο βρίσκεται ακριβώς στη μέση της κατάταξης.
Ad

Η Artificial Analysis επισημαίνει μια ισχυρή σύνδεση μεταξύ της ακρίβειας του AA-Omniscience και του μεγέθους του μοντέλου μεταξύ των μοντέλων ανοιχτού βάρους. Αυτό υποδηλώνει ότι το Fable 5 ενδέχεται να είναι μεγαλύτερο από οποιοδήποτε προηγούμενο δημόσιο μοντέλο της Anthropic.
Στις εργασίες που απαιτούν λειτουργίες πράκτορα (agentic tasks), το Fable 5 διευρύνει το προβάδισμα της Anthropic. Στο GDPval-AA, ένα σημείο αναφοράς για εργασίες γνώσης στον πραγματικό κόσμο, φτάνει σε Elo 1.932, σημειώνοντας αύξηση 2,2% από το Opus 4.8 που ήταν 1.890. Επίσης, βρίσκεται στην κορυφή του Terminal-Bench Hard για κωδικοποίηση με λειτουργίες πράκτορα και του Tau2-bench Telecom για χρήση εργαλείων.
Στο Humanity’s Last Exam, το μοντέλο επιτυγχάνει βαθμολογία 53%, πάνω από επτά μονάδες μπροστά από το Opus 4.8. Μια μόνο εκτέλεση HLE με εφεδρική λειτουργία κοστίζει περίπου 2.200 δολάρια, καθιστώντας το το πιο ακριβό από όλα τα μοντέλα που έχει δοκιμάσει η Artificial Analysis. Τα προηγούμενα μοντέλα Opus έφταναν το ανώτατο όριο των 1.974 δολαρίων.

Τα φίλτρα ασφαλείας αυξάνουν ακόμη περισσότερο το κόστος
Το Fable 5 χρησιμοποιεί το ίδιο βασικό μοντέλο με το Claude Mythos 5, σύμφωνα με την Anthropic, αλλά περιλαμβάνει επιπλέον δικλείδες ασφαλείας για ερωτήματα που αφορούν την κυβερνοασφάλεια, τη βιολογία, τη χημεία και την απόσταξη μοντέλων. Όταν ενεργοποιείται ένα φίλτρο, ένας μηχανισμός εφεδρικής λειτουργίας ανακατευθύνει το αίτημα στο Opus 4.8. Αυτά τα ανακατευθυνόμενα αιτήματα εξακολουθούν να χρεώνονται, αυξάνοντας το συνολικό κόστος.
Η Anthropic δηλώνει ότι λιγότερο από πέντε τοις εκατό των συνεδριών επηρεάζονται. Ωστόσο, η Artificial Analysis μέτρησε ανακατεύθυνση σε περίπου οκτώ τοις εκατό των εργασιών κατά την αξιολόγηση του Δείκτη Νοημοσύνης, κυρίως σε επιστημονικά ερωτήματα από τα GPQA, AA-Omniscience και Humanity’s Last Exam. Στη δοκιμή HLE και μόνο, το ποσοστό ανακατεύθυνσης έφτασε το εννέα τοις εκατό.
Η πρόσβαση συνοδεύεται από ημερομηνία λήξης
Το Fable 5 διατηρεί το ίδιο παράθυρο περιβάλλοντος ενός εκατομμυρίου tokens με το Opus 4.8. Οι συνδρομητές Pro, Max, Team και Enterprise μπορούν να το χρησιμοποιήσουν έως τις 22 Ιουνίου, με τη χρήση να χρεώνεται με διπλάσιο ρυθμό από αυτόν του Opus. Μετά από αυτή την ημερομηνία, θα μεταβεί σε χρέωση βάσει πιστώσεων. Αυτό το καθιστά ακόμη πιο ακριβό από ό,τι υποδηλώνουν οι τιμές των tokens. Η Anthropic δηλώνει ότι θα επαναφέρει την πρόσβαση μέσω συνδρομής μόλις το επιτρέψει η διαθέσιμη χωρητικότητα.
Ο συνάδελφός μου Max ανέλυσε πρόσφατα τα πλεονεκτήματα και τις αδυναμίες του Fable 5 και διαπίστωσε ότι τα φίλτρα ασφαλείας μπλοκάρουν μεγάλο αριθμό ακίνδυνων αιτημάτων, από ερωτήσεις ιατρικής φυσικής έως βασικές αναθεωρήσεις ασφαλείας. Η κάρτα συστήματος της Anthropic αποκάλυψε επίσης αόρατο περιορισμό (throttling) που υποβαθμίζει την απόδοση του Fable όταν οι χρήστες προσπαθούν να δημιουργήσουν ανταγωνιστικά μοντέλα αιχμής, αν και η Anthropic έχει έκτοτε ανακαλέσει αυτή τη δήλωση.
Πηγή: Artificial Analysis