
Η Microsoft παρουσίασε πολλαπλές καινοτομίες στο συνέδριο Build 2026, συμπεριλαμβανομένου ενός εντυπωσιακού οράματος για το λειτουργικό σύστημα Windows. Προς το τέλος της παρουσίασης, οι ομιλητές αναφέρθηκαν σε τέσσερα νέα μοντέλα τεχνητής νοημοσύνης για τη δημιουργία εικόνων, τη συλλογιστική, τη μεταγραφή και τη φωνή, τα οποία διατίθενται δωρεάν. Μετά από δοκιμές, δεν προέκυψε εντυπωσιασμός. Ακολουθούν οι λόγοι, καθώς και όλες οι απαραίτητες πληροφορίες σχετικά με τη νέα σειρά μοντέλων MAI (Microsoft AI).
Τι είναι το MAI και σε τι διαφέρει από το Copilot;
Το MAI και το Copilot αποτελούν διακριτά προϊόντα τεχνητής νοημοσύνης, αν και αμφότερα λειτουργούν ως chatbots (όχι αποκλειστικά). Ενώ το Copilot αξιοποιεί την τεχνολογία, τα μοντέλα MAI χρησιμοποιούν εσωτερικά αναπτυγμένα Μεγάλα Γλωσσικά Μοντέλα (LLMs). Επί του παρόντος, διατίθενται τέσσερις βασικές σειρές μοντέλων MAI, εξαιρουμένου του MAI-Code που επικεντρώνεται στον προγραμματισμό. Η Microsoft ανακοίνωσε τα ακόλουθα μοντέλα κατά τη διάρκεια του Build 2026:
- MAI-Thinking-1, ένα μοντέλο σχεδιασμένο για συλλογιστική.
- MAI-Image-2.5 (και 2.5 Flash), ένα μοντέλο για τη δημιουργία εικόνων.
- MAI-Transcribe-1.5, ένα μοντέλο για τη μεταγραφή ήχου.
- MAI-Voice-2 (και 2 Flash), ένα μοντέλο text-to-speech.
Η Microsoft περιγράφει αυτά τα μοντέλα ως πειραματικά, τονίζοντας ότι βρίσκονται σε κατάσταση `«limited preview»`, συνεπώς δεν πρέπει να αναμένονται πλήρως τελειοποιημένα προϊόντα. Ωστόσο, εάν το επιθυμείτε, μπορείτε να τα χρησιμοποιήσετε δωρεάν, κατά την παρούσα χρονική στιγμή, μέσω του Playground. Το MAI-Thinking-1 δεν είναι προς το παρόν ευρέως προσβάσιμο και προσφέρεται μόνο σε επιλεγμένους χρήστες μέσω πρώιμης πρόσβασης.
Οι ακόλουθες εντυπώσεις βασίζονται σε προσωπική χρήση. Είναι σημαντικό να σημειωθεί ότι τα μοντέλα ενδέχεται να προσφέρουν σημαντική αξία σε εταιρικά περιβάλλοντα.
Το MAI-Thinking-1 δεν είναι κακό, αλλά γιατί να το επιλέξετε έναντι άλλων μοντέλων;
Το MAI-Thinking-1 αποτελεί το πρώτο μοντέλο συλλογιστικής της Microsoft, το οποίο στοχεύει στην αντιμετώπιση σύνθετων προτροπών και θεμάτων. Η Microsoft συγκρίνει το MAI-Thinking-1 με το μοντέλο Sonnet, δηλώνοντας ότι οι χρήστες προτίμησαν το MAI-Thinking-1 σε μια τυφλή αξιολόγηση που διενεργήθηκε από την Surge. Ωστόσο, η Anthropic προωθεί το Opus ως την κορυφαία σειρά μοντέλων της για σύνθετες εργασίες, χαρακτηρίζοντας το Sonnet ως `«τον καλύτερο συνδυασμό ταχύτητας και νοημοσύνης»`.
Στις προσωπικές μου δοκιμές, το Sonnet, ακόμη και με μέτρια επίπεδα νοημοσύνης, αποδείχθηκε πιο χρήσιμο από το MAI-Thinking-1. Κατ’ αρχάς, σε αντίθεση με το Sonnet, το μοντέλο της Microsoft δεν έχει πρόσβαση στο διαδίκτυο, γεγονός που αποτελεί σημαντικό εμπόδιο για την απάντηση σε πολλές ερωτήσεις. Επιπλέον, δεν παρατηρήθηκαν αξιοσημείωτες βελτιώσεις στην ακρίβεια, την ποιότητα των απαντήσεων ή την ταχύτητα του MAI-Thinking-1 σε σύγκριση με το Sonnet, όταν τέθηκαν ερωτήσεις σχετικά με τις λεπτομέρειες των μηχανισμών 2 ή ζητήθηκε βοήθεια για τη δημιουργία μιας δομής βάσης δεδομένων, μεταξύ άλλων.
Το MAI-Thinking-1 είναι αρκετά έξυπνο, αλλά οι περιορισμοί του και η συνολική του απόδοση δεν παρέχουν ένα πειστικό επιχείρημα για την επιλογή του έναντι άλλων διαθέσιμων μοντέλων.
Το MAI-Image-2.5 είναι ένα βήμα μπροστά, αλλά όχι ένα `«Nano Banana Killer»`
Το MAI-Image έχει σημειώσει σημαντική πρόοδο σε σύντομο χρονικό διάστημα. Όταν η Microsoft κυκλοφόρησε την αρχική του έκδοση τον Οκτώβριο του 2025, βρισκόταν πολύ πίσω από τα κορυφαία μοντέλα δημιουργίας εικόνων. Σήμερα, το MAI-Image-2.5 είναι σαφώς βελτιωμένο. Ωστόσο, δεν έχει ακόμη φτάσει το επίπεδο του Nano Banana Pro, ούτε αποτελεί ένα `«Nano Banana Killer»`.
Κατά τη διάρκεια των δοκιμών, δημιουργήθηκαν εικόνες ενός σπιτιού στα προάστια (πρώτη διαφάνεια), ενός κόμικ (τρίτη διαφάνεια) και ενός διαγράμματος (πέμπτη διαφάνεια) χρησιμοποιώντας τόσο το MAI-Image-2.5 όσο και το Nano Banana Pro (δεύτερη, τέταρτη και έκτη διαφάνεια). Οι εικόνες που παρήχθησαν από το Nano Banana Pro ήταν πιο ευκρινείς, ενώ οι εικόνες του MAI-Image-2.5 παρουσίασαν διάφορα προβλήματα, ιδίως όσον αφορά το κείμενο. Για παράδειγμα, παρατηρήθηκε παραμορφωμένο κείμενο στο κόμικ και στο διάγραμμα που δημιουργήθηκαν από το MAI-Image-2.5. Οι δημιουργίες του Nano Banana Pro δεν αντιμετώπισαν αυτό το ζήτημα.
Κατά συνέπεια, δεν συνιστάται η χρήση του MAI-Image-2.5. Ωστόσο, εάν αποτελεί τη μοναδική διαθέσιμη επιλογή για οποιονδήποτε λόγο, μπορεί να εξυπηρετήσει τον σκοπό.
Το MAI-Transcribe-1.5 λειτουργεί καλά χωρίς να ξεχωρίζει
Το MAI-Transcribe-1.5 έχει σχεδιαστεί για τη μετατροπή αρχείων ήχου σε κείμενο. Πολλές υπηρεσίες μεταγραφής βασίζονται στην τεχνητή νοημοσύνη, είτε πλήρως είτε εν μέρει, αλλά το MAI-Transcribe-1.5 προσφέρει δωρεάν αποτελέσματα σε δευτερόλεπτα, απαιτώντας μόνο την παροχή ενός αρχείου ήχου.
Ωστόσο, το MAI-Transcribe-1.5 δεν υπερέχει σε απόδοση έναντι άλλων μοντέλων τεχνητής νοημοσύνης. Κατά τη διάρκεια των δοκιμών, χρησιμοποιήθηκε εκ νέου ένα τεστ μεταγραφής από το GoTranscript, το οποίο παρέχει ένα αρχείο ήχου και μετρά τον αριθμό των λαθών στη μεταγραφή. Το αρχείο ήχου για την πρώτη δοκιμή κατεβάστηκε και υποβλήθηκε τόσο στο Gemini όσο και στο MAI-Transcribe-1.5. Το MAI-Transcribe-1.5 απέδωσε ικανοποιητικά, καταγράφοντας μόλις 13 λάθη, αλλά το Gemini ήταν ακόμη καλύτερο, με μόνο έξι λάθη. Στη συνέχεια, δόθηκε και στα δύο μοντέλα ένα τραγούδι hardcore για ανάλυση των στίχων. Αν και αμφότερα παρουσίασαν λάθη, η μεταγραφή του MAI-Transcribe-1.5 διακόπηκε πριν την ολοκλήρωση του τραγουδιού.
Το MAI-Transcribe-1.5 δεν υστερεί σημαντικά έναντι άλλων μοντέλων, αλλά η Google δεν προωθεί καν το Gemini ως εργαλείο μεταγραφής. Αυτό αποτελεί πρόβλημα για τη Microsoft. Για άλλη μια φορά, το MAI-Transcribe-1.5 μπορεί να χρησιμοποιηθεί αν έχετε μια γρήγορη εργασία, αλλά σε καμία περίπτωση δεν αποτελεί την κορυφαία λύση στην κατηγορία του.
Το MAI-Voice-2 ακούγεται σαν ρομπότ και δεν μου αρέσει
Οι φωνές τεχνητής νοημοσύνης είναι πλέον πανταχού παρούσες, είτε πρόκειται για μουσική που παράγεται από AI, είτε για συνομιλίες με το Copilot, είτε για τη χρήση πληθώρας άλλων εργαλείων βασισμένων στην τεχνητή νοημοσύνη. Η πλειονότητα των φωνών AI δεν ακούγεται τόσο ψεύτικη όσο οι παλαιότερες ψηφιακές φωνές, αλλά ούτε και εντελώς ανθρώπινη. Ορισμένες τεχνολογίες φωνής AI, όπως αυτή της Sesame, εντυπωσιάζουν πραγματικά με τον ρεαλισμό τους, αλλά αυτό αποτελεί την εξαίρεση. Το MAI-Voice-2, από την άλλη πλευρά, είναι πολύ τυπικό.
Παρέχεται η δυνατότητα επιλογής από μια ποικιλία διαφορετικών γλωσσών, κάτι που είναι πάντα θετικό, και μπορεί κανείς να προσαρμόσει περαιτέρω τη φωνή AI με διάφορα στυλ. Ωστόσο, ανεξάρτητα από τις επιλογές που γίνονται, το MAI-Voice-2 ακούγεται απλώς ρομποτικό. Κάποιος συνδυασμός παραγόντων, όπως ο τόνος, ο ρυθμός και η άρθρωση, το καθιστά εντελώς μη ανθρώπινο. Έχουν ακουστεί χειρότερες ψηφιακές φωνές, αλλά το ειδικό μοντέλο φωνής τεχνητής νοημοσύνης της Microsoft δεν καταφέρνει να εντυπωσιάσει.
Όπως και το Copilot, τα μοντέλα MAI δεν καταφέρνουν να ξεχωρίσουν
Τα νέα μοντέλα MAI είναι «αποδεκτά», και αυτό είναι το καλύτερο που μπορεί να ειπωθεί για αυτά. Παρόμοια αίσθηση επικρατεί και για το Copilot, το οποίο ξεχωρίζει περισσότερο για το εκτεταμένο σύνολο χαρακτηριστικών του σε ολόκληρο το οικοσύστημα λογισμικού της Microsoft, παρά για την υπεροχή του υποκείμενου μοντέλου του. Είναι κατανοητό ότι η Microsoft επιθυμούσε να αναδείξει τα εσωτερικά της μοντέλα στο συνέδριο Build, αλλά οι αρχικές δοκιμές αποκαλύπτουν ότι δεν δικαιολογούν μια θέση στο προσκήνιο. Ωστόσο, εάν οι βελτιώσεις στο MAI-Image τους τελευταίους μήνες αποτελούν ένδειξη, τα μοντέλα πιθανότατα θα βελτιωθούν ταχέως, οπότε ενδέχεται να δημιουργήσουν καλύτερες εντυπώσεις στο μέλλον.