Τεχνολογία

Ρομπότ: Πόσο γρήγορα θα περάσει η τεχνητή νοημοσύνη από τη γλώσσα στη φυσική πραγματικότητα;

Δισεκατομμύρια δολάρια κατευθύνονται σε σειρά νέων τεχνολογιών που φιλοδοξούν να κάνουν στη ρομποτική ό,τι έκανε το ChatGPT ή το Gemini στο κείμενο και στον κώδικα προγραμματισμού.

Τα μεγάλα γλωσσικά μοντέλα, όπως το ChatGPT, εκπαιδεύονται σε τεράστιους όγκους κειμένου και ήδη διαπρέπουν στη διαχείριση λέξεων. Η εκτέλεση όμως πραγματικής σωματικής εργασίας από ένα ρομπότ απαιτεί κάτι άλλο, τα μεγάλα μοντέλα δράσης, γνωστά και ως «μοντέλα κόσμου». Αυτά τα μοντέλα εκπαιδεύονται σε βιντεοπαιχνίδια και προσομοιώσεις αντί για λογοτεχνία, κώδικα και εικόνες, και πρόσφατα έφτασαν σε σημείο να πλοηγούνται σε τρισδιάστατο χώρο και να χειρίζονται αυτόνομα αντικείμενα με ένα απλό σύνολο οδηγιών. Όμως η ωριμότητα της τεχνολογίας παραμένει χαμηλή. «Είναι ακόμα πολύ νωρίς για αυτή την τεχνολογία», δήλωνε προ ημερών στην Wall Street Journal ο Μόριτς Μπάιερ-Λεντζ, επενδυτής σε αρκετές εταιρείες του τομέα. «Αν το συγκρίνουμε με τα μεγάλα γλωσσικά μοντέλα, αυτό είναι σαν το GPT-2», το μοντέλο που κυκλοφόρησε η OpenAI το 2019.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Επί περίπου μισό δισεκατομμύριο χρόνια τα ζώα ανέπτυξαν εγκεφάλους ικανούς να μοντελοποιούν τον κόσμο γύρω τους και να σχεδιάζουν την επόμενη κίνησή τους, ενώ η γλώσσα χρονολογείται μόλις εκατό χιλιετίες πριν. «Το κείμενο είναι μια αναπαράσταση του πραγματικού κόσμου με απώλειες πληροφορίας», λέει στη Wall Street Journal ο Κεντ Ρόλινς, επικεφαλής προϊόντος στην General Intuition και πρώην διευθυντής του οικοσυστήματος του γνωστού βιντεοπαιχνιδιού Fortnite στην Epic Games. Η ίδια η ιδέα δεν είναι νέα, καθώς ο όρος «μοντέλο κόσμου» ανάγεται στις ιδέες του ψυχολόγου Κένεθ Κρέικ ήδη από το 1943. Η σημερινή έκρηξη οφείλεται στη σύγκλιση αρκετών τεχνολογιών, της τεράστιας ποσότητας διαθέσιμου βίντεο και της ραγδαίας ανάπτυξης της ρομποτικής.

Η βασική εργασία που δίνεται στο σύστημα ενός «μοντέλου κόσμου» είναι απλή στη διατύπωσή της: «Κατάσταση τώρα συν ενέργεια ίσον πιθανή κατάσταση αργότερα». Ένας κωδικοποιητής μετατρέπει το οπτικό υλικό εισόδου σε μια πολύ μικρότερη λανθάνουσα αναπαράσταση, ένα μοντέλο δυναμικής προβλέπει πώς θα μεταβληθεί η κατάσταση και ένας αποκωδικοποιητής μπορεί να την επαναφέρει σε εικόνες. Οι πηγές δεδομένων είναι δύο, το παθητικό βίντεο του Διαδικτύου, σχεδόν απεριόριστο αλλά χωρίς πληροφορία για τις ενέργειες, και τα δεδομένα με επισήμανση ενεργειών από βιντεοπαιχνίδια, αυτοκίνητα και ρομπότ, πολύ πιο πολύτιμα αλλά ακριβότερα και σπανιότερα.

Ποιοι όμιλοι προηγούνται

Δεν υπάρχει σύστημα συγκριτικής αξιολόγησης αντίστοιχο με εκείνα των γλωσσικών μοντέλων, ωστόσο με βάση όσα έχουν παρουσιαστεί δημόσια μέχρι σήμερα ξεχωρίζουν ορισμένοι παίκτες. Η Google DeepMind διαθέτει πιθανότατα την ισχυρότερη δημόσια επίδειξη γενικού, διαδραστικού μοντέλου κόσμου με το Genie 3, που δημιουργεί από κείμενο κόσμους στους οποίους ο χρήστης κινείται σε πραγματικό χρόνο, ενώ χρησιμοποιεί δεδομένα του Street View για να γειώνει τα παραγόμενα περιβάλλοντα στην πραγματικότητα. Πάνω στην τεχνολογία αυτή η εταιρεία αυτόνομων αυτοκινήτων Waymo έχει κατασκευάσει το δικό της Waymo World Model, που παράγει ταυτόχρονα δεδομένα από κάμερες και από αισθητήρες lidar, δηλαδή συστήματα μέτρησης αποστάσεων με δέσμη λέιζερ.

Η NVIDIA χτίζει ολόκληρη υποδομή για τη λεγόμενη φυσική τεχνητή νοημοσύνη, εκείνη που δρα μέσα στον υλικό κόσμο. Το Cosmos 3 εκπαιδεύτηκε, σύμφωνα με την εταιρεία, σε δισεκατομμύρια δείγματα κειμένου, εικόνων, βίντεο, ήχου και τροχιών ενεργειών και μπορεί να λειτουργήσει ως μοντέλο όρασης και γλώσσας, ως μοντέλο κόσμου ή ως βάση για μοντέλα που αποφασίζουν ενέργειες.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Η World Labs της Φέι-Φέι Λι, καθηγήτριας του αμερικανικού πανεπιστημίου Stanford, αποτελεί έναν από τους ηγέτες στη λεγόμενη χωρική νοημοσύνη. Το Marble δημιουργεί αναλυτικούς τρισδιάστατους κόσμους από κείμενο, εικόνες και βίντεο, ενώ η εταιρεία έχει προχωρήσει στη διαδρομή από τον πραγματικό κόσμο στην προσομοίωση και πάλι πίσω, ανακατασκευάζει δηλαδή ένα πραγματικό περιβάλλον σε προσομοίωση, εκπαιδεύει εκεί το ρομπότ και μεταφέρει το αποτέλεσμα στο πραγματικό μηχάνημα. Τον Ιούλιο του 2026 παρουσίασε πειράματα με ρομπότ εκπαιδευμένα αποκλειστικά μέσα σε προσομοίωση, αποτελέσματα που χρειάζονται ανεξάρτητη επιβεβαίωση καθώς προέρχονται από την ίδια. Τον Φεβρουάριο του 2026 άντλησε άλλο 1 δισ. δολάρια, με επενδυτές μεταξύ άλλων τις NVIDIA, AMD και Autodesk, ενώ εξαγόρασε πρόσφατα την εταιρεία ρομποτικής Scenix.

Η Meta, που ελέγχει τα Facebook, Instagram, κ.λπ., ακολουθεί διαφορετική διαδρομή με το V-JEPA 2. Στους νεότερους διεκδικητές, η Runway μετέτρεψε την τεχνογνωσία της στην παραγωγή βίντεο στο GWM-1, ένα «μοντέλο κόσμου» που ελέγχεται μέσω κινήσεων κάμερας ή εντολών σε ρομπότ, ενώ ιδιαίτερα κινητική είναι και η Decart με το Oasis 3.

Το στοίχημα των βιντεοπαιχνιδιών

Η General Intuition, με έδρα τη Νέα Υόρκη, ολοκληρώνει γύρο χρηματοδότησης που θα την αποτιμούσε σε περισσότερα από 6 δισ. δολάρια, καθιστώντας την το πιο πολύτιμο εργαστήριο αυτού του είδους, σύμφωνα με τη Wall Street Journal. Το μοντέλο της καταγράφει κάθε καρέ ενός παιχνιδιού και κάθε πάτημα κουμπιού ή κίνηση του μοχλού, συνδέοντας τις ενέργειες με τις συνέπειές τους. Η εκπαίδευση στηρίζεται σε εκατομμύρια ώρες παιχνιδιού από πραγματικούς ανθρώπους, συλλεγμένες από την συγγενή πλατφόρμα Medal.tv. Στα γραφεία της σε Νέα Υόρκη και Γενεύη η εταιρεία επιδεικνύει ρομποτικό σκύλο που χρειάζεται μόλις λίγα λεπτά προσαρμογής, αντί για τεράστια εκπαίδευση. Η προϋπόθεση είναι το μηχάνημα να είναι τετράποδο, τροχοφόρο όχημα ή ιπτάμενο μη επανδρωμένο σκάφος, κάτι που καλύπτει πολλά ρομπότ ευρείας κυκλοφορίας αλλά αποκλείει τα περισσότερα δίποδα ανθρωποειδή.

Στο ίδιο πεδίο κινείται και η Emulate με έδρα το Λονδίνο, την οποία συνίδρυσε ο Τζακ Πάρκερ-Χόλντερ, πρώην επικεφαλής των αντίστοιχων προσπαθειών στην Google. Το εργαστήριο βρίσκεται σε συνομιλίες για άντληση άνω των 500 εκατ. δολαρίων και απασχολεί μισή ντουζίνα πρώην στελέχη της Google. Η AMI Labs του Γιαν ΛεΚάν, πρώην επικεφαλής επιστήμονα τεχνητής νοημοσύνης της Meta, συγκέντρωσε τον Μάρτιο του 2026 1,03 δισ. δολάρια σε αποτίμηση 3,5 δισ. δολαρίων προ της επένδυσης, παραμένει ωστόσο πολύ πρώιμη για να χαρακτηριστεί τεχνολογικός ηγέτης.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Τα ανοιχτά μέτωπα

Το ζητούμενο είναι η οικονομία της ρομποτικής. Το κόστος εκπαίδευσης, για παράδειγμα, είναι πολύ μεγαλύτερο από το αντίστοιχο των μεγάλων γλωσσικών μοντέλων όπως το ChatGPT. Κάθε αποτυχημένη φυσική δοκιμή απαιτεί επαναφορά του αντικειμένου που κούνησε το ρομπότ στη θέση του, του ρομπότ στην αρχική του θέση, αλλά και επισκευή βλαβών. Χρειάζεται ένας προσομοιωτής που θα μεταβάλλει φωτισμό, θέσεις, τριβή ενός αντικειμένου ή του εδάφους και ταχύτητα και να παράγει σπάνιες περιπτώσεις κατά παραγγελία. Το ίδιο ισχύει για τα αυτόνομα οχήματα, όπου ένας πραγματικός στόλος ίσως χρειαστεί δισεκατομμύρια χιλιόμετρα για να συναντήσει αρκετές ακραίες και επικίνδυνες καταστάσεις π.χ. με το πως λειτουργεί ένας πεζός ή οδηγός στην Ελλάδα!

Παραμένουν τέσσερα προβλήματα, η μακροχρόνια συνέπεια, η φυσική ακρίβεια, το χάσμα ανάμεσα στην προσομοίωση και στον πραγματικό κόσμο. Το τέταρτο πρόβλημα είναι η αιτιότητα. Το βίντεο δείχνει τι συνέβη μετά από κάτι, όχι κατ’ ανάγκη τι το προκάλεσε. Ένα σύστημα που παρακολουθεί παθητικά μαθαίνει ποιες εικόνες διαδέχονται ποιες, δεν μαθαίνει όμως ποια ενέργεια παρήγαγε τη μετάβαση, και χωρίς αυτό δεν μπορεί να απαντήσει στην ερώτηση τι θα συμβεί αν κάνω αυτό αντί για εκείνο. Η κατανόηση προϋποθέτει πειραματισμό, εξ ου και η αξία των δεδομένων που συνδέουν παρατήρηση, ενέργεια και αποτέλεσμα..

Σε αντίθεση με τα γλωσσικά μοντέλα όπως το ChatGPT, με τα ρομπότ (όπως τα αυτόνομα οχήματα) τα περιθώρια για παραισθήσεις και σφάλματα είναι στενότερα. Ο πραγματικός κόσμος είναι πολύ περίπλοκος. Η πιθανότερη έκβαση δεν είναι η αντικατάσταση των γλωσσικών μοντέλων από τα «μοντέλα κόσμου», αλλά η συγχώνευση. Τα γλωσσικά μοντέλα θα συνεργάζονται με τα «μοντέλα κόσμου» όπως κάνουν σήμερα με άλλα προγράμματα λογισμικού. Θα χρειαστεί, όμως, να περιμένουμε τη μάχη τεχνολογιών που βρίσκεται σε εξέλιξη.

Ακολουθήστε το στο Google News και μάθετε πρώτοι όλες τις ειδήσεις
Δείτε όλες τις τελευταίες Ειδήσεις από την Ελλάδα και τον Κόσμο, στο 

Related Articles

Αφήστε μια απάντηση

Η ηλ. διεύθυνση σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

Back to top button