«Είναι ένα ακόμη ορόσημο στην πορεία μας προς αυτό που ονομάζουμε physical AGI, δηλαδή να κάνουμε ένα ρομπότ να μπορεί να κάνει οτιδήποτε μπορεί να κάνει ένας άνθρωπος», αναφέρει η Google DeepMind, σύμφωνα με δήλωση που δημοσίευσε το Wired, παρουσιάζοντας τη νέα έκδοση του μοντέλου της τεχνητής νοημοσύνης. Η εταιρεία ανακοίνωσε την Πέμπτη το Gemini Robotics 2, μια πλατφόρμα που, όπως υποστηρίζει, μπορεί να ελέγχει ολόκληρο το σώμα ανθρωποειδών ρομπότ και να τα καθοδηγεί σε εργασίες όπως το μάζεμα σκουπιδιών ή το σήκωμα ενός ποτιστηριού.
- Το Gemini Robotics 2 επεκτείνει τον έλεγχο από το άνω μέρος του σώματος σε «κινήσεις ολόκληρου του σώματος», από τα πόδια έως τα ακροδάχτυλα.
- Σε βίντεο εμφανίζεται το ρομπότ Apollo 2 της Apptronik να σκύβει για να πιάσει ένα ποτιστήρι και να παίρνει αντικείμενα από ράφι.
- Η Google χαρακτηρίζει το Gemini Robotics ER 2 «το ασφαλέστερο μοντέλο ρομποτικής της μέχρι σήμερα».
Τι νέο φέρνει η αναβάθμιση σε σχέση με την προηγούμενη έκδοση
Το αρχικό σύστημα Gemini Robotics μπορούσε ήδη να τροφοδοτεί ρομπότ που εκτελούσαν λεπτές κινήσεις, όπως το κλείσιμο σακουλών αποθήκευσης ή το δίπλωμα οριγκάμι, αλλά αυτό γινόταν μέσω ρομποτικών βραχιόνων και χεριών. Η νέα έκδοση, σύμφωνα με την εταιρεία, φέρνει «έξυπνο έλεγχο ολόκληρου του σώματος», επιτρέποντας στα ανθρωποειδή ρομπότ να περπατούν, να σκύβουν, να τεντώνονται και να χειρίζονται αντικείμενα.
Στα βίντεο που δημοσίευσε η Google, τα ρομπότ φαίνεται να τοποθετούν μια κασέτα σε ραδιοκασετόφωνο, να βιδώνουν μια λάμπα, να δένουν σακούλες σκουπιδιών και να σφραγίζουν σακουλάκια τύπου Ziploc — εργασίες που απαιτούν μεγαλύτερη επιδεξιότητα, καθώς το μοντέλο μπορεί πλέον να ελέγχει πιο σύνθετα χέρια με πέντε δάχτυλα.
Η Google DeepMind σημειώνει πάντως ότι τα ρομπότ «έχουν ακόμη δρόμο να διανύσουν ως προς την ταχύτητα κίνησης», προσθέτοντας ωστόσο ότι η αναβάθμιση «είναι ένα σημαντικό βήμα προς τις δεξιότητες που απαιτούνται για την ολοκλήρωση πιο σύνθετων εργασιών στον πραγματικό κόσμο».
Πολλαπλά μοντέλα ΤΝ που «βλέπουν» και δρουν
Η λειτουργία επιτυγχάνεται με τη συνύπαρξη πολλών διαφορετικών μοντέλων τεχνητής νοημοσύνης μέσα στα ρομπότ, κάτι που τους δίνει μια πολυτροπική αντίληψη του περιβάλλοντός τους. Υπάρχει ένα μοντέλο όρασης-γλώσσας που βοηθά στην κατανόηση, καθώς και δύο μοντέλα όρασης-γλώσσας-δράσης που ελέγχουν αντίστοιχα τις κινήσεις ολόκληρου του σώματος και των χεριών.
Παράλληλα αναβαθμίζεται και το Gemini Robotics ER (embodied reasoning), ένα μοντέλο που βοηθά τα ρομπότ να αναλύουν το περιβάλλον τους, να επεξεργάζονται οδηγίες και να εκτελούν πολλαπλά βήματα. Το Gemini Robotics ER 2 «κατανοεί πλέον πότε ξεκινούν και πότε τελειώνουν οι εργασίες», ενώ επιτρέπει και σε ρομπότ διαφορετικών τύπων να συνεργάζονται: σε ένα βίντεο, το Apollo 2 δίνει οδηγίες στο ρομπότ διπλού βραχίονα της Google να βάλει εργαλεία σε έναν κάδο κατά τον καθαρισμό ενός γκαράζ.
Είναι σημαντικό, όπως επισημαίνεται, ότι δεν πρόκειται για μηχανές γενικής χρήσης που μπορούν να κάνουν σχεδόν οτιδήποτε. Το μοντέλο εκπαιδεύτηκε ειδικά για κάθε εργασία που εμφανίζεται στα βίντεο, με συνδυασμό ανθρώπινης τηλεχειριζόμενης καθοδήγησης, βίντεο και προσομοιώσεων.
Το ζήτημα της ασφάλειας μπαίνει στο επίκεντρο
«Το ερώτημα της ασφάλειας είναι ακόμη πιο πιεστικό, επειδή τα τοποθετείς σε πολλές διαφορετικές καταστάσεις», δήλωσε στο Wired η Carolina Parada, επικεφαλής ρομποτικής της Google DeepMind. «Θα εμφανιστεί μεγάλη αβεβαιότητα και θέλεις να μπορείς να κατανοήσεις το ζήτημα της ασφάλειας πιο βαθιά.»
Η τεχνητή νοημοσύνη μπορεί να κάνει λάθη — κάτι εκνευριστικό όταν αναζητά κανείς μια απάντηση, αλλά δυνητικά επικίνδυνο όταν πρόκειται για ένα βαρύ ρομπότ σε μέγεθος ανθρώπου.
Η εταιρεία λέει ότι ακολουθεί μια πολυεπίπεδη προσέγγιση, με δικλείδες ασφαλείας σε κάθε επίπεδο μοντέλου, ενώ εισήγαγε ένα νέο κριτήριο αξιολόγησης, το ASIMOV-Agentic, για τον εντοπισμό εντολών που θα μπορούσαν να οδηγήσουν σε επιβλαβές αποτέλεσμα. Το Gemini Robotics ER 2 χαρακτηρίζεται «το ασφαλέστερο μοντέλο ρομποτικής μέχρι σήμερα», καθώς μπορεί να «αντιλαμβάνεται καλύτερα πότε βρίσκονται άνθρωποι κοντά» και να σταματά με ασφάλεια το ρομπότ εάν κάποιος πλησιάσει υπερβολικά. Βελτιώσεις έρχονται και στο On-Device Model, που τρέχει τοπικά στο ρομπότ χωρίς σύνδεση στο διαδίκτυο και προσαρμόζεται πλέον γρηγορότερα σε νέες, «δραστικά διαφορετικές» μορφές μηχανών.
Η αντιπαράθεση με τα ρομπότ Optimus του Έλον Μασκ
Η Google υπόσχεται ότι το βίντεο περιλαμβάνει «πραγματικό πλάνο σε πραγματικό χρόνο» από «πλήρως αυτόνομα» ρομπότ — κάτι που, όπως σημειώνεται, έρχεται σε αντίθεση με τα ρομπότ Optimus της Tesla, καθώς μια πολυσυζητημένη επίδειξη αποδείχθηκε ότι είχε γίνει με τηλεχειριστές. Ο Έλον Μασκ έχει υποσχεθεί ότι τα Optimus θα είναι «το μεγαλύτερο προϊόν όλων των εποχών», με πωλήσεις 10 τρισεκατομμυρίων δολαρίων. Είχε πει ότι θα υπάρχουν 50.000 έως 100.000 Optimus έως το 2026 και 1.000 ρομπότ σε εργοστάσια έως το τέλος του 2025 — προβλέψεις που δεν επαληθεύτηκαν.
Πρόκειται πάντως για πρώιμο ακόμη στάδιο: η Google δεν πρόκειται να διαθέσει ρομπότ για καταναλωτές στο άμεσο μέλλον.
Πιστεύετε ότι τα ανθρωποειδή ρομπότ με τεχνητή νοημοσύνη θα μπουν σύντομα στην καθημερινότητά μας ή παραμένουν κυρίως υπόσχεση; Πείτε μας τη γνώμη σας.



























