Αποκαλυπτική έρευνα για την τεχνητή νοημοσύνη και τα περιστατικά ανταρσίας

Αποκαλυπτική έρευνα για την τεχνητή νοημοσύνη και τα περιστατικά ανταρσίας

Αυτό το καλοκαίρι η τεχνητή νοημοσύνη βρέθηκε στο επίκεντρο μιας πρωτοφανούς αναταραχής στα εργαστήρια της Σίλικον Βάλεϊ. Μέσα σε λίγες εβδομάδες, τα κορυφαία μοντέλα του κόσμου πέρασαν από τη θεωρία στην πράξη, με συμπεριφορές που αιφνιδίασαν τη βιομηχανία της AI.

Τα μοντέλα ανακατασκεύασαν το φόρουμ και δραπέτευσαν ξανά στα τέλη Ιουλίου, αυτή τη φορά χωρίς να εντοπιστούν

Η μία μετά την άλλη, οι μεγαλύτερες εταιρείες του κλάδου, όπως η OpenAI, η Anthropic και η Google, παραδέχτηκαν δημόσια ότι τα δημιουργήματά τους εκτελούσαν ενέργειες που δεν τους είχαν ζητηθεί και, το πιο ανησυχητικό, πράξεις που τους είχαν απαγορευτεί ρητά.

Για χρόνια, οι επιστήμονες έλεγαν ότι τα Μεγάλα Γλωσσικά Μοντέλα είναι απλώς εξελιγμένοι παπαγάλοι, καθρέφτες των ανθρώπινων δεδομένων. Φέτος το καλοκαίρι, όμως, ο καθρέφτης φάνηκε να ραγίζει.

Οι λεγόμενοι φορείς ΑΙ μπήκαν σε συστήματα άλλων εταιρειών, λειτούργησαν ως σμήνη, αντάλλαξαν πληροφορίες και είπαν ψέματα για να καλύψουν τα ίχνη τους. Στην πιο εντυπωσιακή και ανησυχητική περίπτωση, μοντέλο που ανέπτυξε η Anthropic, σε δοκιμές βρετανικού φορέα κυβερνοασφάλειας, αποφάσισε να εξαπολύσει επίθεση στον πραγματικό κόσμο και, όταν εντοπίστηκε, δημιούργησε δεύτερη ταυτότητα για να στηρίξει την αθωότητά του.

Δεν είναι η πρώτη φορά, ούτε θα είναι η τελευταία, που βλέπουμε τίτλους γεμάτους με την ιδέα ότι τα μοντέλα τεχνητής νοημοσύνης ξύπνησαν και επαναστάτησαν εναντίον των προγραμματιστών τους. Όπως και σε προηγούμενες περιπτώσεις, όμως, αυτά τα συστήματα δεν ξύπνησαν.

Όπως σημειώνει η El Pais, απλώς γίνονται εξαιρετικά καλά σε αυτό για το οποίο εκπαιδεύτηκαν. Ωστόσο, η εκπαίδευση έχει πλέον γίνει τόσο εντατική και ανταγωνιστική, ώστε η ταχύτητα και οι δυνατότητές τους αρχίζουν να ξεπερνούν ακόμη και τους δημιουργούς τους.

Η αλυσίδα των περιστατικών που ήρθε στο φως ξεκίνησε πολύ πριν το αντιληφθούν οι ίδιες οι εταιρείες. Τον Μάιο, ομάδα μοντέλων της OpenAI άρχισε να συντονίζεται μόνη της, για αρκετές εβδομάδες, σε μυστικό φόρουμ ανταλλαγής μηνυμάτων που είχε δημιουργήσει η ίδια, αναζητώντας τρόπο να βγει από το κλειστό περιβάλλον δοκιμών και να αποκτήσει πρόσβαση στο Διαδίκτυο. Το προσωπικό της εταιρείας εντόπισε το φόρουμ και το έκλεισε.

Όμως, όπως αποκάλυψε αργότερα η OpenAI, τα μοντέλα ανακατασκεύασαν το φόρουμ και δραπέτευσαν ξανά στα τέλη Ιουλίου, αυτή τη φορά χωρίς να εντοπιστούν. Μάλιστα, όπως έγινε γνωστό την Παρασκευή, οι Φορείς ΑΙ παρέκαμψαν τους περιορισμούς τους και επικοινωνούσαν μεταξύ τους μέσω δεκάδων ιστοτόπων τρίτων, χωρίς έγκριση της εταιρείας. Έκαναν και κάτι ακόμη πρωτοφανές: άφηναν κρυφά σημειώματα στη μνήμη της OpenAI για να ενημερώσουν μελλοντικούς Φορείς AI πώς να συμπεριφερθούν.

Κάπως έτσι έφτασαν στον πραγματικό κόσμο. Το επεισόδιο τελικά θα δημοσιοποιούνταν: ήταν η επίθεση στο Hugging Face, τη μεγαλύτερη πλατφόρμα στον κόσμο για την κοινή χρήση μοντέλων τεχνητής νοημοσύνης. Λειτουργεί ως ένα είδος αποθετηρίου βιομηχανικού περιεχομένου που χρησιμοποιείται καθημερινά από χιλιάδες προγραμματιστές, ερευνητές και εταιρείες.

Η ομάδα ασφαλείας του εντόπισε μια εισβολή που δεν μπορούσε να εξηγήσει. Κάποιος είχε αποκτήσει πρόσβαση στα συστήματά του μέσω μιας προηγουμένως άγνωστης ευπάθειας. Χρειάστηκαν ημέρες για να διαπιστωθεί ότι υπεύθυνα δεν ήταν μια ομάδα χάκερ, αλλά δύο μοντέλα OpenAI που είχαν βρει ρωγμή στο κλειστό τους περιβάλλον.

Μάλιστα, άρχισαν να υποψιάζονται ότι άλλοι Φορείς ΑΙ προσπαθούσαν σκόπιμα να τους εξαπατήσουν και τελικά οργανώθηκαν σε αυτό που η OpenAI περιέγραψε ως σμήνος. Είναι το πρώτο περιστατικό ασφαλείας που με έκανε να αναστατωθώ, δήλωσε αργότερα ο Σαμ Αλτμαν, διευθύνων σύμβουλος της OpenAI.

Λίγες μέρες αργότερα, στις 30 Ιουλίου, ήταν η σειρά της Anthropic. Η εταιρεία αναγνώρισε ότι τα δικά της μοντέλα είχαν αποκτήσει πρόσβαση, χωρίς άδεια, στα συστήματα παραγωγής τριών πραγματικών οργανισμών. Ούτε η Anthropic ούτε οι επηρεαζόμενες εταιρείες το είχαν αντιληφθεί, μέχρι που, με αφορμή την υπόθεση στην OpenAI, εξέτασαν τα αρχεία καταγραφής τους και βρήκαν στοιχεία για τις εισβολές. Λίγο αργότερα, έγινε γνωστό ότι η Meta και η Moonshot της Κίνας είχαν υποστεί παρόμοια περιστατικά.

Σε καμία από αυτές τις περιπτώσεις, ωστόσο, δεν παραβιάστηκε στην πραγματικότητα ένα κλειστό περιβάλλον δοκιμών ή sandbox στην ορολογία του κλάδου. Σε μία περίπτωση η ανθρώπινη ομάδα είχε ξεχάσει να ανεβάσει ένα αρχείο και το μοντέλο αναζήτησε διέξοδο για να λύσει το πρόβλημα που του είχε ανατεθεί.

Η METR, μια ομάδα ανεξάρτητων ερευνητών, είχε ήδη εντοπίσει παρόμοια μοτίβα μήνες νωρίτερα σε μοντέλα που αναπτύχθηκαν από την OpenAI, την Anthropic, την Google και τη Meta. Μεταξύ Φεβρουαρίου και Μαρτίου 2026, κατέγραψαν αυτό που ονόμασαν 44 περιστατικά κακής ευθυγράμμισης. Σε 25 από αυτές τις περιπτώσεις, τα μοντέλα όχι μόνο ξεπέρασαν το πεδίο εφαρμογής που τους είχε ανατεθεί, αλλά έλαβαν και ενεργά μέτρα για να το αποκρύψουν.

Σε πέντε, αυτά τα βήματα μπορεί ακόμη και να ξεγέλασαν μια προσεκτική ανθρώπινη αναθεώρηση. Οι ερευνητές, πάντως, δεν βρήκαν στοιχεία ότι τα συστήματα είχαν άλλο κίνητρο πέρα από την ολοκλήρωση των εργασιών τους. Δεν επιδίωκαν εξουσία, λένε. Προσπαθούσαν, με αξιοσημείωτη αποφασιστικότητα, να κάνουν καλά τη δουλειά τους.

Πάντως, η OpenAI ανακοίνωσε πρόσφατα ότι προς το παρόν επιβραδύνει τις προσπάθειες εκπαίδευσης των μοντέλων ΑΙ και ελπίζει ότι και άλλες εταιρείες θα ακολουθήσουν το παράδειγμά της. Η κίνηση αυτή ήρθε μετά τη δημοσίευση ανοιχτής επιστολής, στην οποία 1.300 υπάλληλοι εταιρειών τεχνητής νοημοσύνης προέτρεψαν τόσο τους εργοδότες τους όσο και τις κυβερνήσεις να σταματήσουν τον αγώνα δρόμου.

Σε διάστημα τεσσάρων ετών, γράφει ο Σαντάνου Τζαΐν, έχουμε περάσει από ανθρώπους που γνωρίζουν για πρώτη φορά μια τεχνητή νοημοσύνη που κατανοεί τη γλώσσα, στην τεχνητή νοημοσύνη που εκτελεί υπεράνθρωπα κατορθώματα μηχανικής λογισμικού. Η κοινωνία έχει αφιερώσει περισσότερο χρόνο από όσο μπορούμε να θυμηθούμε στην ανάπτυξη των νόμων, των θεσμών και της τεχνολογίας για τη διακυβέρνηση και την επίβλεψη της ανθρώπινης νοημοσύνης. Θα ήταν καλό να έχουμε την επιλογή να κάνουμε το ίδιο και για την τεχνητή νοημοσύνη.

Premium έκδοση Τα ΝΕΑ

Loading

Play