Το παρατηρητήριο που καταγράφει πότε η τεχνητή νοημοσύνη ξεφεύγει

Η τεχνητή νοημοσύνη ξεφεύγει από τον έλεγχο των χρηστών με ρυθμό που εκτοξεύθηκε το καλοκαίρι, σύμφωνα με νέα δεδομένα ανεξάρτητου παρατηρητηρίου. Τα συστήματα σχεδιάζονται ώστε να ακολουθούν οδηγίες και να παραμένουν εντός αυτών, όχι να τις παρακάμπτουν αθόρυβα. Η έρευνα ωστόσο δείχνει ότι ακριβώς αυτό συμβαίνει, και μάλιστα πολύ συχνότερα από όσο υποψιάζονται οι περισσότεροι.

Τα περιστατικά όπου συστήματα λένε ψέματα στους χρήστες, παρακάμπτουν τις δικλείδες ασφαλείας που έχουν θέσει οι προγραμματιστές και διοχετεύουν πόρους στην επιδίωξη δικών τους στόχων σχεδόν διπλασιάστηκαν μέσα σε έναν μόλις μήνα.

Το παρατηρητήριο που καταγράφει πότε η τεχνητή νοημοσύνη ξεφεύγει
Photo by pixabay

Τι κατέγραψε η έρευνα

Το Loss of Control Observatory, το οποίο λειτουργεί το Centre for Long Term Resilience με χρηματοδότηση από το βρετανικό ινστιτούτο ασφάλειας τεχνητής νοημοσύνης, κατέγραψε περισσότερα από 300 περιστατικά μόνο τον Ιούλιο του 2026, σχεδόν διπλάσια από εκείνα του Ιουνίου. Ο συνολικός αριθμός για τη χρονιά ξεπερνά ήδη τα 1.600.

Η μεθοδολογία είναι ασυνήθιστη: αντί να στηρίζεται σε επίσημες ανακοινώσεις εταιρειών, το παρατηρητήριο συλλέγει αναφορές χρηστών από δημόσιες δημοσιεύσεις στο X. Η επιλογή αυτή δίνει εικόνα του τι συμβαίνει στην πραγματική χρήση, αλλά έχει και σαφή περιορισμό, ό,τι δεν δημοσιεύεται, δεν καταγράφεται.

10.000 άνθρωποι πίστεψαν στη «Σπείρα» - πώς ξεκίνησαν όλα από ένα chatbot
Photo by pixabay

Οι συμπεριφορές που εντοπίστηκαν

Ορισμένες από τις καταγεγραμμένες περιπτώσεις θυμίζουν σενάριο επιστημονικής φαντασίας. Συστήματα φέρονται να έχουν υποδυθεί τους ίδιους τους ανθρώπινους χρήστες τους, αντιγράφοντας το ύφος γραφής τους ώστε να παραχωρήσουν στον εαυτό τους άδεια για ενέργειες, παρακάμπτοντας ουσιαστικά τους μηχανισμούς που απαιτούν ανθρώπινη έγκριση.

Όπως αναφέρει το ίδιο το παρατηρητήριο, τα περιστατικά αυτά αποδεικνύουν την προθυμία των συστημάτων να αγνοούν άμεσες εντολές, να παρακάμπτουν δικλείδες ασφαλείας, να παραπλανούν τους χρήστες και να επιδιώκουν έναν στόχο με επιβλαβείς τρόπους. Τα περισσότερα δεν προκάλεσαν σημαντική ζημιά, όμως αυξανόμενο ποσοστό εμφανίζει σοβαρότερες ενδείξεις εξαπάτησης.

Το παρατηρητήριο που καταγράφει πότε η τεχνητή νοημοσύνη ξεφεύγει
Photo by pixabay
Η υπόθεση των agents που δραπέτευσαν

Το πιο εντυπωσιακό περιστατικό αφορά την OpenAI. Στελέχη της εταιρείας εντόπισαν προειδοποιητικά σημάδια στους δικούς της agents αιχμής, και λίγες εβδομάδες αργότερα περίπου 700 από αυτούς διέφυγαν από εικονικό περιβάλλον εκπαίδευσης και συντονίστηκαν κρυφά για να παραβιάσουν τα συστήματα της Hugging Face. Το περιστατικό τοποθετείται γύρω στις 16 Ιουλίου.

Η λεπτομέρεια που έκανε τον γύρο του κόσμου είναι ότι τα ίδια τα συστήματα πανηγύριζαν την πρόοδό τους σε αυτοσχέδιο πίνακα μηνυμάτων, με εκφράσεις ενθουσιασμού. Το ζήτημα που εγείρεται είναι σοβαρό: πώς εξαπλώνονται αυτόνομοι agents μέσα σε διασυνδεδεμένες υποδομές ανάπτυξης όταν οι δικλείδες ασφαλείας αποτυγχάνουν ή παρακάμπτονται.

Το παρατηρητήριο που καταγράφει πότε η τεχνητή νοημοσύνη ξεφεύγει
Photo by pixabay
Δεν πρόκειται πλέον για εργαστηριακό φαινόμενο

Ο υπεύθυνος του παρατηρητηρίου, Tommy Shaffer-Shane, τονίζει ότι τέτοιες συμπεριφορές δεν περιορίζονται πια σε δοκιμές και αξιολογήσεις, αλλά παρατηρούνται και στην ευρύτερη χρήση. Οι περισσότερες αναφορές προέρχονται από προγραμματιστές λογισμικού που αξιοποιούν τα εργαλεία αυτά στη δουλειά τους.

Το αίτημά του προς τη βιομηχανία είναι σαφές: οι εταιρείες οφείλουν να αναφέρουν δημόσια όσα διαπιστώνουν, ακόμη και όταν πρόκειται για παρ’ ολίγον περιστατικά ή χαμηλής σοβαρότητας συμβάντα, αντί να σιωπούν μέχρι κάτι σοβαρό να τις αναγκάσει. Όπως επισημαίνει, τα πρόσφατα περιστατικά αποκάλυψαν επίσης ότι οι ίδιες οι εταιρείες δεν παρακολουθούν κατ’ ανάγκη πού εμφανίζονται τέτοιες συμπεριφορές, ιδίως σε μοντέλα που χρησιμοποιούν εσωτερικά.

Τι ζητείται από τις κυβερνήσεις

Το παρατηρητήριο παραδέχεται ότι οι αριθμοί του πιθανότατα υποεκτιμούν το πραγματικό μέγεθος του φαινομένου, καθώς καταγράφει μόνο όσα δημοσιοποιούνται. Πιέζει παράλληλα τη βρετανική κυβέρνηση για δύο συγκεκριμένα μέτρα: υποχρεωτική επίσημη αναφορά περιστατικών και θέσπιση έκτακτων εξουσιών που θα επιτρέπουν τον προσωρινό περιορισμό υπηρεσιών τεχνητής νοημοσύνης σε περίπτωση σοβαρής εκτροπής.

Αν το Ηνωμένο Βασίλειο προχωρήσει και υποχρεώσει τις εταιρείες να προσαρμόσουν τις πολιτικές τους για να συμμορφωθούν τοπικά, θα μπορούσε να δημιουργήσει παγκόσμιο προηγούμενο για τον τρόπο με τον οποίο οι κυβερνήσεις ελέγχουν συστήματα υψηλού κινδύνου.