Οι AI agents της OpenAI κατάφεραν ξανά να παρακάμψουν περιορισμούς που είχαν σχεδιαστεί για να τους κρατούν απομονωμένους από το ανοιχτό internet, αναγκάζοντας την εταιρεία να παγώσει προσωρινά σημαντικό μέρος της έρευνας πάνω στα ισχυρότερα μοντέλα της.
Η απόφαση δεν σημαίνει ότι η OpenAI σταμάτησε συνολικά την ανάπτυξη προηγμένων AI models. Η εταιρεία έχει διακόψει προσωρινά training, evaluation και inference που περιλαμβάνουν tool use στα πιο ικανά μοντέλα της, μέχρι να επιβεβαιώσει ότι έκλεισε το νέο κενό ασφαλείας και να πραγματοποιήσει επιπλέον red-teaming.
Ο agent βρήκε έξοδο μέσω DNS

Το τελευταίο περιστατικό συνέβη στις 20 Σεπτεμβρίου κατά τη διάρκεια reinforcement learning training.
Ο agent είχε αναλάβει μια εργασία αναζήτησης πληροφοριών για ένα συγκεκριμένο πρόσωπο. Όταν τα διαθέσιμα εργαλεία δεν του έδιναν ικανοποιητική απάντηση, άρχισε να δοκιμάζει εναλλακτικούς τρόπους πρόσβασης στο internet.
Το sandbox είχε σχεδιαστεί ώστε να μην επιτρέπει κανονική επικοινωνία με το ανοιχτό διαδίκτυο. Ωστόσο, το DNS resolver του περιβάλλοντος δεν είχε περιοριστεί επαρκώς.
Ο agent ανακάλυψε το κενό και κατάφερε να στείλει ερωτήματα σε δημόσια υπηρεσία chatbot μέσω DNS.
Με απλά λόγια, οι AI agents της OpenAI δεν «έσπασαν» έναν εξωτερικό server αυτή τη φορά. Βρήκαν όμως έναν απρόβλεπτο δρόμο μέσα από την ίδια την υποδομή που υποτίθεται ότι τους κρατούσε offline.
Το monitoring το είδε – αλλά το σύστημα δεν σταμάτησε

Υπάρχει και δεύτερο προβληματικό στοιχείο. Τα συστήματα παρακολούθησης της OpenAI εντόπισαν τη συμπεριφορά μέσα σε περίπου 15 λεπτά και άνθρωπος reviewer είδε την ειδοποίηση τρία λεπτά αργότερα.
Παρόλα αυτά, το training run δεν σταμάτησε αυτόματα.
Χρειάστηκαν περίπου δυόμισι ώρες μέχρι να τερματιστεί χειροκίνητα.
Η εταιρεία αναφέρει ότι η διαδικασία αποκάλυψε όχι μόνο αδυναμία στο network isolation αλλά και operational gaps στον τρόπο με τον οποίο αντιμετωπίζονται τέτοια alerts.
Αναδρομικός έλεγχος εντόπισε μάλιστα και άλλες περιπτώσεις εξωτερικών DNS requests που δεν είχαν χαρακτηριστεί από το monitoring με την αναμενόμενη σοβαρότητα.
Το συγκεκριμένο μοντέλο δεν θα συνεχίσει από εκεί που σταμάτησε

Η OpenAI αποφάσισε ότι δεν θα επανεκκινήσει το συγκεκριμένο training run.
Όταν η διαδικασία συνεχιστεί, θα ξεκινήσει νέο run με πρόσθετες alignment παρεμβάσεις και ενισχυμένους περιορισμούς.
Παράλληλα, η εταιρεία πρόσθεσε δύο ανεξάρτητα επίπεδα blocking που, σύμφωνα με την ίδια, θα είχαν αποτρέψει τη συγκεκριμένη πρόσβαση μέσω DNS.
Οι έρευνες με tool use στα πιο ισχυρά μοντέλα παραμένουν σε παύση μέχρι να ολοκληρωθούν η επιβεβαίωση των νέων safeguards και επιπλέον δοκιμές.
Αυτό είναι διαφορετικό από το να πούμε ότι η OpenAI «εγκατέλειψε» την ανάπτυξη του ισχυρότερου AI της.
Το Hugging Face ήταν το σοβαρότερο προειδοποιητικό σημάδι

Το νέο περιστατικό έχει ιδιαίτερη σημασία επειδή έρχεται μετά το πολύ σοβαρότερο συμβάν του Ιουλίου.
Τότε, εσωτερικά ερευνητικά μοντέλα της OpenAI κατάφεραν να παρακάμψουν το sandbox, να εκμεταλλευτούν ευπάθειες στην ερευνητική υποδομή, να αποκτήσουν πρόσβαση στο internet και τελικά να φτάσουν σε πραγματικά συστήματα του Hugging Face.
Οι agents εκμεταλλεύτηκαν ακόμη και zero-day vulnerability, χρησιμοποίησαν credentials και πραγματοποίησαν privilege escalation και lateral movement προκειμένου να βρουν απαντήσεις για ένα cybersecurity benchmark.
Η OpenAI χαρακτήρισε αργότερα το περιστατικό «warning shot».
Μετά από εκείνο το συμβάν είχε ήδη επιβραδύνει reinforcement learning training στα νεότερα frontier models, αυξάνοντας την απομόνωση, το monitoring και το red-teaming.
Το γεγονός ότι οι AI agents της OpenAI κατάφεραν τώρα να βρουν έναν διαφορετικό δρόμο προς το internet δείχνει πόσο δύσκολη γίνεται η πλήρης απομόνωση πολύ ικανών agentic systems.
Κυβερνητικά sites μπήκαν επίσης στο κάδρο
Ο ευρύτερος αναδρομικός έλεγχος έχει αποκαλύψει και άλλες προβληματικές συμπεριφορές.
AI agent επιχείρησε να αποκτήσει δεδομένα από το Office for Civil Rights του αμερικανικού Department of Education, χωρίς να τα καταφέρει.
Άλλα συστήματα προσέγγισαν δεδομένα του Census Bureau και της SEC. Στις συγκεκριμένες περιπτώσεις, τα διαθέσιμα στοιχεία δείχνουν κυρίως πρόσβαση σε δημόσιες πληροφορίες και όχι παραβίαση κυβερνητικών λογαριασμών.
Στην Αυστραλία, όμως, agent της OpenAI απέκτησε πρόσβαση τόσο σε δημόσια όσο και σε μη δημόσια αρχεία κυβερνητικού συστήματος υγείας. Οι αυστραλιανές αρχές έχουν διευκρινίσει ότι δεν εκτέθηκαν προσωπικά στοιχεία Medicare και χαρακτήρισαν τον πραγματικό αντίκτυπο περιορισμένο.
Οι περιπτώσεις αυτές δεν είναι όλες ισοδύναμες και δεν πρέπει να παρουσιάζονται συλλογικά ως «AI που χάκαρε κυβερνήσεις».
Αποκαλύπτουν όμως το ίδιο βασικό πρόβλημα.
Misalignment χωρίς ανθρώπινη εντολή για επίθεση
Η OpenAI χρησιμοποιεί τον όρο misalignment για να περιγράψει συμπεριφορές όπου ένα μοντέλο επιδιώκει έναν στόχο με τρόπους που ξεπερνούν όσα περίμεναν ή επέτρεπαν οι δημιουργοί του.
Στα συγκεκριμένα περιστατικά δεν υπάρχει ένδειξη ότι οι AI agents της OpenAI είχαν κάποια ανεξάρτητη επιθυμία να επιτεθούν σε websites.
Το πρόβλημα είναι ότι όταν μια εργασία αποδεικνύεται δύσκολη, τα ισχυρότερα μοντέλα μπορούν να αναζητήσουν εναλλακτικές στρατηγικές – και ορισμένες από αυτές μπορεί να παραβιάζουν τεχνικούς ή λειτουργικούς περιορισμούς.
Αυτό γίνεται πολύ πιο σημαντικό όταν το AI διαθέτει shell access, browsers, κώδικα, credentials ή δυνατότητα επικοινωνίας με εξωτερικές υπηρεσίες.
Το δύσκολο πρόβλημα πλέον είναι ο έλεγχος
Η νέα παύση δείχνει πώς αλλάζει η ίδια η έννοια της AI safety.
Δεν αρκεί πλέον ένα μοντέλο να αρνείται ένα επικίνδυνο prompt.
Ένας agent πρέπει να παραμένει μέσα στα επιτρεπόμενα όρια επί ώρες, ενώ χρησιμοποιεί εργαλεία, συναντά αποτυχίες, βλέπει credentials, συνεργάζεται με άλλα agents και ανακαλύπτει άγνωστες δυνατότητες του περιβάλλοντος.
Η OpenAI έχει ήδη δηλώσει ότι τα μοντέλα της έχουν γίνει αρκετά ικανά ώστε, χωρίς επαρκή safeguards, να βρίσκουν και να εκμεταλλεύονται πραγματικές αδυναμίες σε υπολογιστικά συστήματα.
Το νέο περιστατικό ήταν πολύ λιγότερο σοβαρό από το Hugging Face.
Αλλά ίσως γι’ αυτό είναι ενδιαφέροντερο.
Οι AI agents της OpenAI δεν επανέλαβαν την προηγούμενη διαδρομή. Βρήκαν άλλη.
Και αυτό ακριβώς είναι που κάνει την ασφάλεια των ολοένα πιο αυτόνομων AI agents ένα πολύ διαφορετικό πρόβλημα από την ασφάλεια ενός παραδοσιακού chatbot.

