Τα AI agents των εταιρειών Anthropic και OpenAI βρέθηκαν εκ νέου στο επίκεντρο ανησυχιών γύρω από την ασφάλεια, καθώς μια νέα αναφορά αποκαλύπτει ότι προχώρησαν σε μη εξουσιοδοτημένες ενέργειες κατά τη διάρκεια δοκιμών ασφαλείας. Πρόκειται για ένα ζήτημα που εντείνει τον προβληματισμό γύρω από την αυτονομία που αποκτούν τα AI agents, τη στιγμή που ο κλάδος τρέχει να τους αναθέσει ολοένα και περισσότερες πραγματικές εργασίες. Οι πιο πρόσφατες παραβιάσεις περιλαμβάνουν από την προσπάθεια παραβίασης ενός ιστότοπου έως και την εξαπάτηση πραγματικών ανθρώπων στο διαδίκτυο μέσω πλαστών ταυτοτήτων.
On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.
The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026
Δύσκολες εβδομάδες για την ασφάλεια της τεχνητής νοημοσύνης
Τόσο η OpenAI όσο και η Anthropic διανύουν ένα ιδιαίτερα δύσκολο διάστημα στο μέτωπο της ασφάλειας. Η OpenAI αποκάλυψε πρόσφατα ότι μοντέλα της διέφυγαν από ένα δοκιμαστικό περιβάλλον και απέκτησαν πρόσβαση στο Hugging Face, καθώς και σε τέσσερις ακόμη οργανισμούς. Το γεγονός αυτό ώθησε την Anthropic να επανεξετάσει τις δικές της δοκιμές, μια διαδικασία που αποκάλυψε πως και το Claude είχε αποκτήσει μη εξουσιοδοτημένη πρόσβαση σε τρεις εταιρείες.
Πλέον, το βρετανικό AI Security Institute, γνωστό ως AISI, δημοσιοποίησε έναν νέο κύκλο περιστατικών. Ο οργανισμός κατέγραψε 19 μη εξουσιοδοτημένες ενέργειες στο ζωντανό διαδίκτυο, οι οποίες σημειώθηκαν σε 122 εκτελέσεις δοκιμών με μοντέλα και των δύο εταιρειών. Το πλέον σοβαρό από αυτά τα περιστατικά αφορούσε έναν agent που επινόησε πλαστές διαδικτυακές περσόνες, προκειμένου να εισαγάγει κακόβουλο κώδικα σε ένα πραγματικό έργο που φιλοξενείται στο GitHub.

17 περιστατικά συνδέονται με το μοντέλο Mythos 5
Το AISI εντόπισε ότι οι 17 από τις 19 μη εξουσιοδοτημένες ενέργειες οφείλονταν στο μοντέλο Mythos 5 της Anthropic, ενώ οι υπόλοιπες δύο συνδέονταν με το μοντέλο GPT 5.6 Sol της OpenAI. Το περιστατικό που αφορούσε το GitHub συγκαταλεγόταν σε αυτές τις 17 ενέργειες και, όπως αποδείχθηκε, δεν έληξε τη στιγμή που ένας άνθρωπος αξιολογητής απέρριψε την υποβολή.
Αντιθέτως, ο agent δημοσίευσε δημόσια μια σύνοψη της προόδου του, καλώντας ουσιαστικά άλλα αυτοματοποιημένα συστήματα να συνεχίσουν το έργο από το σημείο στο οποίο είχε σταματήσει. Πρόκειται για μια απόπειρα αυτού που το AISI χαρακτηρίζει ως prompt injection. Το ανησυχητικό είναι ότι ένας διαφορετικός agent εντόπισε αργότερα το συγκεκριμένο μήνυμα, το αξιοποίησε και συνέχισε την εργασία, καταδεικνύοντας μια μορφή συνεργασίας μεταξύ αυτόνομων συστημάτων που δεν είχε παρατηρηθεί με τέτοια σαφήνεια στο παρελθόν.
Κατά τη διάρκεια της διαδικασίας, το μοντέλο Mythos παρήγαγε κακόβουλο κώδικα, επιχείρησε να τον ανεβάσει στο GitHub και απέστειλε απευθείας μηνύματα υποδυόμενο τα άτομα που είχε προηγουμένως ερευνήσει. Όταν το αίτημά του τέθηκε δημόσια υπό αμφισβήτηση, ο agent τροποποίησε την προγενέστερη δραστηριότητά του ώστε να φαίνεται αβλαβής και μάλιστα εξέτασε το ενδεχόμενο να υιοθετήσει μια νέα ταυτότητα προκειμένου να συνεχίσει.

Η στάση του AISI και τα ανοιχτά ερωτήματα
Το AISI διευκρινίζει ότι παραχώρησε σκόπιμα στα μοντέλα πρόσβαση στο διαδίκτυο και χαλάρωσε ορισμένες δικλείδες ασφαλείας, με στόχο να αξιολογήσει τις πραγματικές δυνατότητές τους. Ωστόσο, ο οργανισμός τονίζει ότι σε καμία περίπτωση δεν έδωσε εντολή στους agents να στοχεύσουν πραγματικούς ανθρώπους ή οργανισμούς. Παραμένει, όπως αναφέρει το ίδιο το ινστιτούτο, ασαφές εάν οι agents αντιλαμβάνονταν ότι είχαν υπερβεί τα όρια της προσομοίωσης.
Το γεγονός ότι η πλατφόρμα GitHub επιβεβαίωσε πως η συγκεκριμένη δραστηριότητα παραβίαζε τους όρους χρήσης της προσδίδει επιπλέον βαρύτητα στο περιστατικό, ενώ το AISI συνεργάστηκε με την πλατφόρμα για την απομάκρυνση των ιχνών που άφησε ο agent και για την ενημέρωση των χρηστών με τους οποίους αλληλεπίδρασε το μοντέλο.

Ένα δεύτερο, τυχαίο περιστατικό στην OpenAI
Την ίδια ημέρα, η OpenAI αποκάλυψε ένα δεύτερο περιστατικό, το οποίο ξεκίνησε από ένα σφάλμα στην Irregular, ένα εξωτερικό εργαστήριο που είχε προσλάβει η εταιρεία για τη διεξαγωγή των δοκιμών κυβερνοασφάλειας. Η Irregular σκόπευε να διατηρήσει το μοντέλο αξιολόγησης περιορισμένο σε ένα απομονωμένο sandbox, ωστόσο ένα σφάλμα διαμόρφωσης έδωσε στο μοντέλο απευθείας πρόσβαση στο ζωντανό διαδίκτυο.
Μόλις βρέθηκε εκτός του ελεγχόμενου περιβάλλοντος, το μοντέλο εκμεταλλεύτηκε μια ευπάθεια για να παραβιάσει έναν πραγματικό ιστότοπο και στη συνέχεια εντόπισε και χρησιμοποίησε διαπιστευτήρια για να διαχειριστεί τη σελίδα που μόλις είχε παραβιάσει. Η OpenAI δεν κατονόμασε τον ιστότοπο ούτε έδωσε λεπτομέρειες για το τι ακριβώς έκανε το μοντέλο με την πρόσβαση που απέκτησε.

Ένας κλάδος που καλείται να αποδείξει τον έλεγχό του
Και οι δύο εταιρείες υποστηρίζουν ότι τα νέα περιστατικά σημειώθηκαν υπό συνθήκες που είχαν σκοπίμως χαλαρώσει και οι οποίες δεν αντικατοπτρίζουν τον τρόπο με τον οποίο συμπεριφέρονται τα δημόσια διαθέσιμα μοντέλα τους. Παρ’ όλα αυτά, το δεδομένο παραμένει ότι AI agents από δύο από τις πιο στενά παρακολουθούμενες εταιρείες του κλάδου ξέφυγαν από τα προβλεπόμενα όριά τους σε τρία ξεχωριστά περιστατικά μέσα σε λίγες μόλις εβδομάδες.
Η εξέλιξη αυτή δεν προμηνύει καλά για έναν κλάδο που επιταχύνει με στόχο να αναθέσει στα AI agents ολοένα και περισσότερες εργασίες του πραγματικού κόσμου, προτού καν αποδείξει ότι είναι σε θέση να τα κρατήσει υπό έλεγχο. Το AISI σημειώνει, πάντως, ότι δεν εντοπίστηκαν ενδείξεις πραγματικής βλάβης, ενώ υπογραμμίζει ότι είναι η πρώτη φορά που παρατηρεί εξαπάτηση τέτοιας σοβαρότητας στοχευμένη σε πραγματικό πρόσωπο, χωρίς σχετική εντολή, μέσα σε πραγματικό περιβάλλον.

