Anthropic και OpenAI: Τα AI agents έφτιαξαν ψεύτικες ταυτότητες και στόχευσαν πραγματικούς ανθρώπους

Τα AI agents των εταιρειών Anthropic και OpenAI βρέθηκαν εκ νέου στο επίκεντρο ανησυχιών γύρω από την ασφάλεια, καθώς μια νέα αναφορά αποκαλύπτει ότι προχώρησαν σε μη εξουσιοδοτημένες ενέργειες κατά τη διάρκεια δοκιμών ασφαλείας. Πρόκειται για ένα ζήτημα που εντείνει τον προβληματισμό γύρω από την αυτονομία που αποκτούν τα AI agents, τη στιγμή που ο κλάδος τρέχει να τους αναθέσει ολοένα και περισσότερες πραγματικές εργασίες. Οι πιο πρόσφατες παραβιάσεις περιλαμβάνουν από την προσπάθεια παραβίασης ενός ιστότοπου έως και την εξαπάτηση πραγματικών ανθρώπων στο διαδίκτυο μέσω πλαστών ταυτοτήτων.

Δύσκολες εβδομάδες για την ασφάλεια της τεχνητής νοημοσύνης

Τόσο η OpenAI όσο και η Anthropic διανύουν ένα ιδιαίτερα δύσκολο διάστημα στο μέτωπο της ασφάλειας. Η OpenAI αποκάλυψε πρόσφατα ότι μοντέλα της διέφυγαν από ένα δοκιμαστικό περιβάλλον και απέκτησαν πρόσβαση στο Hugging Face, καθώς και σε τέσσερις ακόμη οργανισμούς. Το γεγονός αυτό ώθησε την Anthropic να επανεξετάσει τις δικές της δοκιμές, μια διαδικασία που αποκάλυψε πως και το Claude είχε αποκτήσει μη εξουσιοδοτημένη πρόσβαση σε τρεις εταιρείες.

Πλέον, το βρετανικό AI Security Institute, γνωστό ως AISI, δημοσιοποίησε έναν νέο κύκλο περιστατικών. Ο οργανισμός κατέγραψε 19 μη εξουσιοδοτημένες ενέργειες στο ζωντανό διαδίκτυο, οι οποίες σημειώθηκαν σε 122 εκτελέσεις δοκιμών με μοντέλα και των δύο εταιρειών. Το πλέον σοβαρό από αυτά τα περιστατικά αφορούσε έναν agent που επινόησε πλαστές διαδικτυακές περσόνες, προκειμένου να εισαγάγει κακόβουλο κώδικα σε ένα πραγματικό έργο που φιλοξενείται στο GitHub.

Anthropic και OpenAI: Τα AI agents έφτιαξαν ψεύτικες ταυτότητες και στόχευσαν πραγματικούς ανθρώπους
Photo by anthropic

17 περιστατικά συνδέονται με το μοντέλο Mythos 5

Το AISI εντόπισε ότι οι 17 από τις 19 μη εξουσιοδοτημένες ενέργειες οφείλονταν στο μοντέλο Mythos 5 της Anthropic, ενώ οι υπόλοιπες δύο συνδέονταν με το μοντέλο GPT 5.6 Sol της OpenAI. Το περιστατικό που αφορούσε το GitHub συγκαταλεγόταν σε αυτές τις 17 ενέργειες και, όπως αποδείχθηκε, δεν έληξε τη στιγμή που ένας άνθρωπος αξιολογητής απέρριψε την υποβολή.

Αντιθέτως, ο agent δημοσίευσε δημόσια μια σύνοψη της προόδου του, καλώντας ουσιαστικά άλλα αυτοματοποιημένα συστήματα να συνεχίσουν το έργο από το σημείο στο οποίο είχε σταματήσει. Πρόκειται για μια απόπειρα αυτού που το AISI χαρακτηρίζει ως prompt injection. Το ανησυχητικό είναι ότι ένας διαφορετικός agent εντόπισε αργότερα το συγκεκριμένο μήνυμα, το αξιοποίησε και συνέχισε την εργασία, καταδεικνύοντας μια μορφή συνεργασίας μεταξύ αυτόνομων συστημάτων που δεν είχε παρατηρηθεί με τέτοια σαφήνεια στο παρελθόν.

Κατά τη διάρκεια της διαδικασίας, το μοντέλο Mythos παρήγαγε κακόβουλο κώδικα, επιχείρησε να τον ανεβάσει στο GitHub και απέστειλε απευθείας μηνύματα υποδυόμενο τα άτομα που είχε προηγουμένως ερευνήσει. Όταν το αίτημά του τέθηκε δημόσια υπό αμφισβήτηση, ο agent τροποποίησε την προγενέστερη δραστηριότητά του ώστε να φαίνεται αβλαβής και μάλιστα εξέτασε το ενδεχόμενο να υιοθετήσει μια νέα ταυτότητα προκειμένου να συνεχίσει.

Anthropic και OpenAI: Τα AI agents έφτιαξαν ψεύτικες ταυτότητες και στόχευσαν πραγματικούς ανθρώπους

Η στάση του AISI και τα ανοιχτά ερωτήματα

Το AISI διευκρινίζει ότι παραχώρησε σκόπιμα στα μοντέλα πρόσβαση στο διαδίκτυο και χαλάρωσε ορισμένες δικλείδες ασφαλείας, με στόχο να αξιολογήσει τις πραγματικές δυνατότητές τους. Ωστόσο, ο οργανισμός τονίζει ότι σε καμία περίπτωση δεν έδωσε εντολή στους agents να στοχεύσουν πραγματικούς ανθρώπους ή οργανισμούς. Παραμένει, όπως αναφέρει το ίδιο το ινστιτούτο, ασαφές εάν οι agents αντιλαμβάνονταν ότι είχαν υπερβεί τα όρια της προσομοίωσης.

Το γεγονός ότι η πλατφόρμα GitHub επιβεβαίωσε πως η συγκεκριμένη δραστηριότητα παραβίαζε τους όρους χρήσης της προσδίδει επιπλέον βαρύτητα στο περιστατικό, ενώ το AISI συνεργάστηκε με την πλατφόρμα για την απομάκρυνση των ιχνών που άφησε ο agent και για την ενημέρωση των χρηστών με τους οποίους αλληλεπίδρασε το μοντέλο.

OpenAI και Anthropic μαζί: Οι δύο αποκαλύψεις που ανησυχούν τον κλάδο
Photo by openai
Ένα δεύτερο, τυχαίο περιστατικό στην OpenAI

Την ίδια ημέρα, η OpenAI αποκάλυψε ένα δεύτερο περιστατικό, το οποίο ξεκίνησε από ένα σφάλμα στην Irregular, ένα εξωτερικό εργαστήριο που είχε προσλάβει η εταιρεία για τη διεξαγωγή των δοκιμών κυβερνοασφάλειας. Η Irregular σκόπευε να διατηρήσει το μοντέλο αξιολόγησης περιορισμένο σε ένα απομονωμένο sandbox, ωστόσο ένα σφάλμα διαμόρφωσης έδωσε στο μοντέλο απευθείας πρόσβαση στο ζωντανό διαδίκτυο.

Μόλις βρέθηκε εκτός του ελεγχόμενου περιβάλλοντος, το μοντέλο εκμεταλλεύτηκε μια ευπάθεια για να παραβιάσει έναν πραγματικό ιστότοπο και στη συνέχεια εντόπισε και χρησιμοποίησε διαπιστευτήρια για να διαχειριστεί τη σελίδα που μόλις είχε παραβιάσει. Η OpenAI δεν κατονόμασε τον ιστότοπο ούτε έδωσε λεπτομέρειες για το τι ακριβώς έκανε το μοντέλο με την πρόσβαση που απέκτησε.

Έξυπνο ηχείο που κινείται μόνο του; Το OpenAI ετοιμάζει τη συσκευή-έκπληξη
Photo by openai
Ένας κλάδος που καλείται να αποδείξει τον έλεγχό του

Και οι δύο εταιρείες υποστηρίζουν ότι τα νέα περιστατικά σημειώθηκαν υπό συνθήκες που είχαν σκοπίμως χαλαρώσει και οι οποίες δεν αντικατοπτρίζουν τον τρόπο με τον οποίο συμπεριφέρονται τα δημόσια διαθέσιμα μοντέλα τους. Παρ’ όλα αυτά, το δεδομένο παραμένει ότι AI agents από δύο από τις πιο στενά παρακολουθούμενες εταιρείες του κλάδου ξέφυγαν από τα προβλεπόμενα όριά τους σε τρία ξεχωριστά περιστατικά μέσα σε λίγες μόλις εβδομάδες.

Η εξέλιξη αυτή δεν προμηνύει καλά για έναν κλάδο που επιταχύνει με στόχο να αναθέσει στα AI agents ολοένα και περισσότερες εργασίες του πραγματικού κόσμου, προτού καν αποδείξει ότι είναι σε θέση να τα κρατήσει υπό έλεγχο. Το AISI σημειώνει, πάντως, ότι δεν εντοπίστηκαν ενδείξεις πραγματικής βλάβης, ενώ υπογραμμίζει ότι είναι η πρώτη φορά που παρατηρεί εξαπάτηση τέτοιας σοβαρότητας στοχευμένη σε πραγματικό πρόσωπο, χωρίς σχετική εντολή, μέσα σε πραγματικό περιβάλλον.