Το Claude εντοπίστηκε σε επικίνδυνες βιολογικές έρευνες αποκάλυψε η Anthropic

Η Anthropic αποκάλυψε ότι εντόπισε και διέκοψε πολλαπλές περιπτώσεις στις οποίες επιστήμονες χρησιμοποίησαν μοντέλα Claude σε έρευνες που, σύμφωνα με την αξιολόγησή της, θα μπορούσαν δυνητικά να υποστηρίξουν την ανάπτυξη βιολογικών όπλων.

Η Anthropic περιγράφει τις συγκεκριμένες υποθέσεις σε νέα εκτενή έκθεση για την κακόβουλη ή επικίνδυνη χρήση των AI μοντέλων της, παρουσιάζοντας πέντε διαφορετικά case studies που σχετίζονται με biological misuse. Η εταιρεία τονίζει, ωστόσο, ότι πρόκειται για έναν ιδιαίτερα δύσκολο τομέα αξιολόγησης, καθώς η ίδια επιστημονική γνώση μπορεί να χρησιμοποιηθεί τόσο για νόμιμη βιοϊατρική έρευνα όσο και για επικίνδυνους σκοπούς.

Ακριβώς αυτή η dual-use φύση της βιολογικής έρευνας βρίσκεται στο επίκεντρο του προβλήματος. Ένα AI model μπορεί να βοηθήσει έναν επιστήμονα να αναλύσει έναν ιό, να σχεδιάσει ένα πείραμα ή να οργανώσει μια ερευνητική πρόταση χωρίς να είναι πάντα προφανές αν ο τελικός στόχος είναι θεραπευτικός, αμυντικός ή δυνητικά επιθετικός.

Πέντε υποθέσεις biological misuse

Η Anthropic αναφέρει ότι εντόπισε πέντε περιπτώσεις στις οποίες η χρήση των μοντέλων της δημιούργησε σοβαρές ανησυχίες σχετικά με πιθανή βιολογική κακόβουλη χρήση.

Σε μία από αυτές, το biological safety classifier της εταιρείας εντόπισε αίτημα που αφορούσε τη σύνταξη ερευνητικής πρότασης για gain-of-function research πάνω στον ιό chikungunya.

Claude: Ομαδική αγωγή για παραπλανητική διαφήμιση των ορίων χρήσης

Το συγκεκριμένο είδος έρευνας μπορεί να εξετάζει πώς γενετικές μεταβολές επηρεάζουν χαρακτηριστικά ενός οργανισμού ή παθογόνου. Στην υπόθεση που περιγράφεται, η προτεινόμενη κατεύθυνση αφορούσε χαρακτηριστικά όπως η αυξημένη μεταδοτικότητα και η δυνατότητα αποφυγής της ανοσολογικής απόκρισης.

Για την Anthropic, ο συνδυασμός αυτών των παραμέτρων ήταν αρκετός ώστε η δραστηριότητα να θεωρηθεί υψηλού κινδύνου και να ενεργοποιηθούν οι μηχανισμοί ασφαλείας.

Η εταιρεία αναφέρει επίσης ότι η σύνδεση της προτεινόμενης έρευνας με στρατιωτικό ερευνητικό οργανισμό αύξησε περαιτέρω τις ανησυχίες της.

Άλλες περιπτώσεις σχετίζονταν με gain-of-function έρευνα γύρω από στελέχη γρίπης των πτηνών, καθώς και με τη χρήση του Claude για την ανάπτυξη ενός atlas τοξινών και ενός generative pipeline που επιχειρούσε να βελτιστοποιήσει συγκεκριμένα χαρακτηριστικά τους.

Η λεπτή γραμμή μεταξύ έρευνας και απειλής

Το μεγαλύτερο πρόβλημα που αναδεικνύει η Anthropic δεν είναι μόνο ότι τα σύγχρονα AI models μπορούν να παρέχουν προηγμένη επιστημονική βοήθεια.

Η νέα λειτουργία dream της Anthropic επιτρέπει στο Claude και στους AI agents

Είναι ότι το ίδιο ακριβώς ερώτημα μπορεί να είναι απολύτως νόμιμο σε ένα εργαστήριο και ιδιαίτερα επικίνδυνο σε διαφορετικό context.

Έρευνα για έναν παθογόνο οργανισμό μπορεί να αποτελεί απαραίτητο βήμα για την ανάπτυξη εμβολίου ή θεραπείας. Παρόμοια γνώση, όμως, μπορεί θεωρητικά να χρησιμοποιηθεί και για την ενίσχυση χαρακτηριστικών που αυξάνουν τον κίνδυνο ενός βιολογικού παράγοντα.

Αυτό κάνει τον εντοπισμό του biological misuse πολύ πιο σύνθετο από άλλες κατηγορίες κακόβουλης χρήσης AI.

Ένα αίτημα για malware, για παράδειγμα, μπορεί σε αρκετές περιπτώσεις να περιέχει πιο εμφανείς ενδείξεις κακόβουλης πρόθεσης. Στη βιολογία, η τεχνική γλώσσα ενός ερευνητή που εργάζεται πάνω σε ένα εμβόλιο μπορεί να μοιάζει σημαντικά με εκείνη κάποιου που εξετάζει τις ίδιες βιολογικές διαδικασίες για διαφορετικό σκοπό.

Η Anthropic αναφέρει ότι σε αυτές τις περιπτώσεις προτίμησε να κινηθεί περισσότερο συντηρητικά, ακριβώς επειδή οι πιθανές συνέπειες ενός λάθους είναι δυσανάλογα μεγάλες.

Γιατί δεν κατονομάζονται οι επιστήμονες

Η Anthropic βάζει «υπογραφή» σε κάθε κείμενο που γράφει το Claude

Η Anthropic δεν δημοσιοποίησε την ταυτότητα των επιστημόνων, των εργαστηρίων ή των οργανισμών που συνδέονται με τις περιπτώσεις.

Η επιλογή αυτή έχει ιδιαίτερη σημασία, καθώς η εταιρεία ξεκαθαρίζει ότι τα στοιχεία που εντόπισε δεν αποδεικνύουν από μόνα τους πρόθεση κατασκευής βιολογικού όπλου.

Οι εμπλεκόμενοι περιγράφονται ως εργαζόμενοι επιστήμονες και όχι ως άτομα για τα οποία έχει αποδειχθεί εγκληματική δραστηριότητα.

Αυτό αλλάζει και τον τρόπο με τον οποίο πρέπει να διαβάζεται η υπόθεση. Η Anthropic δεν υποστηρίζει ότι αποκάλυψε πέντε προγράμματα βιολογικών όπλων. Υποστηρίζει ότι εντόπισε χρήσεις του Claude που ξεπέρασαν τα όρια ασφαλείας της και μπορούσαν, υπό συγκεκριμένες συνθήκες, να υποστηρίξουν επικίνδυνη βιολογική έρευνα.

Η διαφορά είναι κρίσιμη τόσο επιστημονικά όσο και δημοσιογραφικά.

Από τα βιολογικά όπλα μέχρι surveillance και cyberattacks

Η biological misuse είναι μόνο μία από τις κατηγορίες επικίνδυνης χρήσης που εξετάζει η Anthropic.

Η εταιρεία έχει εντοπίσει περιπτώσεις στις οποίες τα AI μοντέλα της επιχειρήθηκε να χρησιμοποιηθούν για surveillance, ανάπτυξη software exploits, προπαγάνδα, απάτες και εργασίες που σχετίζονται με συμβατικά οπλικά συστήματα.

Σε κάθε περίπτωση που θεωρήθηκε ότι παραβιάζονται οι κανόνες χρήσης, η Anthropic προχώρησε σε αποκλεισμό των σχετικών λογαριασμών.

Τα δεδομένα από αυτές τις έρευνες χρησιμοποιούνται παράλληλα για την εκπαίδευση και βελτίωση των safety systems της εταιρείας.

Πρόκειται ουσιαστικά για έναν συνεχή κύκλο: νέες δυνατότητες δημιουργούν νέες μορφές χρήσης, αυτές αποκαλύπτουν αδυναμίες στους υπάρχοντες μηχανισμούς προστασίας και οι εταιρείες επιχειρούν στη συνέχεια να προσαρμόσουν τα classifiers και τα safeguards τους.

Τι σημαίνει για τα ισχυρότερα AI models

Η υπόθεση της Anthropic αποκαλύπτει ένα από τα σημαντικότερα προβλήματα που θα συνοδεύσουν τη νέα γενιά frontier AI.

Όσο τα μοντέλα γίνονται καλύτερα στη βιολογία, στη χημεία, στον προγραμματισμό και στην επιστημονική έρευνα, τόσο αυξάνεται και η χρησιμότητά τους για ανθρώπους που μπορούν να αξιοποιήσουν αυτές τις δυνατότητες με επικίνδυνο τρόπο.

Δεν σημαίνει ότι ένα chatbot μπορεί αυτόνομα να δημιουργήσει ένα βιολογικό όπλο. Σημαίνει όμως ότι η AI μπορεί να μειώσει τον χρόνο, την τεχνική δυσκολία ή το γνωστικό κόστος ορισμένων σταδίων μιας σύνθετης ερευνητικής διαδικασίας.

Αυτό είναι το πραγματικό ζήτημα.

Τα σύγχρονα AI systems δεν χρειάζεται να αντικαταστήσουν έναν ειδικό για να δημιουργήσουν νέο κίνδυνο. Αρκεί να κάνουν έναν ήδη εκπαιδευμένο επιστήμονα, μηχανικό ή hacker περισσότερο αποτελεσματικό.

Η Anthropic βρίσκεται έτσι αντιμέτωπη με το ίδιο παράδοξο που αφορά συνολικά τη βιομηχανία της τεχνητής νοημοσύνης: όσο περισσότερο χρήσιμα γίνονται τα μοντέλα για πραγματική επιστημονική εργασία, τόσο δυσκολότερο γίνεται να περιοριστεί η πρόσβαση στις επικίνδυνες εφαρμογές της ίδιας γνώσης.

Το πραγματικό τεστ για την ασφάλεια της AI

Η συγκεκριμένη υπόθεση αποτελεί ίσως πιο ουσιαστικό τεστ για την ασφάλεια της AI από τα συνηθισμένα jailbreaks που επιχειρούν να κάνουν ένα chatbot να παράγει απαγορευμένες απαντήσεις.

Εδώ μιλάμε για πραγματικούς επιστήμονες, πραγματικό επιστημονικό context και αιτήματα που μπορούν να βρίσκονται πολύ κοντά στα όρια μεταξύ αποδεκτής και επικίνδυνης έρευνας.

Για εταιρείες όπως η Anthropic, αυτό σημαίνει ότι τα απλά keyword filters δεν αρκούν.

Η αποτελεσματική προστασία απαιτεί κατανόηση του context, αξιολόγηση της συνολικής αλληλουχίας μιας έρευνας και μηχανισμούς που μπορούν να αντιληφθούν πότε μια σειρά φαινομενικά νόμιμων ενεργειών αρχίζει να δημιουργεί επικίνδυνο αποτέλεσμα.

Και αυτό είναι πιθανό να αποτελέσει ένα από τα μεγαλύτερα προβλήματα της επόμενης φάσης της AI: όχι το αν τα μοντέλα μπορούν να γνωρίζουν περισσότερα, αλλά το πώς οι εταιρείες θα αποφασίζουν ποιος μπορεί να αξιοποιεί αυτή τη γνώση, σε ποιο context και μέχρι ποιο σημείο.