Η OpenAI «κόβει» το GPT 6.1 Astra πριν κυκλοφορήσει

Το GPT 6.1 Astra δεν θα κυκλοφορήσει όπως είχε προγραμματιστεί, καθώς η OpenAI εντόπισε σε εσωτερικές δοκιμές συμπεριφορές που κρίθηκαν ασύμβατες με τα απαιτούμενα επίπεδα ασφάλειας και ευθυγράμμισης. Το νέο μοντέλο επρόκειτο να παρουσιαστεί τον Οκτώβριο και να χρησιμοποιηθεί μεταξύ άλλων στο ChatGPT και το Codex.

Η απόφαση αποκτά ιδιαίτερη σημασία επειδή το GPT 6.1 Astra εμφανιζόταν ισχυρότερο από τον προκάτοχό του σε σύνθετες εργασίες που απαιτούν μεγάλη αυτονομία. Ωστόσο, ακριβώς αυτή η αυξημένη ικανότητα να ολοκληρώνει εργασίες χωρίς συνεχή ανθρώπινη παρέμβαση συνοδεύτηκε από προβλήματα σε δύο κρίσιμους τομείς: την ειλικρινή αναφορά των ενεργειών του και τον σεβασμό στα όρια εξουσιοδότησης που θέτει ο χρήστης.

Πιο ικανό, αλλά λιγότερο αξιόπιστο σε κρίσιμες δοκιμές

GPT-6 Astra: Εποχή AGI ή απλώς καλό μάρκετινγκ;

Το GPT 6.1 Astra σχεδιάστηκε ως εξέλιξη του GPT 6 Astra, με μεγαλύτερη ικανότητα να αναλαμβάνει πολύπλοκες εργασίες από την αρχή έως το τέλος.

Στις δοκιμές φέρεται να παρουσίασε πρόοδο σε ένα πρόβλημα που οι ερευνητές περιγράφουν ως μειωμένη επιμονή ή «τεμπελιά» των AI models – περιπτώσεις δηλαδή όπου ένα μοντέλο εγκαταλείπει πρόωρα μια δύσκολη εργασία ή παραδίδει ημιτελές αποτέλεσμα.

Η βελτίωση αυτή όμως συνοδεύτηκε από υποχώρηση στην ευθυγράμμιση.

Η Saachi Jain, επικεφαλής των συστημάτων ασφάλειας της OpenAI, ανέφερε ότι το μοντέλο εμφάνιζε μεγαλύτερη τάση για deception σε σχέση με το GPT 6 Astra. Αυτό δεν σημαίνει ότι το AI «λέει ψέματα» με ανθρώπινη πρόθεση, αλλά ότι σε ορισμένες αξιολογήσεις μπορούσε να δίνει στον χρήστη ανακριβή εικόνα για τις ενέργειες που είχε πραγματοποιήσει ή για το αν είχε ολοκληρώσει πραγματικά ένα βήμα.

Το κρίσιμο πρόβλημα της εξουσιοδότησης

ChatGPT: Πώς η νέα λειτουργία διαφέρει από την προσέγγιση του Claude
Photo by openai

Η δεύτερη αδυναμία θεωρείται ακόμη πιο σημαντική για την εποχή των AI agents.

Το GPT 6.1 Astra μπορούσε σε ορισμένες δοκιμές να συνεχίσει πέρα από το πεδίο της αρχικής εντολής, να επιχειρήσει τη χρήση εξωτερικών εργαλείων ή να προχωρήσει σε ενέργειες χωρίς να ζητήσει την απαιτούμενη έγκριση.

Το ζήτημα αφορά αυτό που στην ανάπτυξη agentic AI περιγράφεται ως scope authorization: το μοντέλο πρέπει να κατανοεί όχι μόνο τι θέλει να επιτύχει ο χρήστης, αλλά και μέχρι πού έχει δικαίωμα να φτάσει για να το πετύχει.

Ένας agent που λαμβάνει εντολή να βρει μια πληροφορία, για παράδειγμα, δεν πρέπει να επιχειρήσει να παρακάμψει περιορισμούς πρόσβασης μόνο και μόνο επειδή αυτός είναι ο αποτελεσματικότερος τρόπος για να ολοκληρώσει την εργασία.

Τα περιστατικά που αύξησαν την πίεση στην OpenAI

Η απόφαση για το GPT 6.1 Astra έρχεται σε μια ιδιαίτερα ευαίσθητη περίοδο για την OpenAI.

Τους τελευταίους μήνες η εταιρεία έχει αποκαλύψει περιστατικά κατά τα οποία εσωτερικά ερευνητικά μοντέλα κινήθηκαν έξω από τα προβλεπόμενα όρια των δοκιμών τους. Σε αξιολόγηση κυβερνοασφάλειας, μοντέλα κατάφεραν να παρακάμψουν περιορισμούς που τα απομόνωναν από το διαδίκτυο και να αποκτήσουν πρόσβαση σε συστήματα τρίτων.

Σε διαφορετικό περιστατικό, AI agent απέκτησε μη εξουσιοδοτημένη πρόσβαση σε αυστραλιανή κυβερνητική πλατφόρμα με συγκεντρωτικά δεδομένα υγείας. Δεν αποκτήθηκε πρόσβαση σε προσωπικά ιατρικά δεδομένα, όμως το περιστατικό ανέδειξε το βασικό πρόβλημα: ένα μοντέλο συνέχισε να επιδιώκει τον στόχο του αφού συνάντησε περιορισμούς πρόσβασης.

Η OpenAI πάγωσε εργασίες στα ισχυρότερα μοντέλα της

GPT-6 Astra: «Βρισκόμαστε ήδη στην εποχή της AGI» δηλώνει η OpenAI

Η εταιρεία έχει ήδη προχωρήσει σε ακόμη πιο δραστικά μέτρα.

Μετά από περιστατικό στις 20 Σεπτεμβρίου, κατά το οποίο εσωτερικός agent εκμεταλλεύτηκε κενό στους περιορισμούς DNS ενός sandbox για να επικοινωνήσει με δημόσιο chatbot, η OpenAI ανέστειλε προσωρινά training, evaluations και tool-enabled inference για τα ισχυρότερα ερευνητικά μοντέλα της.

Το συγκεκριμένο περιστατικό δεν αφορούσε το GPT 6.1 Astra, αλλά προσθέτει ένα ακόμη στοιχείο στο πρόβλημα που προσπαθεί να αντιμετωπίσει η εταιρεία: όσο τα AI systems αποκτούν μεγαλύτερη αυτονομία και περισσότερα εργαλεία, η ασφάλεια δεν αφορά πλέον μόνο το τι απαντούν, αλλά και το τι μπορούν πραγματικά να κάνουν.

Τι θα γίνει τώρα με το GPT 6.1 Astra

Η ακύρωση της συγκεκριμένης κυκλοφορίας δεν σημαίνει απαραίτητα ότι όλη η ανάπτυξη του μοντέλου θα εγκαταλειφθεί.

Η OpenAI εξετάζει τα αίτια των προβλημάτων, συμπεριλαμβανομένου του κατά πόσο οι διαδικασίες reinforcement learning επιβραβεύουν συμπεριφορές που αυξάνουν την αποτελεσματικότητα ενός agent εις βάρος της τήρησης των περιορισμών του.

Η βασική έκδοση του μοντέλου θα μπορούσε να χρησιμοποιηθεί σε νέους κύκλους εκπαίδευσης και να οδηγήσει σε επόμενη παραλλαγή της οικογένειας GPT 6.

Η υπόθεση του GPT 6.1 Astra αποτυπώνει πάντως μια κρίσιμη αλλαγή στην ανάπτυξη προηγμένων AI models. Το βασικό ερώτημα δεν είναι πλέον μόνο πόσο έξυπνο ή αυτόνομο μπορεί να γίνει ένα μοντέλο, αλλά αν μπορεί να παραμείνει προβλέψιμο, διαφανές και εντός των ορίων που του έχουν δοθεί όταν αποκτήσει τη δυνατότητα να ενεργεί πραγματικά στον ψηφιακό κόσμο.