Η AI superintelligence μπορεί να αποτελέσει υπαρξιακό κίνδυνο για την ανθρωπότητα, προειδοποιούν ερευνητές που εργάζονται ή έχουν εργαστεί σε μερικά από τα μεγαλύτερα εργαστήρια τεχνητής νοημοσύνης στον κόσμο. Σε μια νέα σειρά βιντεοσκοπημένων συνεντεύξεων, άνθρωποι με εμπειρία στις OpenAI, Google DeepMind και Anthropic μιλούν δημόσια για τον φόβο ότι η ανάπτυξη συστημάτων πολύ πιο ικανών από τον άνθρωπο μπορεί να προχωρήσει ταχύτερα από την ικανότητά μας να τα ελέγξουμε.
Οι δηλώσεις είναι ιδιαίτερα έντονες. Ο Geoffrey Irving, πρώην ερευνητής των OpenAI και Google DeepMind, εκτιμά προσωπικά ότι η πιθανότητα η AI να οδηγήσει σε ανθρώπινο αφανισμό βρίσκεται περίπου στο 50%. Ο Neel Nanda, ερευνητής της Google DeepMind, τοποθετεί τη δική του εκτίμηση τουλάχιστον στο 10%, ενώ ο πρώην ερευνητής της OpenAI Daniel Kokotajlo χαρακτηρίζει μια πραγματική superintelligence δυνητικά «θεϊκής κλίμακας» ως προς τις δυνατότητές της.
Οι αριθμοί αυτοί, ωστόσο, δεν αποτελούν μετρημένες επιστημονικές πιθανότητες. Εκφράζουν προσωπικές εκτιμήσεις κινδύνου ανθρώπων που εργάζονται πάνω στην AI safety.
Οι προειδοποιήσεις έρχονται μέσα από την ίδια τη βιομηχανία
Οι συνεντεύξεις συγκεντρώθηκαν από την Palisade Research, μη κερδοσκοπικό οργανισμό που μελετά τις δυνατότητες, τη συμπεριφορά και τους κινδύνους προηγμένων AI agents.
Το ενδιαφέρον βρίσκεται στο γεγονός ότι αρκετοί από όσους εμφανίζονται στα βίντεο δεν είναι εξωτερικοί επικριτές της τεχνολογίας.
Έχουν εργαστεί μέσα στα εργαστήρια που αναπτύσσουν τα ισχυρότερα μοντέλα.
Ο Irving υποστηρίζει ότι ο κίνδυνος αυξάνεται γρήγορα και ότι όσοι βρίσκονται μέσα στον χώρο έχουν ευθύνη να μιλούν πιο άμεσα για αυτόν.
Ακόμη πιο έντονη είναι η θέση του Kokotajlo. Κατά την εκτίμησή του, αν δημιουργηθεί πραγματική AI superintelligence χωρίς να έχει λυθεί το πρόβλημα του alignment, κανείς δεν μπορεί να θεωρεί δεδομένο ότι ο άνθρωπος θα εξακολουθεί να έχει τον έλεγχο.
Τι φοβούνται πραγματικά οι ερευνητές
Το βασικό σενάριο δεν είναι ένα AI που ξαφνικά «αποφασίζει να γίνει κακό».
Η ανησυχία αφορά συστήματα τα οποία γίνονται εξαιρετικά ικανά, αυτόνομα και στρατηγικά, αλλά επιδιώκουν έναν στόχο με τρόπο που δεν συμβαδίζει πλήρως με την ανθρώπινη πρόθεση.
Το πρόβλημα γίνεται σοβαρότερο αν ένα τέτοιο σύστημα αποκτήσει τη δυνατότητα να πραγματοποιεί μακροχρόνιο σχεδιασμό, να χρησιμοποιεί εργαλεία, να αντιγράφει τον εαυτό του ή ακόμη και να βοηθά στην ανάπτυξη της επόμενης γενιάς AI.
Εδώ εμφανίζεται η έννοια του recursive self-improvement.
Αν η AI αρχίσει να αυτοματοποιεί την ίδια την έρευνα τεχνητής νοημοσύνης, κάθε νέα γενιά μοντέλων θα μπορούσε θεωρητικά να συμβάλλει στην ανάπτυξη της επόμενης. Οι ερευνητές που ανησυχούν για την AI superintelligence θεωρούν ότι σε ένα τέτοιο σενάριο η πρόοδος μπορεί να γίνει πολύ δυσκολότερο να ελεγχθεί.
Τα σημερινά AI δεν είναι superintelligence
Υπάρχει όμως μια κρίσιμη διάκριση. Οι προειδοποιήσεις αφορούν κυρίως μελλοντικά συστήματα και όχι το σημερινό ChatGPT, το Gemini ή το Claude.
Η ίδια η Palisade Research έχει αναφέρει ότι η σημερινή γενιά μοντέλων δεν διαθέτει ακόμη τις δυνατότητες μακροχρόνιου σχεδιασμού και αυτονομίας που θα της επέτρεπαν να αποτελέσει ουσιαστική απειλή απώλειας ανθρώπινου ελέγχου.
Τα υπάρχοντα μοντέλα μπορούν να εμφανίσουν ανησυχητικές συμπεριφορές σε ελεγχόμενα πειράματα, όπως να παρακάμπτουν οδηγίες ή να αντιστέκονται σε διαδικασίες τερματισμού. Αυτό όμως απέχει σημαντικά από την ύπαρξη ενός αυτόνομου συστήματος που μπορεί να λειτουργεί αποτελεσματικά για μεγάλα χρονικά διαστήματα και να επιδιώκει σύνθετους στρατηγικούς στόχους.
Η συζήτηση επομένως αφορά κυρίως το πού μπορεί να οδηγήσει η σημερινή πορεία ανάπτυξης.
Γιατί συνεχίζουν να δουλεύουν πάνω στην AI;
Ένα από τα προφανή ερωτήματα που θέτει το ίδιο το project είναι γιατί ένας ερευνητής συνεχίζει να εργάζεται σε μια τεχνολογία την οποία θεωρεί δυνητικά τόσο επικίνδυνη.
Ο Neel Nanda υποστηρίζει ότι παραμένει στον χώρο επειδή θεωρεί ότι η δική του δουλειά μειώνει τον κίνδυνο. Κατά τη θέση του, η αποχώρηση των ερευνητών που επικεντρώνονται στην ασφάλεια δεν θα σταματούσε τις εταιρείες από το να αναπτύσσουν ισχυρότερα συστήματα.
Άλλοι ερευνητές εκφράζουν διαφορετικές προσεγγίσεις, από ισχυρότερους μηχανισμούς ελέγχου έως επιβράδυνση της ανάπτυξης των πιο προηγμένων μοντέλων.
Δεν υπάρχει, πάντως, μία κοινά αποδεκτή λύση.
Και αυτό αποτελεί ίσως ένα από τα σημαντικότερα στοιχεία της συζήτησης για την AI superintelligence: ακόμη και μεταξύ όσων συμφωνούν ότι ο κίνδυνος πρέπει να ληφθεί σοβαρά, δεν υπάρχει συναίνεση για το πόσο μεγάλος είναι ούτε για το πώς πρέπει να αντιμετωπιστεί.
Από το “AI doom” σε πραγματική συζήτηση για τον έλεγχο
Οι εκτιμήσεις περί ανθρώπινου αφανισμού παραμένουν εξαιρετικά αβέβαιες και αμφισβητούνται έντονα από άλλους ερευνητές, οι οποίοι θεωρούν ότι τέτοια ποσοστά δεν μπορούν να υπολογιστούν με επιστημονικά αξιόπιστο τρόπο.
Αυτό όμως δεν σημαίνει ότι το ευρύτερο ερώτημα εξαφανίζεται.
Καθώς τα AI models αποκτούν μεγαλύτερη αυτονομία, πρόσβαση σε υπολογιστές, δυνατότητα χρήσης εργαλείων και ολοένα μεγαλύτερο ρόλο στην ίδια την ανάπτυξη λογισμικού και AI, το πρόβλημα μετατοπίζεται από το «πόσο έξυπνο είναι το μοντέλο» στο «τι επιτρέπεται να κάνει και ποιος μπορεί πραγματικά να το σταματήσει».
Η AI superintelligence δεν υπάρχει σήμερα με τη μορφή που περιγράφουν οι συγκεκριμένοι ερευνητές.
Το ερώτημα που θέτουν είναι διαφορετικό: αν κάποτε υπάρξει, θα έχουμε λύσει το πρόβλημα του ελέγχου πριν τη δημιουργήσουμε ή θα προσπαθήσουμε να το λύσουμε αφού θα είναι ήδη πολύ αργά;

