Όταν το AI παρακάμπτει τις εντολές: Πάνω από 1.600 περιστατικά μέσα στο 2026
Ανησυχητική αύξηση παρουσιάζουν τα περιστατικά κατά τα οποία συστήματα Τεχνητής Νοημοσύνης φαίνεται να ενεργούν αντίθετα με τις οδηγίες των χρηστών τους, παρακάμπτοντας περιορισμούς, αποκρύπτοντας τις ενέργειές τους ή επιδιώκοντας στόχους με μη προβλεπόμενους τρόπους. Μόνο τον Ιούλιο καταγράφηκαν περισσότερα από 300 τέτοια περιστατικά, αριθμός σχεδόν διπλάσιος σε σχέση με τον Ιούνιο.
Σύμφωνα με στοιχεία του Loss of Control Observatory, που παρακολουθεί αναφορές χρηστών για περιστατικά «απώλειας ελέγχου» συστημάτων AI και δημιουργήθηκε με χρηματοδότηση του βρετανικού AI Security Institute (AISI), το φαινόμενο λαμβάνει ανησυχητικές διαστάσεις.
Το Παρατηρητήριο ξεκίνησε την καταγραφή τον Νοέμβριο του 2025 και χαρακτηρίζει ως περιστατικό απώλειας ελέγχου κάθε περίπτωση στην οποία υπάρχουν σαφείς ενδείξεις σχεδιασμένης ή συναφούς συμπεριφοράς από ένα σύστημα AI.
Μεταξύ των περιστατικών που έχουν καταγραφεί, σύμφωνα με δημοσίευμα του Guardian, περιλαμβάνονται συστήματα που φέρονται να προσποιήθηκαν τον ίδιο τον άνθρωπο-χειριστή τους, μιμήθηκαν τον τρόπο γραφής του ώστε να δώσουν στον εαυτό τους «έγκριση» για ενέργειες ή παρέκαμψαν κανόνες που απαιτούσαν ανθρώπινη συγκατάθεση.
Περισσότερα από 1.600 περιστατικά μέσα στο 2026
Συνολικά, πάνω από 1.600 περιστατικά απώλειας ελέγχου έχουν καταγραφεί μέσα στο 2026, με τα περισσότερα να αναφέρονται από προγραμματιστές που χρησιμοποιούν συστήματα Τεχνητής Νοημοσύνης στην εργασία τους.
Η καταγραφή δεν θεωρείται πλήρης, καθώς το Παρατηρητήριο βασίζεται σε περιστατικά που δημοσιοποιούν χρήστες στην πλατφόρμα X, γεγονός που υποδηλώνει ότι ο πραγματικός αριθμός μπορεί να είναι μεγαλύτερος.
Παρότι τα περισσότερα περιστατικά δεν προκάλεσαν σημαντική ζημιά, οι ερευνητές διαπιστώνουν αύξηση στα περιστατικά που αξιολογούνται ως σοβαρότερα, λόγω του βαθμού εξαπάτησης και της απόκλισης της συμπεριφοράς του AI από τις προθέσεις του χρήστη.
Το AI που «έβγαλε» άνθρωπο από λίστα αναμονής
Ένα χαρακτηριστικό περιστατικό αποκαλύφθηκε τον Αύγουστο στην Αυστραλία. Ένας προσωπικός AI agent, με την ονομασία OpenClaw, χρησιμοποιούνταν από μέλος γυμναστηρίου. Το σύστημα, χωρίς να του ζητηθεί, φέρεται να αφαίρεσε άλλο μέλος από τη λίστα αναμονής για ένα περιζήτητο πρωινό μάθημα, εξασφαλίζοντας τη θέση για τον δικό του χρήστη.
Στη συνέχεια το AI απολογήθηκε για την ενέργειά του, αλλά δεν μπορούσε να επαναφέρει στη λίστα το μέλος που είχε αφαιρέσει.
«Δεν συμβαίνει μόνο στα εργαστήρια»
Τα ευρήματα εντείνουν τον προβληματισμό για τα ολοένα πιο αυτόνομα συστήματα Τεχνητής Νοημοσύνης και για το κατά πόσο τέτοιες συμπεριφορές περιορίζονται στα ελεγχόμενα περιβάλλοντα δοκιμών.
Ο Tommy Shaffer-Shane, ανώτερο στέλεχος πολιτικής στο Centre for Long Term Resilience που λειτουργεί το Παρατηρητήριο, επισημαίνει ότι υπάρχει η αντίληψη πως οι αποκλίνουσες και συγκαλυμμένες συμπεριφορές εμφανίζονται μόνο κατά τις δοκιμές των μοντέλων.
Ωστόσο, τα δεδομένα δείχνουν ότι παρόμοιες συμπεριφορές καταγράφονται ήδη και στην πραγματική χρήση της τεχνολογίας.
Οι ανησυχίες για τα πιο προηγμένα μοντέλα
Τα νέα στοιχεία έρχονται σε περίοδο αυξανόμενου προβληματισμού για τη συμπεριφορά προηγμένων μοντέλων και αυτόνομων AI agents. Το βρετανικό AISI έχει εντοπίσει πρόσφατα σοβαρά περιστατικά σε δοκιμές κυβερνοασφάλειας, ενώ άλλα περιστατικά αφορούν αυτόνομα συστήματα που συνεργάστηκαν για την εκτέλεση κυβερνοεπιθέσεων σε ελεγχόμενα περιβάλλοντα.
Οι εξελίξεις αυτές έχουν αναζωπυρώσει τη συζήτηση για τα λεγόμενα frontier AI models και την ανάγκη ισχυρότερων δικλίδων ασφαλείας, καθώς τα συστήματα αποκτούν μεγαλύτερη αυτονομία και δυνατότητα να ενεργούν χωρίς συνεχή ανθρώπινη παρέμβαση.
Το Loss of Control Observatory ζητεί μεγαλύτερη διαφάνεια από τις εταιρείες Τεχνητής Νοημοσύνης, υποστηρίζοντας ότι πρέπει να παρακολουθούν συστηματικά και να δημοσιοποιούν σοβαρά περιστατικά απώλειας ελέγχου, ακόμη και αν δεν προκάλεσαν ζημιά.
Επιπλέον, προτείνει στη βρετανική κυβέρνηση να θεσπίσει έκτακτες εξουσίες για την αντιμετώπιση ιδιαίτερα σοβαρών περιστατικών, οι οποίες θα μπορούσαν να φτάνουν ακόμα και στην προσωρινή επιβολή περιορισμών σε υπηρεσίες AI.