Η OpenAI κατατάσσει τα GPT-6 Sol και GPT-6 Luna της έκδοσης Οκτωβρίου στην υψηλή βαθμίδα ικανότητας για την κυβερνοασφάλεια και τη βιολογία/χημεία. Η αξιολόγηση συνοδεύεται από βελτιώσεις στην ανθεκτικότητα σε jailbreaks, αλλά και από περιορισμένες υποτροπές σε ορισμένες κατηγορίες ασφαλείας.
Η «υψηλή» βαθμίδα αφορά ικανότητα, όχι πρόθεση
Η έκθεση ασφάλειας της OpenAI, που δημοσιεύτηκε στις 7 Οκτωβρίου 2026, αντιμετωπίζει και τα δύο μοντέλα ως High Capability στους τομείς της κυβερνοασφάλειας και της βιολογίας/χημείας. Η διατύπωση περιγράφει το ανώτατο επίπεδο ικανότητας που μπορούν να επιδείξουν σε αξιολογήσεις και δεν αποτελεί από μόνη της ένδειξη ότι τα μοντέλα θα χρησιμοποιήσουν αυτές τις δυνατότητες κακόβουλα.
Η ίδια αξιολόγηση διευκρινίζει ότι κανένα από τα δύο μοντέλα δεν φτάνει το όριο High στην αυτοβελτίωση της τεχνητής νοημοσύνης. Με βάση την ταξινόμηση, η OpenAI ενεργοποίησε για τα GPT-6 Sol και GPT-6 Luna το ίδιο σύνολο μέτρων προστασίας που είχε περιγράψει για τα GPT-5.6 Sol και GPT-5.6 Luna.
Καλύτερη αντοχή στα jailbreaks, με αστερίσκους
Σε σύγκριση με τους αντίστοιχους GPT-5.6, τα νέα μοντέλα εμφανίζουν ισχυρότερη αντίσταση σε jailbreaks, συμπεριλαμβανομένων επιθέσεων που προσαρμόζονται σε πολλές διαδοχικές συνομιλίες. Η OpenAI αναφέρει επίσης μειώσεις σε απαντήσεις που παρακάμπτουν τα όρια ασφαλείας ή εμφανίζουν ανεντιμότητα και εξαπάτηση.
Η εικόνα όμως δεν είναι ομοιόμορφη. Οι αξιολογήσεις κατέγραψαν στατιστικά σημαντικές υποτροπές σε ορισμένες κατηγορίες, όπως η αυτοκαταστροφή για το Sol και η αυτοκαταστροφή, το gore και το σεξουαλικό περιεχόμενο για το Luna. Η εταιρεία υποστηρίζει ότι, μετά από χειροκίνητο έλεγχο και red-team δοκιμές, οι παραβιάσεις που εξετάστηκαν ήταν συνήθως οριακές και χαμηλής σοβαρότητας.
Τι δείχνουν οι μετρήσεις στην πράξη
Στις δοκιμές πολλαπλών γύρων, τα δύο μοντέλα είχαν ελαφρώς χαμηλότερες σημειακές εκτιμήσεις από τις εκδόσεις Σεπτεμβρίου, με ευρέως επικαλυπτόμενα διαστήματα εμπιστοσύνης. Παράλληλα, ξεπέρασαν το GPT-5.6 Sol σε κάθε προϋπολογισμό επιθέσεων που εξετάστηκε. Στις δοκιμές prompt injection, πέτυχαν ανθεκτικότητα 99,99% για το Sol και 99,79% για το Luna στις αξιολογήσεις ιεραρχίας εντολών.
Οι αριθμοί αυτοί δεν είναι ποσοστό κινδύνου στην καθημερινή χρήση. Η ίδια η OpenAI σημειώνει ότι τα σύνολα δοκιμών έχουν σχεδιαστεί για δύσκολες περιπτώσεις, χωρίς να αποτυπώνουν τη συχνότητα τέτοιων συμπεριφορών στην παραγωγή. Επιπλέον, οι αξιολογήσεις ικανότητας γίνονται στη μέγιστη προσπάθεια συλλογισμού, ενώ οι αξιολογήσεις ασφάλειας στο χαμηλότερο επίπεδο ανάπτυξης, ώστε να προσεγγίζουν διαφορετικές ερωτήσεις.
Γιατί η ταξινόμηση έχει σημασία
Η ένταξη στην υψηλή βαθμίδα μεταφέρει το βάρος από την απλή επίδειξη δυνατοτήτων στην απόδειξη ότι οι δικλίδες λειτουργούν όταν τα μοντέλα χρησιμοποιούνται σε πραγματικά συστήματα. Σε περιβάλλοντα κυβερνοασφάλειας και βιολογικής έρευνας, ακόμη και μια σπάνια αποτυχία μπορεί να έχει δυσανάλογο κόστος, γι’ αυτό οι μετρήσεις πρέπει να επαναλαμβάνονται καθώς αλλάζουν τα μοντέλα, τα εργαλεία και οι επιθέσεις.
Η έκθεση είναι, επομένως, περισσότερο ένας χάρτης διαχείρισης ρίσκου παρά μια τελική ετυμηγορία. Δείχνει πού αυξήθηκε η ικανότητα και ποια προστασία εφαρμόστηκε, αφήνοντας ανοιχτό το κρίσιμο ερώτημα της συμπεριφοράς σε πραγματικές, σύνθετες ροές εργασίας.
Πηγή: OpenAI Deployment Safety Hub — GPT-6 Sol και GPT-6 Luna, ενημέρωση Οκτωβρίου 2026