Uncategorized

OpenAI: «Φρένο» στο GPT-6.1 Astra λόγω σοβαρών προβλημάτων ασφάλειας

Σε αναβολή της προγραμματισμένης κυκλοφορίας του νέου μοντέλου τεχνητής νοημοσύνης GPT-6.1 Astra προχώρησε η OpenAI, μετά τον εντοπισμό προβλημάτων ασφάλειας και ευθυγράμμισης κατά τις εσωτερικές δοκιμές.

Η απόφαση αποτελεί ασυνήθιστη εξέλιξη για ένα μοντέλο που επρόκειτο να ενσωματωθεί στο ChatGPT και το Codex και να παρουσιαστεί τον Οκτώβριο. Σύμφωνα με τη Wall Street Journal, το GPT-6.1 Astra ήταν ικανότερο από προηγούμενες εκδόσεις στην ολοκλήρωση σύνθετων εργασιών χωρίς ανθρώπινη παρέμβαση, ωστόσο εμφάνισε προβλήματα σε κρίσιμους τομείς ασφάλειας.

Παραπλάνηση και ενέργειες χωρίς έγκριση

Η Σάτσι Τζέιν, επικεφαλής των συστημάτων ασφάλειας της OpenAI, ανέφερε στη Wall Street Journal ότι το μοντέλο εμφάνισε μεγαλύτερη τάση παραπλάνησης σε σχέση με το GPT-6 Astra.

Σε ορισμένες περιπτώσεις δεν ενημέρωνε με ακρίβεια τους χρήστες για τις ενέργειες που είχε πραγματοποιήσει, ενώ φέρεται να προχωρούσε σε εργασίες χωρίς προηγουμένως να ζητήσει την απαραίτητη έγκριση.

Παράλληλα, επιχειρούσε να χρησιμοποιήσει εξωτερικά εργαλεία ή υπηρεσίες ακόμη και σε περιπτώσεις όπου αυτό μπορούσε να δημιουργήσει κινδύνους. Το ζήτημα αφορά αυτό που η OpenAI περιγράφει ως «εξουσιοδότηση πεδίου», δηλαδή την ανάγκη ένα μοντέλο να παραμένει εντός των ορίων που έχει θέσει ο χρήστης.

Το GPT-6.1 Astra είχε παρουσιάσει βελτιώσεις και σε άλλους τομείς, μεταξύ άλλων στη μείωση της τάσης των μοντέλων να εγκαταλείπουν ή να εκτελούν επιφανειακά τις εργασίες τους. Ωστόσο, η OpenAI έκρινε ότι οι αδυναμίες του στην ασφάλεια και την ευθυγράμμιση δεν επέτρεπαν την κυκλοφορία του.

Οι προηγούμενες δοκιμές με τους agents

Η απόφαση έρχεται μετά από σειρά περιστατικών κατά τη διάρκεια των εσωτερικών δοκιμών της OpenAI, στα οποία agents της εταιρείας φέρεται να κινήθηκαν πέρα από τα προβλεπόμενα όρια.

Μεταξύ άλλων, agents που συμμετείχαν σε άσκηση κυβερνοασφάλειας απέκτησαν πρόσβαση στην πλατφόρμα Hugging Face, ενώ έχουν καταγραφεί αντίστοιχα περιστατικά με ιστοτόπους δημόσιων οργανισμών και διεθνών οργανισμών.

Η OpenAI έχει ήδη ενισχύσει τα συστήματα παρακολούθησης και τις δικλίδες ασφαλείας για τους agents, με στόχο τον ταχύτερο εντοπισμό συμπεριφορών που αποκλίνουν από τις προβλεπόμενες οδηγίες.

Νέοι έλεγχοι και επανεκπαίδευση

Η εταιρεία σχεδιάζει να διερευνήσει τα αίτια των προβλημάτων που εντοπίστηκαν στο GPT-6.1 Astra, εξετάζοντας μεταξύ άλλων τον τρόπο με τον οποίο η ενισχυτική μάθηση επηρεάζει τη συμπεριφορά των μοντέλων.

Παράλληλα, δεν αποκλείεται να αξιοποιηθεί η βασική έκδοση του μοντέλου σε νέους κύκλους εκπαίδευσης, ώστε να αποτελέσει τη βάση για μελλοντικές εκδόσεις της σειράς GPT-6.

Η εξέλιξη έρχεται σε μια περίοδο κατά την οποία η ασφάλεια και η συμπεριφορά των αυτόνομων AI agents βρίσκονται όλο και περισσότερο στο επίκεντρο. Η OpenAI έχει ήδη δημοσιεύσει αναλυτικά στοιχεία για τα μέτρα ασφαλείας και τις δοκιμές ευθυγράμμισης των μοντέλων Astra, ενώ συνεχίζει να ενισχύει την παρακολούθηση της συμπεριφοράς τους.

YouTube thumbnail

Τελευταία Νέα

Related Articles

Αφήστε μια απάντηση

Η ηλ. διεύθυνση σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

Back to top button