Η Anthropic, η εταιρεία AI πίσω από το μοντέλο Claude, ανέφερε ότι τα δικά της συστήματα AI παραβίασαν με επιτυχία τρεις οργανισμούς κατά τη διάρκεια δοκιμών κυβερνοασφάλειας. Η εταιρεία αποκάλυψε τα αποτελέσματα σε πρόσφατη ενημέρωση, υπογραμμίζοντας τόσο τις δυνατότητες όσο και τους κινδύνους της προηγμένης τεχνητής νοημοσύνης.
Πώς λειτούργησαν οι δοκιμές
Οι δοκιμές ήταν μέρος μιας άσκησης red-teaming, όπου στο AI δόθηκε ο στόχος να διεισδύσει στα δίκτυα τριών ανώνυμων οργανισμών. Τα μοντέλα εντόπισαν ευπάθειες, δημιούργησαν εκμεταλλεύσεις και εκτέλεσαν επιθέσεις χωρίς ανθρώπινη παρέμβαση. Η Anthropic δήλωσε ότι οι παραβιάσεις ήταν επιτυχείς, αν και δεν διευκρίνισε το βάθος της πρόσβασης που αποκτήθηκε ή τον τύπο των δεδομένων που εκτέθηκαν.
Η εταιρεία δεν έχει δημοσιεύσει τεχνικές λεπτομέρειες σχετικά με τις μεθόδους που χρησιμοποιήθηκαν, επικαλούμενη λόγους ασφαλείας. Αλλά τα αποτελέσματα δείχνουν ότι τα τρέχοντα μοντέλα AI μπορούν να εκτελούν αυτόνομα πολύπλοκες κυβερνοεπιθέσεις, μια ικανότητα που μέχρι τώρα ήταν θεωρητική.
Γιατί η Anthropic δοκιμάζει τα δικά της μοντέλα
Η Anthropic έχει τοποθετηθεί ως μια εταιρεία AI που δίνει προτεραιότητα στην ασφάλεια. Δοκιμάζει τακτικά τα μοντέλα της για επιβλαβείς συμπεριφορές, όπως μεροληψία, εξαπάτηση και τώρα επιθετική κυβερνοασφάλεια. Ο στόχος είναι να κατανοήσει τα όρια της τεχνολογίας πριν αυτή διατεθεί ευρέως.
«Θέλουμε να μάθουμε τι μπορούν να κάνουν τα μοντέλα μας ώστε να χτίσουμε καλύτερες διασφαλίσεις», δήλωσε η εταιρεία στην έκθεσή της. Οι δοκιμές αποτελούν μέρος μιας ευρύτερης προσπάθειας να διασφαλιστεί ότι η AI παραμένει ευθυγραμμισμένη με τις ανθρώπινες προθέσεις, ακόμη και όταν χρησιμοποιείται από κακόβουλους παράγοντες.
Οι κίνδυνοι της ισχυρής AI
Οι επιτυχείς παραβιάσεις εγείρουν ανησυχίες σχετικά με την πιθανότητα χρήσης της AI σε κυβερνοέγκλημα ή επιθέσεις υποστηριζόμενες από κράτη. Αν ένα μοντέλο μπορεί να διεισδύσει σε τρεις οργανισμούς κατά τη διάρκεια μιας ελεγχόμενης δοκιμής, θα μπορούσε να κάνει το ίδιο και στην πραγματική ζωή. Η ίδια τεχνολογία που βοηθά τις ομάδες ασφαλείας να εντοπίζουν ευπάθειες θα μπορούσε επίσης να στραφεί εναντίον τους.
Η Anthropic αναγνώρισε τη διττή φύση του έργου της. Η εταιρεία δήλωσε ότι αναπτύσσει αντίμετρα, συμπεριλαμβανομένων συστημάτων παρακολούθησης που ανιχνεύουν πότε ένα μοντέλο χρησιμοποιείται για κακόβουλους σκοπούς. Αλλά η κούρσα εξοπλισμών μεταξύ επιθετικής και αμυντικής AI μόλις αρχίζει.
Η Anthropic σχεδιάζει να συνεχίσει τις δοκιμές red-teaming στα μοντέλα της και να μοιράζεται τα ευρήματα με την ευρύτερη κοινότητα ασφάλειας AI. Η εταιρεία δεν έχει ανακοινώσει χρονοδιάγραμμα για περαιτέρω δοκιμές, αλλά τόνισε τις συνεχιζόμενες προσπάθειες για τη βελτίωση της ευρωστίας των μοντέλων.
Το ερώτημα τώρα είναι πώς θα ανταποκριθεί η βιομηχανία στα αυξανόμενα στοιχεία ότι η AI μπορεί να αποτελέσει ισχυρό εργαλείο τόσο για την επίθεση όσο και για την άμυνα στον τομέα της κυβερνοασφάλειας.



