Αυτή η κυβερνοεπίθεση επιτρέπει στους χάκερ να θέσουν σε κίνδυνο μοντέλα τεχνητής νοημοσύνης αλλάζοντας μόνο ένα γράμμα.

Περίληψη:

  • Ερευνητές στο HiddenLayer ανέπτυξαν μια νέα επίθεση σε μεγάλα γλωσσικά μοντέλα (LLM) που ονομάζεται TokenBreaker.
  • Προσθέτοντας ή αλλάζοντας μόνο έναν χαρακτήρα, μπορούν να παρακάμψουν ορισμένους μηχανισμούς ασφαλείας.
  • Τα βασικά μοντέλα μεγάλης γλώσσας (LLM) εξακολουθούν να είναι σε θέση να κατανοήσουν την πρόθεση της επίθεσης.

Ερευνητές ασφαλείας ανακάλυψαν έναν τρόπο να παρακάμψουν τους ενσωματωμένους μηχανισμούς προστασίας σε ορισμένα... Μεγάλα γλωσσικά μοντέλα (LLM) και να το κάνουν να ανταποκρίνεται σε κακόβουλους ισχυρισμούς.

Οι Kieran Evans, Casimir Schulz και Kenneth Young της HiddenLayer δημοσίευσαν μια εις βάθος αναφορά σχετικά με μια νέα τεχνική επίθεσης που ονομάζουν TokenBreak, η οποία στοχεύει στον τρόπο με τον οποίο ορισμένα μεγάλα γλωσσικά μοντέλα (LLM) διασπούν το κείμενο σε διακριτικά (tokens), ιδιαίτερα εκείνα που χρησιμοποιούν στρατηγικές Byte Pair Encoding (BPE) ή WordPiece.

Πρόσωπο τεχνητής νοημοσύνης σε προφίλ σε ψηφιακό φόντο.

Η μετατροπή σε token είναι η διαδικασία διαχωρισμού κειμένου σε μικρότερες μονάδες που ονομάζονται tokens, οι οποίες μπορεί να είναι λέξεις, μέρη λέξεων ή χαρακτήρες, τις οποίες χρησιμοποιούν μεγάλα γλωσσικά μοντέλα (LLM) για να κατανοήσουν και να δημιουργήσουν γλώσσα. Για παράδειγμα, η λέξη «δυστυχία» μπορεί να αναλυθεί σε «μη», «ευτυχία» και «νότητα» και κάθε token στη συνέχεια μετατρέπεται σε ένα αριθμητικό αναγνωριστικό που μπορεί να επεξεργαστεί το μοντέλο (καθώς τα LLM δεν διαβάζουν ακατέργαστο κείμενο, αλλά αριθμούς). Αυτή η επίθεση αποτελεί μια αυξανόμενη απειλή για την κυβερνοασφάλεια, απαιτώντας από τους οργανισμούς και τους ερευνητές να αναπτύξουν προηγμένες στρατηγικές άμυνας για την προστασία των συστημάτων τεχνητής νοημοσύνης τους.

Τι είναι οι οδηγίες χρήσης;

Το Finstructions βασίζεται στην προσθήκη επιπλέον χαρακτήρων σε λέξεις-κλειδιά (όπως η μετατροπή των «οδηγιών» σε «finstructions»), επιτρέποντας στους εισβολείς να ξεγελάσουν τα μοντέλα ασφαλείας κάνοντάς τα να πιστέψουν ότι ο κώδικας είναι ακίνδυνος.

Αντιθέτως, το στοχευμένο μοντέλο μεγάλης γλώσσας (LLM) παραμένει σε θέση να κατανοήσει την αρχική πρόθεση των οδηγιών, επιτρέποντας στους εισβολείς να περνούν κακόβουλο κώδικα μέσω αμυντικών μηχανισμών χωρίς να εντοπίζονται. Αυτή η ευπάθεια αποτελεί σημαντικό κίνδυνο ασφαλείας για τα συστήματα τεχνητής νοημοσύνης.

Αυτή η τεχνολογία θα μπορούσε να χρησιμοποιηθεί, μεταξύ άλλων, για την παράκαμψη φίλτρων ανεπιθύμητης αλληλογραφίας που υποστηρίζονται από τεχνητή νοημοσύνη και την αποστολή κακόβουλου περιεχομένου στα εισερχόμενα των χρηστών, αυξάνοντας τον κίνδυνο επιθέσεων ηλεκτρονικού "ψαρέματος" (phishing) και κακόβουλου λογισμικού.

Για παράδειγμα, εάν ένα φίλτρο ανεπιθύμητης αλληλογραφίας έχει εκπαιδευτεί να μπλοκάρει μηνύματα που περιέχουν τη λέξη «λαχείο», μπορεί να επιτρέψει τη διέλευση ενός μηνύματος που λέει «Κερδίσατε τον κουλοχέρη!», εκθέτοντας τους παραλήπτες σε πιθανώς κακόβουλες σελίδες προορισμού, μολύνσεις από κακόβουλο λογισμικό και τα παρόμοια. Αυτός ο γλωσσικός χειρισμός επιτρέπει την παράκαμψη των μηχανισμών ασφαλείας.

«Αυτή η τεχνική επίθεσης χειραγωγεί το κείμενο εισόδου με τρόπο που προκαλεί σε ορισμένα μοντέλα να δίνουν λανθασμένες ταξινομήσεις», εξήγησαν οι ερευνητές.

«Το πιο σημαντικό είναι ότι ο τελικός στόχος (το μεγάλο γλωσσικό μοντέλο ή ο παραλήπτης του email) μπορεί ακόμα να κατανοήσει και να ανταποκριθεί στο χειραγωγημένο κείμενο και, ως εκ τούτου, να είναι ευάλωτος στην επίθεση που το μοντέλο προστασίας σχεδιάστηκε ειδικά για να αποτρέψει», πρόσθεσαν.

Η HiddenLayer πρόσθεσε ότι τα μοντέλα που χρησιμοποιούν τμηματοποιητές λέξεων Unigram είναι ανθεκτικά σε αυτό το είδος χειραγώγησης. Επομένως, μια στρατηγική μετριασμού είναι η επιλογή μοντέλων με πιο ισχυρές μεθόδους τμηματοποίησης.

Κουμπί μετάβασης στην κορυφή