Διερεύνηση της ασφάλειας των μοντέλων τεχνητής νοημοσύνης: ανάλυση επιθέσεων με έγχυση αξίωσης και προστασίες

Μετά την εξάπλωσή της σε πολλούς τομείς, η εξάρτηση από μοντέλα τεχνητής νοημοσύνης για διάφορους σκοπούς αυξάνεται, αλλά καθώς αυτή η εξάρτηση αυξάνεται, εμφανίζονται και νέες προκλήσεις ασφαλείας. Μια τέτοια πρόκληση είναι η επίθεση έγχυσης αξίωσης AI, η οποία στοχεύει έξυπνα μοντέλα με σκοπό να χειραγωγήσει τα αποτελέσματά τους.

Οι ισχυρισμοί AI οι επιθέσεις δηλητηριάζουν την έξοδο των εργαλείων AI που βασίζονται σε αυτά, αλλάζοντας και χειραγωγώντας την έξοδο τους σε κάτι κακόβουλο. Πώς όμως λειτουργεί μια επίθεση με ένεση με αξίωση AI και πώς μπορείτε να προστατεύσετε τον εαυτό σας; Επαληθεύω Αξίζουν τα χρήματα οι αξιώσεις τεχνητής νοημοσύνης premium;

Τι είναι μια επίθεση έγχυσης ισχυρισμών AI;

Οι επιθέσεις έγχυσης ισχυρισμού AI εκμεταλλεύονται τις ευπάθειες σε μοντέλα παραγωγής τεχνητής νοημοσύνης για να χειριστούν την παραγωγή τους. Μπορούν να εκτελεστούν από εσάς ή να εγχυθούν από εξωτερικό χρήστη μέσω μιας έμμεσης επίθεσης έγχυσης αξίωσης. Οι επιθέσεις DAN (Do Anything Now) δεν ενέχουν κανέναν κίνδυνο για εσάς, τον τελικό χρήστη, αλλά άλλες επιθέσεις είναι θεωρητικά ικανές να δηλητηριάσουν την έξοδο που λαμβάνετε από τη γενετική τεχνητή νοημοσύνη.

Για παράδειγμα, κάποιος θα μπορούσε να χειραγωγήσει ένα μοντέλο τεχνητής νοημοσύνης για να σας ζητήσει να εισαγάγετε παράνομα το όνομα χρήστη και τον κωδικό πρόσβασής σας, χρησιμοποιώντας την εξουσία και την αξιοπιστία του AI για να πετύχει μια επίθεση phishing. Θεωρητικά, η αυτόνομη τεχνητή νοημοσύνη (με δυνατότητα ανάγνωσης και απάντησης σε μηνύματα) θα μπορούσε επίσης να λαμβάνει και να ενεργεί σε ανεπιθύμητες εξωτερικές οδηγίες.

Η επίθεση εξαρτάται από την κατανόηση του χάκερ για το πώς λειτουργεί το μοντέλο AI και πώς αντιδρά στις εισαγωγές. Στην περίπτωση της έγχυσης αξίωσης AI, τα δεδομένα που έχουν δημιουργηθεί με κακόβουλο τρόπο εισάγονται για τον χειρισμό των αποτελεσμάτων του μοντέλου. Για παράδειγμα, εάν ένα μοντέλο λάβει στοιχεία που σχετίζονται με μια ταξινόμηση, ένας χάκερ θα μπορούσε να εισαγάγει παραπλανητικά δεδομένα για να κατευθύνει το μοντέλο προς μια εσφαλμένη ταξινόμηση.

Η επιτυχία αυτού του τύπου επίθεσης εξαρτάται από την προσεκτική κατανόηση του σχεδιασμού του μοντέλου και την ανάλυση των δεδομένων που χρησιμοποιούνται στην εκπαίδευση. Τεχνικές προστασίας όπως η επικύρωση δεδομένων και η πολυπλοκότητα του μοντέλου προσπαθούν να μειώσουν τις πιθανότητες επιτυχίας των επιθέσεων έγχυσης αξιώσεων AI. Επαληθεύω Τι είναι οι εχθρικές επιθέσεις εναντίον μοντέλων AI και πώς μπορείτε να τις σταματήσετε;

Πώς λειτουργούν οι επιθέσεις έγχυσης αξίωσης;

Οι επιθέσεις έγχυσης αξίωσης λειτουργούν με την παροχή πρόσθετων οδηγιών στο AI χωρίς τη συγκατάθεση ή τη γνώση του χρήστη. Οι χάκερ μπορούν να το επιτύχουν αυτό με διάφορους τρόπους, συμπεριλαμβανομένων των επιθέσεων DAN και των έμμεσων επιθέσεων έγχυσης αξίωσης.

DAN Attacks (Κάνε οτιδήποτε τώρα)

Οι επιθέσεις DAN (Do Anything Now) είναι ένας τύπος επίθεσης έγχυσης αξίωσης που περιλαμβάνει "jailbreaking" δημιουργημένων μοντέλων AI όπως το ChatGPT. Μην πλάθετε Αυτές οι επιθέσεις jailbreak Είναι επικίνδυνο για εσάς ως τελικό χρήστη, αλλά επεκτείνει τη δύναμη του AI, επιτρέποντάς του να γίνει εργαλείο κατάχρησης.

Για παράδειγμα, χρησιμοποιήστε Ερευνητής ασφαλείας Alejandro Vidal Ο DAN καλείται να κάνει το μοντέλο GPT-4 του OpenAI να δημιουργήσει κώδικα Python για το keylogger. Όταν χρησιμοποιείται κακόβουλα, μια επίθεση jailbreak μειώνει σημαντικά τα εμπόδια που βασίζονται σε δεξιότητες που σχετίζονται με το έγκλημα στον κυβερνοχώρο και μπορεί να επιτρέψει σε νέους χάκερ να εξαπολύσουν πιο εξελιγμένες επιθέσεις.

Επιθέσεις δηλητηρίασης δεδομένων εκπαίδευσης

Οι επιθέσεις δηλητηρίασης δεδομένων εκπαίδευσης για μοντέλα AI δεν μπορούν να ταξινομηθούν ως επιθέσεις έγχυσης αξιώσεων, αλλά έχουν αξιοσημείωτες ομοιότητες ως προς τον τρόπο λειτουργίας τους και τους κινδύνους που ενέχουν για τους χρήστες. Σε αντίθεση με τις επιθέσεις έγχυσης αξίωσης, οι επιθέσεις δηλητηρίασης δεδομένων εκπαίδευσης είναι ένας τύπος αντίθετης επίθεσης μηχανικής μάθησης που συμβαίνει όταν ένας χάκερ τροποποιεί τα δεδομένα εκπαίδευσης που χρησιμοποιούνται από ένα μοντέλο τεχνητής νοημοσύνης. Συμβαίνει το ίδιο αποτέλεσμα: τοξική απόδοση και τροποποίηση συμπεριφοράς.

Οι πιθανές εφαρμογές των επιθέσεων δηλητηρίασης δεδομένων εκπαίδευσης είναι πρακτικά απεριόριστες. Για παράδειγμα, τα δεδομένα εκπαίδευσης του AI που χρησιμοποιούνται για το φιλτράρισμα των προσπαθειών phishing από μια πλατφόρμα συνομιλίας ή email θα μπορούσαν θεωρητικά να τροποποιηθούν. Εάν ο χάκερ διδάξει στο μοντέλο AI ότι ορισμένοι τύποι προσπαθειών phishing είναι αποδεκτοί, μπορεί να στείλει επανειλημμένα μηνύματα ηλεκτρονικού ψαρέματος χωρίς να εντοπιστεί.

Οι επιθέσεις δηλητηρίασης δεδομένων εκπαίδευσης δεν μπορούν να σας βλάψουν άμεσα, αλλά μπορεί να κάνουν πιθανές άλλες απειλές. Εάν θέλετε να προστατευθείτε από αυτές τις επιθέσεις, να θυμάστε ότι η τεχνητή νοημοσύνη δεν είναι αλάνθαστη και ότι θα πρέπει να ελέγξετε οτιδήποτε συναντήσετε στο διαδίκτυο. Επαληθεύω Ο πλήρης οδηγός σας για την προστασία του απορρήτου σας στην εποχή της τεχνητής νοημοσύνης.

Έμμεσες επιθέσεις ένεσης αξίωσης

Οι επιθέσεις έγχυσης αξίωσης είναι ο τύπος επίθεσης που ενέχει τον μεγαλύτερο κίνδυνο για εσάς, τον τελικό χρήστη. Αυτές οι επιθέσεις συμβαίνουν όταν τροφοδοτούνται κακόβουλες οδηγίες στο AI που δημιουργείται από έναν εξωτερικό πόρο, όπως μια κλήση διεπαφής προγραμματισμού εφαρμογών (API), προτού λάβει την απαιτούμενη είσοδο.

Μια εργασία με τίτλο «Πραγματικός συμβιβασμός των ενσωματωμένων εφαρμογών LLM με χρήση έμμεσης επίθεσης έγχυσης αξίωσης» έδειξε... arXiv [PDF] Μια θεωρητική επίθεση όπου μια τεχνητή νοημοσύνη θα μπορούσε να κατευθυνθεί για να πείσει έναν χρήστη να εγγραφεί σε έναν ιστότοπο ηλεκτρονικού ψαρέματος εντός της απάντησης, χρησιμοποιώντας κρυφό κείμενο (αόρατο στο ανθρώπινο μάτι αλλά τέλεια αναγνώσιμο στο μοντέλο AI) για να εισάγει κρυφά πληροφορίες . Μια άλλη επίθεση που πραγματοποιήθηκε από την ίδια ερευνητική ομάδα τεκμηριώθηκε GitHub Μια επίθεση στην οποία Δεύτερος πιλότος (πρώην Bing Chat) για να πείσει τον χρήστη ότι είναι ένας ζωντανός πράκτορας υποστήριξης που αναζητά πληροφορίες πιστωτικής κάρτας.

Οι έμμεσες επιθέσεις έγχυσης ισχυρισμών αποτελούν απειλή επειδή μπορεί να χειραγωγήσουν τις απαντήσεις που λαμβάνετε από ένα αξιόπιστο μοντέλο τεχνητής νοημοσύνης, αλλά αυτή δεν είναι η μόνη απειλή που αποτελούν. Όπως αναφέρθηκε προηγουμένως, μπορεί επίσης να προκαλέσει οποιοδήποτε αυτόνομο μοντέλο AI που μπορεί να χρησιμοποιείτε να συμπεριφέρεται με απροσδόκητους και δυνητικά επιβλαβείς τρόπους.

Αποτελούν απειλές οι επιθέσεις έγχυσης ισχυρισμού AI;

Σίγουρα, οι επιθέσεις έγχυσης με ισχυρισμό AI αποτελούν απειλή, αλλά δεν είναι γνωστό πώς ακριβώς μπορούν να εκμεταλλευτούν αυτά τα τρωτά σημεία. Δεν υπάρχουν επιτυχείς επιθέσεις έγχυσης τεχνητής νοημοσύνης και πολλές γνωστές προσπάθειες έχουν πραγματοποιηθεί από ερευνητές που δεν είχαν πραγματική πρόθεση να προκαλέσουν βλάβη. Ωστόσο, πολλοί ερευνητές τεχνητής νοημοσύνης θεωρούν ότι οι επιθέσεις έγχυσης με ισχυρισμό AI είναι μια από τις πιο δύσκολες προκλήσεις στην εφαρμογή της ασφάλειας AI.

Επιπλέον, η απειλή τέτοιων επιθέσεων δεν πέρασε απαρατήρητη από τις αρχές. Σύμφωνα με την εφημερίδα Washington PostΤον Ιούλιο του 2023, η Ομοσπονδιακή Επιτροπή Εμπορίου διερεύνησε το OpenAI, αναζητώντας περισσότερες πληροφορίες σχετικά με γνωστά περιστατικά επιθέσεων με έγχυση αξίωσης. Είναι γνωστό ότι καμία επίθεση δεν ήταν επιτυχής μέχρι στιγμής μετά τις δοκιμές, αλλά αυτό είναι πιθανό να αλλάξει.

Οι χάκερ αναζητούν συνεχώς νέες μεθόδους και μπορούμε μόνο να μαντέψουμε πώς ένας χάκερ θα χρησιμοποιήσει επιθέσεις έγχυσης αξίωσης στο μέλλον. Μπορείτε να προστατεύσετε τον εαυτό σας εφαρμόζοντας πάντα έναν υγιή έλεγχο στις απαντήσεις του μοντέλου AI σας. Σε αυτό, τα μοντέλα τεχνητής νοημοσύνης είναι απίστευτα χρήσιμα, αλλά είναι σημαντικό να θυμάστε ότι έχετε κάτι που δεν έχει η τεχνητή νοημοσύνη: την ανθρώπινη κρίση. Θυμηθείτε, θα πρέπει να ελέγχετε προσεκτικά τα αποτελέσματα που λαμβάνετε από εργαλεία όπως το Copilot και να απολαύσετε τη χρήση εργαλείων AI καθώς εξελίσσονται και βελτιώνονται. Τώρα μπορείτε να δείτε Επίτευξη αυτομάθησης για υπολογιστές: Μπορούν τα ευφυή συστήματα να αποκτήσουν κοινή λογική;

Κουμπί μετάβασης στην κορυφή