Η Anthropic εγκαταλείπει την πρωτοποριακή της δέσμευση για ασφάλεια: Τι έχει αλλάξει και γιατί έχει σημασία;

περίληψη

  • Ο Anthropic μαλακώνει την υπόσχεσή του για ασφάλεια.
  • Το προηγούμενο αυστηρό πάγωμα της ανάπτυξης από την εταιρεία έχει αντικατασταθεί από μια υπόσχεση αυξημένης διαφάνειας.
  • Αυτή η κίνηση θα μπορούσε να υποβαθμίσει τα πρότυπα ασφαλείας στον κλάδο.

Anthropic, ο κατασκευαστής του πράκτορα τεχνητής νοημοσύνης Claude (ένας από τους Τα αγαπημένα μας εργαλεία παραγωγικότηταςΈνα από τα βασικά χαρακτηριστικά του είναι η ακλόνητη δέσμευσή του στην ασφάλεια. ανάρτησηΗ εταιρεία έχει περιγράψει την Πολιτική Υπεύθυνης Επέκτασης (RSP) και τις αλλαγές που περιλαμβάνονται στην έκδοση 3.0.

Η Anthropic εγκαταλείπει την πρωτοποριακή της δέσμευση για ασφάλεια: Τι έχει αλλάξει και γιατί έχει σημασία;

Ποια ήταν η παλιά πολιτική ασφαλείας του Anthropic;

Η εταιρεία έχει θέσει ένα βιομηχανικό πρότυπο για τις εγγυήσεις ασφάλειας.

Για να κατανοήσετε τις αλλαγές που κάνει η Anthropic, πρέπει να κατανοήσετε την αρχική της Πολιτική Υπεύθυνης Κλιμάκωσης (RSP). Το 2023, η Anthropic δεσμεύτηκε να σταματήσει την εκπαίδευση μοντέλων Τεχνητής Νοημοσύνης εάν οι δυνατότητές τους υπερέβαιναν την ικανότητα της εταιρείας να αποδείξει ότι ήταν ασφαλή. Οι προειδοποιητικές σημαίες για την ασφάλεια που θα μπορούσαν να προκαλέσουν αυτήν τη διακοπή περιελάμβαναν τα ακόλουθα:

  • Μοντέλα που θα μπορούσαν να βοηθήσουν στη δημιουργία ή την ανάπτυξη χημικών, βιολογικών ή πυρηνικών όπλων.
  • Μοντέλα που μπορούν να βελτιωθούν υπερβολικά.
  • Μοντέλα που μπορούν να βοηθήσουν σε κυβερνοεπιθέσεις.
  • Μοντέλα που μπορούν να συμπεριφέρονται με συγκεκριμένους τρόπους χωρίς ανθρώπινη παρέμβαση, όπως το να «ξεφεύγουν» από το περιβάλλον τους για να αποφύγουν το κλείσιμο.

Η Πολιτική Υπεύθυνης Επέκτασης (RSP) επέβαλε αυστηρό όριο σε αυτά τα μοντέλα—η Anthropic θα σταματούσε την ανάπτυξη ακόμη και αν αυτό σήμαινε ότι θα την προσπερνούσαν οι ανταγωνιστές. Ήταν μια τολμηρή στάση σε έναν κλάδο όπου όλοι φαινόταν να αγωνίζονται με ιλιγγιώδη ταχύτητα.

Η νέα Πολιτική Υπεύθυνης Επέκτασης (RSP) της Anthropic

Η έκδοση 3.0 χαλαρώνει σημαντικά τους κανόνες.

Η Anthropic εξακολουθεί να έχει πολιτική υπεύθυνης επέκτασης, αλλά με την έκδοση 3.0, η εταιρεία θα σταματήσει την ανάπτυξη μόνο εάν πιστεύει ότι έχει ήδη σημαντικό προβάδισμα έναντι των ανταγωνιστών. Η δεσμευτική υπόσχεση διακοπής έχει αντικατασταθεί από μια υπόσχεση διαφάνειας σχετικά με το εάν η εταιρεία επιτυγχάνει τους στόχους ασφαλείας της και αντιστοιχεί ή υπερβαίνει την ασφάλεια των ανταγωνιστών. Με άλλα λόγια, ουσιαστικά έχει αναλάβει μια δέσμευση ασφάλειας.

Τι προκάλεσε αυτές τις αλλαγές; Η Anthropic αναφέρει ότι η αρχική της Δέσμευση Ασφάλειας (RSP) δεν πέτυχε το επιθυμητό αποτέλεσμα. Η RSP είχε ως στόχο να αποτελέσει παράδειγμα ασφάλειας για να ακολουθήσουν και άλλες εταιρείες. Δυστυχώς, οι ανταγωνιστές δεν έλαβαν υπόψη αυτό το μήνυμα. Η εταιρεία πιστεύει ότι περιορίζοντας τις δικές της προσπάθειες, ουσιαστικά επιτρέπει σε ανταγωνιστές που δεν είναι τόσο ευαισθητοποιημένοι σε θέματα ασφάλειας να κυριαρχήσουν στην αγορά και να υπαγορεύσουν τον ρυθμό ανάπτυξης.

Τι σημαίνει αυτό για τον κλάδο;

Ένα μεγάλο βήμα προς τα πίσω

Δυστυχώς, αυτές οι αλλαγές θα μπορούσαν να δημιουργήσουν ένα κακό προηγούμενο στον τομέα της τεχνητής νοημοσύνης. Το Anthropic ήταν το χρυσό πρότυπο για τις πρακτικές ασφαλείας και με αυτές τις αλλαγές, ο πήχης έχει μειωθεί σημαντικά. Αυτό θα μπορούσε να στείλει ένα μήνυμα στους ανταγωνιστές ότι η ασφάλεια έρχεται δεύτερη μετά την καινοτομία. Ενώ αυτό θα μπορούσε να βοηθήσει τον Claude να Ενημερωνόμαστε για το ChatGPTΩστόσο, εξακολουθεί να φαίνεται σαν ένα βήμα προς τη λάθος κατεύθυνση.

Τελικά, αν θέλουμε να διαλύσουμε τους φόβους των απαισιόδοξων για την Τεχνητή Νοημοσύνη, μια δέσμευση ασφάλειας από μία μόνο εταιρεία δεν θα είναι αρκετή — ολόκληρος ο κλάδος πρέπει να ενωθεί και να θέσει ένα όριο στην άμμο. Σε αυτό το στάδιο, φαίνεται ολοένα και πιο απίθανο να συμβεί αυτό.

Κουμπί μετάβασης στην κορυφή