Η εμφάνιση των chatbots που βασίζονται σε γενετική τεχνητή νοημοσύνη έχει διαδώσει τον όρο «μοντέλο μεγάλης γλώσσας», την υποκείμενη τεχνολογία AI που λειτουργεί στα παρασκήνια. Τα μεγάλα γλωσσικά μοντέλα (LLM) παράγουν αποτελέσματα με βάση ένα προβλεπόμενο σύνολο γλώσσας ως απόκριση στην εισαγωγή του χρήστη, κάνοντάς το να φαίνεται σαν το AI να μπορεί να σκεφτεί μόνο του.
Αλλά τα LLM δεν είναι τα μόνα μεγάλα διαθέσιμα μοντέλα. Τα Μεγάλα Μοντέλα Δράσης (LAM) μπορεί να είναι η επόμενη πρωτοποριακή τεχνολογία στην τεχνητή νοημοσύνη. Επαληθεύω Μερικά μεγάλα προβλήματα με το ChatGPT του OpenAI.

Γρήγοροι σύνδεσμοι
Τι είναι ένα Μεγάλο Μοντέλο Δράσης (LAM);
Το Large Action Model (LAM) είναι ένα μοντέλο τεχνητής νοημοσύνης που είναι σε θέση να κατανοεί την ανθρώπινη συμβολή και να εκτελεί την αντίστοιχη δράση, καθιστώντας το ικανό να αλληλεπιδρά με τον κόσμο με τρόπο που μοιάζει με τον άνθρωπο. Αυτή είναι μια ελαφρώς διαφορετική προσέγγιση από τα μοντέλα τεχνητής νοημοσύνης που επικεντρώνονται αποκλειστικά στη δημιουργία αποκρίσεων. Ο όρος «μεγάλο επιχειρηματικό μοντέλο» εισήχθη για πρώτη φορά από την Rabbit Inc, την εταιρεία ανάπτυξης του Rabbit R1. Στο βίντεο παρουσίασης του Rabbit R1 της εταιρείας, λέει ότι το LAM είναι ένα νέο θεμελιώδες μοντέλο που βοηθά στη μετακίνηση της τεχνητής νοημοσύνης από τα λόγια στη δράση.
Τα LAM εκπαιδεύονται σε μεγάλα σύνολα δεδομένων ενεργειών χρήστη. Ως εκ τούτου, μαθαίνουν μιμούμενοι ανθρώπινες πράξεις ή μέσω επίδειξης. Μέσω της επίδειξης, το μοντέλο LAM μπορεί να κατανοήσει και να πλοηγηθεί στις διεπαφές χρήστη διαφορετικών ιστοτόπων ή εφαρμογών για κινητά και να εκτελέσει συγκεκριμένες ενέργειες με βάση τις οδηγίες σας. Σύμφωνα με Κουνέλι,Το LAM μπορεί να το επιτύχει ακόμα κι αν η διεπαφή έχει αλλάξει ελαφρώς.
Μπορείτε να σκεφτείτε τα LAM ως επέκταση των υφιστάμενων δυνατοτήτων των LLM. Ενώ η παραγωγή κειμένου ή μέσου παραγωγής στο LLM βασίζεται στην εισαγωγή του χρήστη προβλέποντας την επόμενη λέξη ή διακριτικό (κάνετε μια ερώτηση και το μοντέλο LLM παρέχει έξοδο κειμένου ή πολυμέσων), τα LAM το προχωρούν περαιτέρω προσθέτοντας τη δυνατότητα υλοποίησης... Πολύπλοκες διαδικασίες για λογαριασμό σας. Επαληθεύω Πρέπει να χρησιμοποιήσετε ένα τοπικό μοντέλο LLM; Πλεονεκτήματα, μειονεκτήματα και βέλτιστες πρακτικές.
Τι μπορούν να κάνουν τα LAM;
Τα LAM αφορούν την εκτέλεση σύνθετων ενεργειών για λογαριασμό σας. Ωστόσο, το κρίσιμο σημείο που πρέπει να σημειωθεί είναι η ικανότητα εκτέλεσης πολύπλοκων διαδικασιών. Αυτό κάνει τα LAM πιο χρήσιμα για προηγμένες εργασίες, αλλά αυτό δεν σημαίνει ότι δεν μπορούν να εκτελέσουν απλούστερες διαδικασίες.
Θεωρητικά, αυτό σημαίνει ότι θα μπορούσατε, για παράδειγμα, να ζητήσετε από το μοντέλο LAM να κάνει κάτι για λογαριασμό σας, όπως να παραγγείλετε έναν καφέ από το τοπικό σας καφέ ή μια βόλτα με το Uber, ακόμη και να κάνετε κράτηση ξενοδοχείου. Επομένως, είναι διαφορετικό από το να εκτελείτε απλές εργασίες, όπως να ζητάτε από το Google Assistant, το Siri ή την Alexa να ανάψει την τηλεόραση ή τα φώτα του σαλονιού.
Κάτω από την κουκούλα, σύμφωνα με το όραμα που μοιράζεται η Rabbit Inc., το μοντέλο LAM μπορεί να έχει πρόσβαση σε έναν σχετικό ιστότοπο ή εφαρμογή όπως η Uber και να περιηγηθεί στη διεπαφή του για να προβεί σε μια ενέργεια, όπως να ζητήσει μια διαδρομή ή να την ακυρώσει εάν αλλάξετε μυαλό. Επαληθεύω Γιατί η κυκλοφορία προϊόντων ημιτελούς τεχνολογίας είναι πιο συχνή από ποτέ;.
Τα LAM θα έχουν καλύτερη απόδοση από τα LLM, αλλά δεν είναι έτοιμα (ακόμα)
Η έννοια των LAM είναι συναρπαστική, ίσως περισσότερο από τα LLM. Τα Μεγάλα Μοντέλα Δράσης (LAMs) θα είναι το μέλλον μετά τη γενετική τεχνητή νοημοσύνη, επιτρέποντάς μας να μπορούμε να αντισταθμίσουμε τις εγκόσμιες εργασίες και να επικεντρωθούμε σε άλλες ικανοποιητικές δραστηριότητες. Ωστόσο, όσο συναρπαστικό κι αν ακούγεται, τα LAM δεν είναι ακόμα έτοιμα.
Το πρώτο εμπορικό προϊόν που υποσχέθηκε να αξιοποιήσει το LAM (Rabbit r1) δεν τήρησε πλήρως την υπόσχεση μάρκετινγκ να εκτελέσει ενέργειες για λογαριασμό των χρηστών του. Η συσκευή απέτυχε τόσο άσχημα στο βασικό της σημείο πώλησης που πολλές κριτικές από πρώτο χέρι την περιέγραψαν ως αρκετά άχρηστη.
Ακόμη χειρότερα, μια έρευνα από τον YouTuber Coffeezilla, σε συνεργασία με μια επιλεγμένη ομάδα μηχανικών λογισμικού με πρόσβαση σε μέρος της βάσης Rabbit r1, διαπίστωσε ότι ο Rabbit χρησιμοποιούσε σενάρια Playwright για να εκτελέσει ενέργειες αντί για LAM. Έτσι, αντί για ένα μηχάνημα που εκτελούσε ένα μοναδικό μοντέλο τεχνητής νοημοσύνης, στην πραγματικότητα έτρεχε απλώς ένα σωρό δηλώσεις If > then. Πολύ μακριά από το υποσχεμένο μοντέλο LAM.
Αν υπάρχει κάτι που μπορείτε να αφαιρέσετε από το Rabbit r1, είναι ότι ναι, το όραμα είναι εκεί. Ωστόσο, πρέπει να γίνει δουλειά πριν από την εφαρμογή, οπότε μην ενθουσιαστείτε ακόμα. Μπορείτε να δείτε τώρα Ένας ολοκληρωμένος οδηγός για να ξεκινήσετε και να χρησιμοποιήσετε αποτελεσματικά το μοντέλο Llama 2.










