Σε έναν κόσμο που βασίζεται όλο και περισσότερο σε βίντεο, τα εργαλεία δημιουργίας και επεξεργασίας βίντεο γίνονται πιο σημαντικά. Ωστόσο, η διαδικασία επεξεργασίας βίντεο εξακολουθεί να είναι πολύπλοκη και χρονοβόρα, ειδικά για αρχάριους.
Καθώς η ταχύτητα της ανάπτυξης της τεχνητής νοημοσύνης κινείται προς ένα σημείο πέρα από την ανθρώπινη κατανόηση, το Sora του OpenAI για τη μετατροπή προτροπών κειμένου σε βίντεο είναι απλώς η πιο πρόσφατη τεχνολογία τεχνητής νοημοσύνης που σοκάρει τον κόσμο για να συνειδητοποιήσει ότι τα πράγματα συμβαίνουν νωρίτερα από ό,τι περίμενε κανείς.
Το OpenAI Sora είναι μια καινοτόμος τεχνολογία που στοχεύει στη μετατροπή και την επεξεργασία βίντεο με αποτελεσματικό και καινοτόμο τρόπο. Αυτό το μοντέλο εγείρει ερωτήματα σχετικά με την έκταση του αντίκτυπού του στη βιομηχανία βίντεο και θα συμβάλει στην αλλαγή του τρόπου παραγωγής και επεξεργασίας του βίντεο για πάντα; Σε αυτό το άρθρο, θα εξερευνήσουμε την έννοια του OpenAI Sora και τις πιθανές δυνατότητές του, ρίχνοντας μια ματιά στο πώς θα επηρεάσει τη βιομηχανία βίντεο και τι θα μπορούσε να σημαίνει αυτή η καινοτομία τόσο για τους χρήστες όσο και για τους δημιουργούς. Επαληθεύω Καλύτερες γεννήτριες βίντεο AI (Κείμενο σε βίντεο).

Γρήγοροι σύνδεσμοι
Τι είναι το OpenAI Sora;
Όπως και άλλα μοντέλα παραγωγής τεχνητής νοημοσύνης όπως το DALL-E και το MidJourney, το Sora λαμβάνει μηνύματα κειμένου από εσάς και τα μετατρέπει σε οπτικό μέσο. Ωστόσο, σε αντίθεση με τις γεννήτριες εικόνων με τεχνητή νοημοσύνη που αναφέρθηκαν παραπάνω, η Sora δημιουργεί ένα βίντεο γεμάτο κίνηση, διαφορετικές γωνίες κάμερας, κατεύθυνση και οτιδήποτε άλλο θα περίμενε κανείς από ένα παραδοσιακά παραγόμενο βίντεο.

Βλέποντας τα παραδείγματα στο Ιστοσελίδα Sora, τα αποτελέσματα είναι συχνά δυσδιάκριτα από τα πραγματικά, επαγγελματικά βίντεο που παράγονται. Τα πάντα, από κορυφαίες λήψεις με drone έως πλήρεις παραγωγές ταινιών πολλών εκατομμυρίων δολαρίων με ηθοποιούς, δημιουργημένες από τεχνητή νοημοσύνη, ειδικά εφέ και τα έργα.

Φυσικά, η Sora δεν είναι η πρώτη τεχνολογία που το κάνει αυτό. Με διαφορά, ο πιο ορατός ηγέτης σε αυτόν τον τομέα ήταν RunwayML, η οποία παρέχει τις υπηρεσίες της στο κοινό έναντι αμοιβής. Ωστόσο, ακόμη και κάτω από τις καλύτερες συνθήκες, τα βίντεο του Runway είναι πιο κοντά στις πρώτες γενιές παρά Στατικές εικόνες MidJourney. Δεν υπάρχει σταθεροποίηση εικόνας, η φυσική δεν έχει νόημα, και καθώς γράφω αυτό το άρθρο, το μεγαλύτερο απόσπασμα είναι περίπου 16 δευτερόλεπτα.
Αντίθετα, η καλύτερη αξία που έχει να προσφέρει η Sora είναι η απόλυτη σταθερότητα, με φυσική που είναι σωστή (τουλάχιστον στον εγκέφαλό μας) και τα κλιπ μπορεί να διαρκούν έως και ένα λεπτό. Τα κλιπ είναι εντελώς χωρίς ήχο, αλλά υπάρχουν ήδη άλλα συστήματα AI που μπορούν Δημιουργήστε μουσική Ηχητικά εφέ και ομιλία. Επομένως, δεν έχω καμία αμφιβολία ότι αυτά τα εργαλεία μπορούν να ενσωματωθούν στη ροή εργασιών του Sora, ή στη χειρότερη, στην παραδοσιακή φωνητική φωνή και τη δουλειά του foley. Επαληθεύω Τα πιο ενδιαφέροντα και ενδιαφέροντα εργαλεία AI για να δείτε.
Δεν μπορεί να υπερεκτιμηθεί τι τεράστιο άλμα αντιπροσωπεύει η Sora από το εφιαλτικό βίντεο με τεχνητή νοημοσύνη ενός μόλις έτους πριν από την επίδειξη του Sora. Όπως το εξαιρετικά ανησυχητικό βίντεο AI του Ο Γουίλ Σμιθ τρώει μακαρόνια. Νομίζω ότι αυτό είναι μεγαλύτερο σοκ για το σύστημα από ό,τι όταν οι γεννήτριες εικόνων AI μετατράπηκαν από αστείο σε εντυπωσιακό υπαρξιακό τρόμο στις καρδιές των εικαστικών καλλιτεχνών.
Ο Sora πιθανότατα θα επηρεάσει ολόκληρη τη βιομηχανία βίντεο, από δημιουργούς μεμονωμένων λήψεων μέχρι το επίπεδο των έργων μεγάλου προϋπολογισμού από τη Disney και τη Marvel. Τίποτα δεν θα επιβιώσει από αυτό. Νομίζω ότι αυτό ισχύει ιδιαίτερα, καθώς η Sora δεν χρειάζεται να δημιουργεί πράγματα από ολόκληρα υφάσματα, αλλά μπορεί να εργαστεί με υπάρχοντα υλικά, όπως η κίνηση μιας ακίνητης εικόνας που έχετε δώσει. Αυτή θα μπορούσε να είναι η πραγματική αρχή της δημιουργίας ταινιών με τεχνητή νοημοσύνη.
Πώς λειτουργεί το Sora;
Θα εμβαθύνουμε στον χαρακτήρα του Sora όσο μπορούμε, αλλά δεν είναι δυνατόν να υπεισέλθουμε σε τόσες λεπτομέρειες. Πρώτον, το OpenAI κατά ειρωνικό τρόπο δεν είναι ανοιχτό σχετικά με τις εσωτερικές λειτουργίες της τεχνολογίας του. Είναι ιδιόκτητο, επομένως η μυστική σάλτσα που ξεχωρίζει τη Sora από τον ανταγωνισμό μας είναι άγνωστη στις λεπτομέρειες της. Δεύτερον, δεν είμαι επιστήμονας υπολογιστών και ίσως δεν είστε επιστήμονας υπολογιστών, επομένως μπορούμε να καταλάβουμε πώς λειτουργεί αυτή η τεχνολογία μόνο με γενικούς, γενικούς όρους.
Τα καλά νέα είναι ότι υπάρχει μια εξαιρετική περιγραφή του Sora (προστατεύεται η συνδρομή) από Μάικ Γιανγκ Σε Medium, με βάση Τεχνική έκθεση από το OpenAI Το οποίο έχει γίνει αναλυτικό για να το καταλάβουμε εμείς οι απλοί άνθρωποι. Ενώ και τα δύο έγγραφα αξίζει να διαβαστούν, μπορούμε να εξαγάγουμε τα πιο σημαντικά στοιχεία εδώ.
Το Sora βασίζεται στα μαθήματα που πήρε το OpenAI κατά τη δημιουργία μοντέλων όπως το ChatGPT ή το DALL-E. Το OpenAI επινόησε πώς να εκπαιδεύει το Sora σε δείγματα βίντεο τμηματοποιώντας αυτά τα βίντεο σε "patches" που είναι παρόμοια με τα "tokens" που χρησιμοποιούνται από το εκπαιδευτικό μοντέλο ChatGPT. Δεδομένου ότι αυτά τα διακριτικά έχουν όλα το ίδιο μέγεθος, πράγματα όπως το μήκος κλιπ, η αναλογία διαστάσεων και το μέγεθος ανάλυσης δεν έχουν σημασία για τη Sora.
Ο Sora χρησιμοποιεί την ίδια προσέγγιση ευρείας μετασχηματιστή που τροφοδοτεί το GPT σε συνδυασμό με τη μέθοδο διάδοσης που χρησιμοποιείται από γεννήτριες εικόνας AI. Κατά τη διάρκεια της προπόνησης, εξετάζει τα μερικώς διαδεδομένα patch token από ένα βίντεο και προσπαθεί να προβλέψει πώς θα έμοιαζε ένα διακριτικό χωρίς θόρυβο. Συγκρίνοντας αυτό με την πραγματική αλήθεια, το μοντέλο μαθαίνει τη «γλώσσα» του βίντεο. Γι' αυτό τα παραδείγματα από Ιστοσελίδα Sora Φαίνεται πολύ πρωτότυπο.
Εκτός από αυτή την εκπληκτική ικανότητα, ο Sora έχει επίσης πολύ λεπτομερείς ενσωματωμένους σχολιασμούς για τα καρέ βίντεο στα οποία έχει εκπαιδευτεί, γεγονός που είναι μεγάλος λόγος για τον οποίο μπορεί να επεξεργάζεται τα βίντεο που δημιουργεί με βάση τα μηνύματα κειμένου.
Η ικανότητα του Sora να προσομοιώνει με ακρίβεια τη φυσική σε βίντεο φαίνεται να είναι ένα αναδυόμενο χαρακτηριστικό, το οποίο προκύπτει απλώς από την εκπαίδευσή του σε εκατομμύρια βίντεο που περιέχουν κίνηση με βάση τη φυσική του πραγματικού κόσμου. Το Sora έχει εξαιρετική σταθερότητα αντικειμένου, έτσι ώστε όταν το αντικείμενο φεύγει από το πλαίσιο ή εμποδίζεται από κάτι άλλο μέσα στο πλαίσιο, παραμένει εκεί και επιστρέφει χωρίς καμία ενόχληση.
Ωστόσο, εξακολουθούν να υπάρχουν προβλήματα μερικές φορές όταν τα αντικείμενα στο βίντεο αλληλεπιδρούν με αιτιότητα και με αυτόματη δημιουργία αντικειμένων. Επίσης, κάπως αστείο, ο Σόρα φαίνεται να μπερδεύει κατά καιρούς δεξιά και αριστερά. Ωστόσο, ό,τι έχει αποδειχθεί μέχρι στιγμής όχι μόνο είναι πραγματικά αξιοποιήσιμο, αλλά σίγουρα βρίσκεται στην αιχμή της τεχνολογίας.
Πότε είναι προσβάσιμο το Sora;
Έτσι, είμαστε όλοι πολύ ενθουσιασμένοι που δοκιμάζουμε το Sora και μπορείτε να εγγυηθείτε ότι θα το χρησιμοποιήσω και θα γράψω για το πόσο καλή είναι αυτή η τεχνολογία όταν δεν μας δείχνει άμεσα αποτελέσματα, αλλά όταν μπορεί, θα συμβαίνει?
Μέχρι τη στιγμή που γράφεται αυτό το άρθρο, δεν είναι σαφές ακριβώς πόσος χρόνος θα περάσει μέχρι να γίνει διαθέσιμο το Sora στο ευρύ κοινό ή πόσο θα κοστίσει η πρόσβαση σε αυτό. Το OpenAI είπε ότι το μοντέλο βρίσκεται στα χέρια της «Κόκκινης Ομάδας», μιας ομάδας ανθρώπων των οποίων η δουλειά είναι να προσπαθήσουν να κάνουν τον Σόρα να κάνει όλα τα κακά πράγματα που δεν έπρεπε να κάνει και στη συνέχεια να βοηθήσουν να βάλουν προστατευτικά κιγκλιδώματα ενάντια σε αυτό το είδος. Το πράγμα συμβαίνει όταν οι πραγματικοί πελάτες μπορούν να το χρησιμοποιήσουν. Αυτό περιλαμβάνει τη δυνατότητα δημιουργίας παραπλανητικών πληροφοριών, δημιουργίας προσβλητικού ή προσβλητικού υλικού και πολλές άλλες παραβιάσεις που θα μπορούσε κανείς να φανταστεί.
Από τη στιγμή που γράφεται αυτό το άρθρο, βρίσκεται επίσης στα χέρια επιλεγμένων δημιουργών περιεχομένου, κάτι που πιστεύω ότι είναι για δοκιμαστικούς σκοπούς και για να λάβουμε κάποιες κριτικές και εγκρίσεις τρίτων ενώ βρισκόμαστε στο δρόμο για την τελική κυκλοφορία του.
Η ουσία είναι ότι στην πραγματικότητα δεν γνωρίζουμε πότε θα είναι διαθέσιμο, με τον ίδιο τρόπο που μπορείτε να πληρώσετε για να χρησιμοποιήσετε το DALL-E 3, και μάλιστα ακόμη και το OpenAI δεν έχει ακριβή ημερομηνία. Αυτό συμβαίνει απλώς και μόνο επειδή, εάν είναι στα χέρια των ελεγκτών ασφαλείας, ενδέχεται να ανακαλύψουν ζητήματα που χρειάζονται περισσότερο χρόνο από τον αναμενόμενο να επιλυθούν, γεγονός που θα καθυστερήσει τη δημόσια κυκλοφορία.
Το γεγονός ότι το OpenAI αισθάνεται έτοιμο να επιδείξει τον Sora και μάλιστα να κάνει κάποιες συντονισμένες δημόσιες αξιώσεις μέσω του Safety, κανείς δεν μπορεί να το πει με βεβαιότητα. Νομίζω ότι μιλάμε για μήνες, όχι για χρόνια, αλλά μην το περιμένετε την επόμενη εβδομάδα. Τώρα μπορείτε να δείτε Εργαλεία ηθικής τεχνητής νοημοσύνης για καλλιτέχνες και δημιουργούς.









