Το Gemini Omni 1.1 Flash επιχειρεί να λύσει ένα από τα δυσκολότερα προβλήματα της παραγωγής βίντεο με τεχνητή νοημοσύνη: το πώς διαδοχικά πλάνα μοιάζουν πράγματι ότι ανήκουν στο ίδιο βίντεο. Η Google παρουσίασε τη νέα έκδοση του γενετικού της μοντέλου βίντεο, δίνοντας σε δημιουργούς και προγραμματιστές σαφώς μεγαλύτερο έλεγχο σε ό,τι συμβαίνει ανάμεσα στο πρώτο και στο τελευταίο καρέ.
Η σημαντικότερη αλλαγή αφορά τη μνήμη του μοντέλου. Το νέο μοντέλο μπορεί να αναλύσει έως δέκα δευτερόλεπτα προηγούμενου υλικού για να συνεχίσει μια σκηνή, όταν οι προηγούμενες εκδόσεις βασίζονταν αποκλειστικά στο τελευταίο δευτερόλεπτο. Η διαφορά είναι ουσιαστική: αντί να μαντεύει τι πρέπει να ακολουθήσει, το σύστημα διατηρεί σαφώς καλύτερη συνέπεια σε χαρακτήρες, περιβάλλοντα και συνολική κατεύθυνση της αφήγησης.

Επέκταση σκηνών έως τα 40 δευτερόλεπτα
Η δυνατότητα επέκτασης επιτρέπει τη συνέχιση ενός υπάρχοντος βίντεο από το σημείο όπου σταμάτησε, χωρίς ορατή ασυνέχεια. Τα βίντεο μπορούν να επεκταθούν σε τμήματα των δέκα δευτερολέπτων, φτάνοντας συνολική διάρκεια έως 40 δευτερόλεπτα.
Ο αριθμός αυτός μπορεί να μη φαίνεται εντυπωσιακός σε σύγκριση με μια συμβατική παραγωγή, αλλά αλλάζει ουσιαστικά τα δεδομένα για το είδος. Ανοίγει τον δρόμο για σεκάνς με πραγματική αρχή, μέση και τέλος, αντί για μεμονωμένα, αποσπασματικά πλάνα λίγων δευτερολέπτων που δύσκολα συνθέτουν αφήγηση.

Έλεγχος πρώτου και τελευταίου καρέ
Εξίσου χρήσιμη είναι η δυνατότητα καθορισμού τόσο του αρχικού όσο και του τελικού καρέ ενός πλάνου, με το σύστημα να παράγει όλο το ενδιάμεσο υλικό που τα συνδέει. Πρόκειται για λειτουργία ιδανική για σύνθετες κινήσεις κάμερας γύρω από ένα αντικείμενο, για ομαλά zoom ανάμεσα σε δύο συνθέσεις ή για τη δημιουργία κλιπ σχεδιασμένων να επαναλαμβάνονται χωρίς εμφανές άλμα.
Στην ίδια λογική κινείται και η υποστήριξη αναφορών βίντεο. Ο δημιουργός μπορεί να τροφοδοτήσει το μοντέλο με έως τρία δευτερόλεπτα υπάρχοντος υλικού, προσφέροντας επιπλέον οπτικό πλαίσιο. Σύμφωνα με την εταιρεία, αυτό βοηθά στη διατήρηση στοιχείων όπως η εμφάνιση ενός χαρακτήρα ανάμεσα σε διαφορετικές παραγόμενες σκηνές.

Δοκιμές σε χαμηλή ανάλυση και τελικό υλικό σε 4K
Μία από τις πιο πρακτικές προσθήκες αναγνωρίζει κάτι απλό: δεν χρειάζεται κάθε πειραματισμός να ξεκινά από τη μέγιστη ποιότητα. Οι προγραμματιστές μπορούν πλέον να παράγουν προεπισκοπήσεις σε ανάλυση 360p, οι οποίες σύμφωνα με την εταιρεία είναι έως 60% ταχύτερες από την τυπική έξοδο 720p και κοστίζουν περίπου το ένα τρίτο.
Αυτό διευκολύνει τη γρήγορη δοκιμή ιδεών, την προσαρμογή των prompts και την επεξεργασία πολλαπλών εκδοχών πριν δαπανηθεί χρόνος και κόστος στο τελικό αποτέλεσμα. Μόλις το αποτέλεσμα κριθεί ικανοποιητικό, το μοντέλο παράγει υλικό σε 1080p ή αναβαθμίζει το ολοκληρωμένο βίντεο έως τα 4K, έτοιμο για επαγγελματική χρήση.
Πού είναι διαθέσιμο
Η διάθεση γίνεται σε πολλαπλά επίπεδα. Οι προγραμματιστές έχουν πρόσβαση μέσω του Gemini API στο Google AI Studio, ενώ οι επιχειρήσεις μπορούν να αξιοποιήσουν το μοντέλο μέσα από την εταιρική πλατφόρμα Agent Platform. Παράλληλα, η εταιρεία έχει δημοσιεύσει τεκμηρίωση και οδηγούς για την ενσωμάτωση των νέων λειτουργιών σε εφαρμογές τρίτων.
Δεν απαιτείται ωστόσο ανάπτυξη εφαρμογής για να δοκιμάσει κανείς τις δυνατότητες αυτές. Το μοντέλο διατίθεται παγκοσμίως μέσα από το Google Flow σε όλους τους συνδρομητές AI Plus, Pro και Ultra, ενώ η επέκταση σκηνών φτάνει και απευθείας στην εφαρμογή Gemini για τους ίδιους συνδρομητές – καθιστώντας μία από τις πιο ενδιαφέρουσες λειτουργίες σαφώς πιο εύκολα προσβάσιμη στο ευρύ κοινό.

Τι σηματοδοτεί η αναβάθμιση
Η κατεύθυνση της αναβάθμισης είναι ενδεικτική της ωρίμανσης ολόκληρης της κατηγορίας. Το ζητούμενο δεν είναι πλέον η εντυπωσιακή μεμονωμένη εικόνα, αλλά ο έλεγχος: η δυνατότητα του δημιουργού να καθορίζει πού ξεκινά και πού καταλήγει ένα πλάνο, να διατηρεί συνέπεια ανάμεσα σε σκηνές και να δουλεύει με λογική παραγωγής και όχι τυχαιότητας. Είναι ακριβώς τα στοιχεία που χωρίζουν ένα εντυπωσιακό demo από ένα εργαλείο που μπορεί πραγματικά να ενταχθεί σε επαγγελματική ροή εργασίας.

