Η Google ανακοίνωσε το EmbeddingGemma 2 και μπορείς να κάνεις search ακόμα και μέσα σε video

Το EmbeddingGemma 2 είναι το νέο ανοιχτό embedding model της Google DeepMind και επιχειρεί να μεταφέρει ένα κρίσιμο κομμάτι της τεχνητής νοημοσύνης απευθείας σε smartphones, laptops και άλλες καταναλωτικές συσκευές.

Με 740 εκατ. παραμέτρους, μπορεί να μετατρέπει κείμενο, κώδικα, εικόνες, ήχο και video σε ένα κοινό σύστημα αριθμητικών αναπαραστάσεων, επιτρέποντας αναζήτηση και ανάκτηση περιεχομένου χωρίς να χρειάζεται απαραίτητα σύνδεση με το cloud.

Η σημαντική αλλαγή σε σχέση με την πρώτη γενιά είναι η εγγενής multimodal λειτουργία. Το αρχικό EmbeddingGemma επικεντρωνόταν στο κείμενο. Το EmbeddingGemma 2 μπορεί πλέον να κατανοήσει διαφορετικούς τύπους δεδομένων μέσα στον ίδιο χώρο embeddings, ανοίγοντας τον δρόμο για εφαρμογές όπου μια φράση μπορεί να εντοπίσει μια εικόνα, ένα voice memo να βρει ένα συγκεκριμένο σημείο σε video ή ένα text query να αναζητήσει μέσα σε ώρες ηχογραφήσεων.

Τι είναι στην πραγματικότητα ένα embedding model

Το EmbeddingGemma 2 δεν είναι chatbot και δεν λειτουργεί όπως ένα κλασικό generative AI model που παράγει απαντήσεις, εικόνες ή κώδικα.

Ο ρόλος του είναι να μετατρέπει το περιεχόμενο σε vectors – αριθμητικές αναπαραστάσεις που αποτυπώνουν τη σημασιολογική σχέση ανάμεσα σε διαφορετικά δεδομένα. Αν δύο στοιχεία έχουν παρόμοιο νόημα, τα embeddings τους βρίσκονται κοντά μεταξύ τους στον μαθηματικό χώρο.

Αυτό αποτελεί τη βάση για semantic search, recommendation systems, clustering και Retrieval-Augmented Generation. Το ενδιαφέρον εδώ είναι ότι το EmbeddingGemma 2 το κάνει ταυτόχρονα για text, code, εικόνες, audio και video μέσα σε κοινό vector space 768 διαστάσεων.

740 εκατ. παράμετροι αλλά δεν χρειάζονται πάντα όλες

Η Google έχει σχεδιάσει το μοντέλο με αρθρωτή αρχιτεκτονική.

Για εφαρμογές που χρησιμοποιούν αποκλειστικά text και code μπορούν να φορτωθούν περίπου 270 εκατ. παράμετροι. Η προσθήκη vision ανεβάζει το σύνολο στα 440 εκατ., ενώ text και audio απαιτούν περίπου 570 εκατ. Το πλήρες multimodal configuration φτάνει τα 740 εκατ. παραμέτρους.

Αυτό έχει ιδιαίτερη σημασία για mobile και edge εφαρμογές, όπου η διαθέσιμη μνήμη και η κατανάλωση ενέργειας είναι κρίσιμοι παράγοντες.

Με quantization, η Google αναφέρει ότι σε Pixel 11 Pro το text-only configuration μπορεί να λειτουργήσει με περίπου 191 MB ενεργής RAM, ενώ το πλήρες EmbeddingGemma 2 απαιτεί περίπου 567 MB.

Αναζήτηση χωρίς να φεύγουν τα δεδομένα από τη συσκευή

Το σημαντικότερο πλεονέκτημα του μοντέλου βρίσκεται πιθανότατα στο privacy-first on-device AI.

Ένα smartphone θα μπορούσε, για παράδειγμα, να επιτρέπει στον χρήστη να γράψει «βρες το video όπου κάποιος παίζει κιθάρα δίπλα στη θάλασσα» και να αναζητήσει το συγκεκριμένο clip μέσα στην προσωπική βιβλιοθήκη χωρίς οι φωτογραφίες και τα videos να ανεβαίνουν σε κάποιον server.

Αντίστοιχα, μια εφαρμογή θα μπορούσε να αναζητά μέσα σε ηχογραφήσεις χρησιμοποιώντας απλό κείμενο ή να εντοπίζει συγκεκριμένες στιγμές ενός video μέσω μιας ηχητικής περιγραφής.

Η τοπική επεξεργασία μειώνει παράλληλα το latency και επιτρέπει ορισμένες λειτουργίες ακόμη και χωρίς σύνδεση στο Internet.

8K context και μικρότερο κόστος αποθήκευσης

Το EmbeddingGemma 2 διαθέτει context window 8.192 tokens, τετραπλάσιο από εκείνο της προηγούμενης γενιάς.

Το διαθέσιμο context μπορεί να αντιστοιχεί, ανάλογα με το είδος του περιεχομένου, σε περίπου 5,5 λεπτά audio, 29 εικόνες ή 58 video frames. Διαφορετικοί τύποι δεδομένων μπορούν επίσης να συνδυάζονται στο ίδιο input.

Παράλληλα, η Google χρησιμοποιεί Matryoshka Representation Learning. Τα embeddings παράγονται αρχικά σε 768 διαστάσεις, αλλά μπορούν να περιοριστούν σε 512, 256 ή ακόμη και 128.

Η τεχνική αυτή μπορεί να μειώσει έως και έξι φορές τον χώρο που απαιτεί μια τοπική vector database, κάτι ιδιαίτερα χρήσιμο σε smartphones και άλλες συσκευές με περιορισμένη αποθήκευση.

Μεγάλο άλμα και στην αναζήτηση κώδικα

Η Google δίνει ιδιαίτερη έμφαση και στο code retrieval.

Στο MTEB Code, το νέο μοντέλο ανεβαίνει από επίδοση 68,76 της προηγούμενης γενιάς σε 78,68. Αυτό το κάνει ενδιαφέρον για semantic code search, indexing ολόκληρων codebases και AI coding agents που χρειάζονται να εντοπίζουν γρήγορα το σχετικό κομμάτι κώδικα πριν προχωρήσουν σε reasoning ή generation.

Το ίδιο μοντέλο μπορεί επομένως να λειτουργήσει ως retrieval layer πριν από ένα μεγαλύτερο generative model.

Το on-device RAG γίνεται πιο πρακτικό

Εδώ βρίσκεται ίσως η μεγαλύτερη στρατηγική σημασία του EmbeddingGemma 2.

Σε συνδυασμό με μοντέλα της οικογένειας Gemma 4, μπορεί να δημιουργήσει πλήρως τοπικά RAG pipelines. Το EmbeddingGemma 2 εντοπίζει τα κατάλληλα αρχεία ή δεδομένα και το generative model αναλαμβάνει στη συνέχεια να τα αναλύσει και να παράγει την απάντηση.

Επειδή μάλιστα τα δύο μοντέλα μοιράζονται ορισμένα αρχιτεκτονικά στοιχεία, όπως τον text tokenizer και το audio encoder, η συνολική απαίτηση μνήμης μπορεί να περιοριστεί.

Το EmbeddingGemma 2 διατίθεται με άδεια Apache 2.0 και τα weights του είναι διαθέσιμα για developers. Η πραγματική του σημασία, όμως, δεν βρίσκεται μόνο στα benchmarks. Βρίσκεται στην προσπάθεια της Google να κάνει το multimodal semantic search και το RAG λειτουργίες που μπορούν να εκτελούνται απευθείας στη συσκευή – γρήγορα, offline και χωρίς κάθε προσωπικό αρχείο να χρειάζεται να περάσει πρώτα από το cloud.