Gemini 3.8 Live: Η Google κάνει τη συνομιλία με την AI πιο φυσική και πολύ πιο έξυπνη

Το Gemini 3.8 Live είναι η νέα προσπάθεια της Google να κάνει τη συνομιλία με την τεχνητή νοημοσύνη να μοιάζει λιγότερο με εντολές προς έναν ψηφιακό βοηθό και περισσότερο με φυσικό διάλογο με έναν συνεργάτη που ακούει, καταλαβαίνει τι βλέπεις και μπορεί να εκτελεί εργασίες ενώ συνεχίζεις να του μιλάς.

Η Google παρουσίασε δύο νέα μοντέλα: το Gemini 3.8 Live, που έχει σχεδιαστεί για γρήγορη και οικονομική χρήση σε μεγάλη κλίμακα, και το Gemini 3.8 Live Extended Thinking, το οποίο αφιερώνει περισσότερη υπολογιστική ισχύ σε σύνθετα προβλήματα και εργασίες που απαιτούν πολλά βήματα. Και τα δύο προορίζονται τόσο για απλούς χρήστες όσο και για developers και επιχειρήσεις που θέλουν να δημιουργήσουν voice agents.

Τι νέο φέρνει το Gemini 3.8 Live

Η βασική διαφορά βρίσκεται στον τρόπο που χειρίζεται τη ζωντανή συνομιλία.

Η Google θέλει το AI να μπορεί να ακούει, να καταλαβαίνει το περιβάλλον και να εκτελεί ενέργειες χωρίς η συζήτηση να σταματά κάθε φορά που αναλαμβάνει μια εργασία.

Οι σημαντικότερες νέες δυνατότητες είναι:

  • Συνεχίζει να μιλά ενώ εκτελεί μια εργασία: μπορεί να χρησιμοποιεί εργαλεία ή APIs στο παρασκήνιο χωρίς να «παγώνει» η συνομιλία.
  • Καταλαβαίνει εικόνα και ήχο μαζί: μπορεί να βλέπει live εικόνα από κάμερα και να χρησιμοποιεί όσα βλέπει για να απαντήσει πιο σωστά.
  • Αλλάζει γλώσσα αυτόματα: αναγνωρίζει και χρησιμοποιεί έως 97 γλώσσες, ακόμη και όταν αλλάζεις γλώσσα μέσα στην ίδια συζήτηση.
  • Καταλαβαίνει καλύτερα αριθμούς και κωδικούς: μπορεί να χειρίζεται με μεγαλύτερη ακρίβεια αριθμούς παραγγελιών, κωδικούς επιβεβαίωσης και τεχνικά στοιχεία.
  • Μπορεί να κάνει πολλά πράγματα ταυτόχρονα: για παράδειγμα να συνεχίζει τη συνομιλία ενώ ψάχνει πληροφορίες ή καλεί μια υπηρεσία.
  • Δίνει ενημέρωση όσο δουλεύει: το Extended Thinking μπορεί να εξηγεί ότι εξετάζει κάτι και να δίνει μικρές ενημερώσεις καθώς προχωρά σε μια σύνθετη εργασία.

Το Extended Thinking για τις δύσκολες εργασίες

Το Gemini 3.8 Live Extended Thinking είναι η πιο ισχυρή από τις δύο εκδόσεις. Δεν προορίζεται απλώς για ερωτήσεις τύπου «τι καιρό θα κάνει αύριο;». Η Google το σχεδιάζει για εργασίες που απαιτούν περισσότερη σκέψη, πολλά βήματα και συνδυασμό διαφορετικών πληροφοριών. Για παράδειγμα, ένας χρήστης θα μπορούσε να του ζητήσει με τη φωνή να εξετάσει ένα πρόγραμμα, να βρει διαθέσιμες ώρες, να συγκρίνει επιλογές και να προτείνει την καλύτερη λύση.

Το σημαντικό είναι ότι το μοντέλο δεν χρειάζεται να σιωπά μέχρι να ολοκληρώσει όλη τη διαδικασία.Μπορεί να απαντήσει άμεσα, να εξηγήσει ότι ξεκινά τον έλεγχο και να συνεχίσει τη συζήτηση ενώ επεξεργάζεται τα επόμενα βήματα. Η Google θεωρεί ότι αυτό κάνει το voice AI πολύ πιο φυσικό στην καθημερινή χρήση.

Gemini 3.8 Live: Η Google κάνει τη συνομιλία με την AI πιο φυσική και πολύ πιο έξυπνη
Photo by google
Βλέπει και ακούει σχεδόν σε πραγματικό χρόνο

Το Gemini 3.8 Live δεν περιορίζεται στη φωνή. Μπορεί να επεξεργάζεται visual input σχεδόν σε πραγματικό χρόνο, κάτι που επιτρέπει στον χρήστη να δείχνει ένα αντικείμενο, μια οθόνη ή ένα πρόβλημα μέσω κάμερας και να συζητά για αυτό χωρίς να ανεβάζει ξεχωριστά φωτογραφίες. Αυτό ανοίγει τον δρόμο για πιο πρακτικούς AI assistants.

Ένας τεχνικός θα μπορούσε να δείξει ένα μηχάνημα και να ζητήσει βοήθεια. Ένας χρήστης θα μπορούσε να δείξει ένα προϊόν ή ένα έγγραφο και να ρωτήσει τι βλέπει. Ένας voice agent εξυπηρέτησης θα μπορούσε να συνδυάζει αυτά που ακούει με οπτικές πληροφορίες.

Το AI γίνεται έτσι περισσότερο multimodal και λιγότερο ένα απλό chatbot που μιλά.

Πού θα είναι διαθέσιμο

Το Gemini 3.8 Live αρχίζει να διατίθεται μέσω Gemini API και Google AI Studio για developers. Η Google το φέρνει επίσης στο Search Live, ενώ επιχειρήσεις θα μπορούν να το δοκιμάσουν μέσω Gemini Enterprise. Το Gemini 3.8 Live Extended Thinking έρχεται επίσης σε Gemini API και Google AI Studio, αλλά θα εμφανιστεί και στο Gemini Live για απλούς χρήστες. Παράλληλα θα είναι διαθέσιμο σε επιλεγμένες λειτουργίες του Google Workspace, μεταξύ άλλων σε Docs, Gmail και Keep, ανάλογα με το συνδρομητικό πρόγραμμα.

SynthID και AI-generated φωνή

Η Google προσθέτει και ένα σημαντικό μέτρο διαφάνειας. Όλο το audio που δημιουργείται από τα συγκεκριμένα AI συστήματα φέρει SynthID watermark. Το watermark δεν ακούγεται από τον άνθρωπο, αλλά μπορεί να χρησιμοποιηθεί για να αναγνωριστεί ότι το audio δημιουργήθηκε από AI. Η Google θέλει έτσι να περιορίσει την πιθανότητα χρήσης των νέων voice models για παραπληροφόρηση ή παραπλανητικό περιεχόμενο.

Gemini 3.8 Live: Η Google κάνει τη συνομιλία με την AI πιο φυσική και πολύ πιο έξυπνη

Γιατί έχει σημασία

Το Gemini 3.8 Live δείχνει προς τα πού πηγαίνουν οι AI assistants. Το επόμενο βήμα δεν είναι απλώς να δίνουν καλύτερες απαντήσεις. Είναι να μπορούν να μιλούν φυσικά, να βλέπουν τι βλέπει ο χρήστης, να χειρίζονται εργαλεία και να ολοκληρώνουν πραγματικές εργασίες χωρίς να διακόπτεται η συνομιλία. Αν αυτή η εμπειρία λειτουργήσει όπως την περιγράφει η Google, η μεγάλη αλλαγή δεν θα είναι ότι το Gemini «μιλά καλύτερα».

Θα είναι ότι αρχίζει να λειτουργεί περισσότερο σαν πραγματικός ψηφιακός συνεργάτης και λιγότερο σαν chatbot που περιμένει την επόμενη εντολή.