Το Grok 4.7 είναι το νέο frontier AI μοντέλο της SpaceXAI, με την εταιρεία να στρέφει ξεκάθαρα το ενδιαφέρον της σε coding, agentic εργασίες και απαιτητικό knowledge work. Η νέα έκδοση βασίζεται σε μεγαλύτερο μοντέλο από το Grok 4.6, έχει εκπαιδευτεί περισσότερο σε εργασίες μεγάλης διάρκειας και υπόσχεται καλύτερο self-verification χωρίς αύξηση της βασικής τιμής στο API.

Η κυκλοφορία του Grok 4.7 στις 21 Σεπτεμβρίου συνοδεύεται από επιθετική τοποθέτηση απέναντι στα κορυφαία μοντέλα της αγοράς. Η SpaceXAI υποστηρίζει ότι μπορεί να προσφέρει διπλάσια ταχύτητα και χαμηλότερο κόστος από συγκρίσιμα μοντέλα, όμως τα ίδια τα benchmarks που δημοσίευσε δείχνουν μια πιο σύνθετη εικόνα: σημαντική πρόοδο έναντι του Grok 4.6, αλλά όχι καθολική υπεροχή απέναντι σε GPT-5.6 Sol και Fable 5.1.

Μεγαλύτερο μοντέλο και περισσότερη εκπαίδευση

Η SpaceXAI δεν περιορίστηκε σε περαιτέρω tuning της προηγούμενης έκδοσης. Το Grok 4.7 χρησιμοποιεί νέο και μεγαλύτερο base model, χωρίς πάντως να δημοσιοποιείται αριθμός παραμέτρων.

Η reinforcement learning εκπαίδευσή του διήρκεσε περισσότερο και επικεντρώθηκε σε δυσκολότερα προβλήματα, με μεγαλύτερο βάρος σε εργασίες που μπορεί να χρειαστούν πολλές ώρες για να ολοκληρωθούν.

Στόχος είναι το μοντέλο να παραμένει λειτουργικό σε μεγάλα agent loops, να ελέγχει καλύτερα τα αποτελέσματά του και να διαχειρίζεται αποτελεσματικότερα μεγάλα context windows. Η εταιρεία αναφέρει επίσης ότι εκπαιδεύτηκε ειδικά ώστε να κατανοεί το Grok Bot harness, με στόχο καλύτερες επιδόσεις πέρα από το coding, όπως σε έγγραφα, παρουσιάσεις και γενικό knowledge work.

Ισχυρή άνοδος στο coding χωρίς καθολική πρωτιά

Στο CursorBench 4.0, το Grok 4.7 xhigh σημείωσε 46,3%, από 40,4% του Grok 4.6. Το Fable 5.1 Max παρέμεινε υψηλότερα με 51,8%, ενώ το GPT-5.6 Sol Max κατέγραψε 41,7%.

Στο DeepSWE v1.1 το νέο Grok έφτασε το 71% σε high effort, πολύ κοντά στο 72,7% του GPT-5.6 Sol και πάνω από το 70% του Fable 5.1.

Μεγαλύτερη πρόοδος εμφανίζεται στο Terminal-Bench 4.0, όπου το Grok 4.7 ανεβαίνει από το 20,3% της προηγούμενης έκδοσης στο 38%. Το αποτέλεσμα είναι ουσιαστική βελτίωση, αλλά το Fable 5.1 παραμένει αρκετά μπροστά με 57,9%.

Τα συγκεκριμένα αποτελέσματα προέρχονται από τις δοκιμές που δημοσίευσε η ίδια η SpaceXAI και επομένως χρειάζεται προσοχή όταν χρησιμοποιούνται για άμεσες συγκρίσεις μεταξύ εταιρειών.

Καλύτερο και σε επαγγελματικές εργασίες

Η SpaceXAI επιχειρεί ταυτόχρονα να τοποθετήσει το Grok 4.7 ως μοντέλο για επαγγελματική εργασία και όχι μόνο ως coding assistant.

Στο EEBench για electrical engineering σημειώνει 64%, έναντι 56,4% του Fable 5.1 και 39,4% του GPT-5.6 Sol. Στο Harvey Legal Agent Benchmark φτάνει το 19,6%, ενώ στο AA Briefcase, που αξιολογεί σύνθετες εργασίες γραφείου μεγάλης διάρκειας, καταγράφει score 1.657.

Στο HealthBench Professional για clinical reasoning η εικόνα αλλάζει, με το Grok 4.7 στο 56,7%, πίσω από το GPT-5.6 Sol στο 60,5% και το Fable 5.1 στο 62,1%.

Η εικόνα που προκύπτει είναι περισσότερο αυτή ενός ανταγωνιστικού all-around μοντέλου παρά ενός συστήματος που προηγείται σε κάθε κατηγορία.

500.000 tokens και τέσσερα επίπεδα reasoning

Grok 4.7 - Νέο AI μοντέλο για coding και knowledge work

Μέσω API, το Grok 4.7 υποστηρίζει context window έως 500.000 tokens, text και image input και text output. Διαθέτει τέσσερα επίπεδα reasoning – low, medium, high και xhigh – με το high να αποτελεί την προεπιλογή.

Για prompts έως 200.000 tokens, η βασική τιμή είναι 2 δολάρια ανά εκατομμύριο input tokens, 0,50 δολάρια για cached input και 6 δολάρια ανά εκατομμύριο output tokens.

Πάνω από τα 200.000 tokens ενεργοποιείται υψηλότερη τιμολόγηση, στα 4 δολάρια για input και 12 δολάρια για output. Υπάρχει επίσης Grok 4.7 Fast με περίπου διπλάσια ταχύτητα παραγωγής και διπλάσια χρέωση, αλλά η συγκεκριμένη έκδοση προσφέρεται μόνο μέσω Cursor και Grok Build.

Νέο βάρος στην ασφάλεια

Η SpaceXAI υποστηρίζει ότι το Grok 4.7 διαθέτει εντελώς νέο safeguard stack και καλύτερη αντίσταση σε jailbreaks.

Στο δικό της HackerBench v0.3, μόλις το 3,3% των επικίνδυνων dual-use prompts πέρασε τους μηχανισμούς προστασίας, ενώ στο LatchBio biosafety benchmark καταγράφεται score 62,4%.

Η εταιρεία αναφέρει παράλληλα ότι έχει αρχίσει να παρέχει σε επιλεγμένους συνεργάτες cybersecurity πρόσβαση στις red-team δυνατότητες του μοντέλου για αμυντική έρευνα.

Η μάχη μεταφέρεται σε τιμή και πραγματική παραγωγικότητα

Το Grok 4.7 είναι ήδη διαθέσιμο μέσω Cursor, Grok Build, του Grok API και τρίτων model platforms. Η στρατηγική της SpaceXAI είναι εμφανής: αντί να στηρίζεται αποκλειστικά στη διεκδίκηση της κορυφαίας θέσης σε benchmarks, προσπαθεί να συνδυάσει frontier επιδόσεις με επιθετική τιμολόγηση.

Το πραγματικό τεστ θα είναι η συμπεριφορά του σε πολύωρες εργασίες παραγωγής κώδικα, έρευνας και επαγγελματικής δημιουργίας, όπου το κόστος δεν εξαρτάται μόνο από την τιμή ανά token αλλά και από το πόσα tokens, tool calls και reasoning steps χρειάζεται τελικά το μοντέλο για να ολοκληρώσει σωστά μια εργασία.