Επιστροφή στις Ειδήσεις
ΠροϊόνAI Understanding ενημέρωση

Η DeepSeek δημοσιεύει το πειραματικό μοντέλο V4 Flash με δυνατότητες όρασης

Η DeepSeek δημοσίευσε το DeepSeek-V4-Flash-Vision-Exp, ένα πειραματικό πολυτροπικό μοντέλο που προσθέτει οπτικές μονάδες στην αρχιτεκτονική του V4-Flash και αναφέρει βελτιωμένη απόδοση σε πολλά σημεία αναφοράς οπτικών πρακτόρων.

5 min readRead the primary source
Source-provided image accompanying DeepSeek publishes experimental V4 Flash model with vision capabilities
Έγγραφο κύριας πηγήςΗ πηγή καταγράφηκε
Εκδότης
huggingface.co
Σύνδεσμος πηγής
huggingface.cohttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Τύπος πηγής
Κύριο έγγραφο — μια επίσημη ανακοίνωση, χαρτί, αρχειοθέτηση ή σελίδα πρώτου μέρους που διαβάζουμε απευθείας.
ΠλαίσιοΚαταλάβετε αυτό σε 60 δευτερόλεπτα

Ξεκινήστε εδώ

Βασικοί όροι

Μνήμη (μνήμη πράκτορα)
Το αποθηκευμένο πλαίσιο που χρησιμοποιεί ένας πράκτορας τεχνητής νοημοσύνης σε βήματα ή περιόδους σύνδεσης για να βελτιώσει τη συνέχεια.
κερδοσκοπική αποκωδικοποίηση
Μια μέθοδος επιτάχυνσης συμπερασμάτων όπου ένα μικρό πρόχειρο μοντέλο προτείνει διακριτικά που ένα μεγαλύτερο μοντέλο επαληθεύει παράλληλα.
Πολυτροπικό μοντέλο
Ένα μοντέλο που μπορεί να επεξεργαστεί ή να δημιουργήσει πολλούς τύπους δεδομένων όπως κείμενο, εικόνα και ήχος.
Δοκιμάστε τον εαυτό σαςΕξηγημένο Κουίζ Μοντέλων AI

Τι έγινε

Το DeepSeek δημοσίευσε το DeepSeek-V4-Flash-Vision-Exp στο Hugging Face ως το πρώτο πειραματικό πολυτροπικό μοντέλο της στην οικογένεια DeepSeek-V4. Η κάρτα μοντέλου λέει ότι προσθέτει οπτικές ενότητες και συνεχή εκπαίδευση στην αρχιτεκτονική DeepSeek-V4-Flash, με αναφερόμενα κέρδη στις εργασίες πολυτροπικών πρακτόρων, διατηρώντας παράλληλα συγκρίσιμες επιδόσεις σε εργασίες πρακτόρων μόνο κειμένου.

Η εγγραφή Hugging Face προσδιορίζει το DeepSeek-V4-Flash-Vision-Exp ως μοντέλο εικόνας κειμένου σε κείμενο χρησιμοποιώντας Transformers. Η κάρτα μοντέλου του το περιγράφει ως το πρώτο πειραματικό πολυτροπικό μοντέλο του DeepSeek στην οικογένεια V4. Ο δηλωμένος σχεδιασμός συνδυάζει την αρχιτεκτονική DeepSeek-V4-Flash με οπτικές ενότητες και συνεχή εκπαίδευση που προορίζεται να ξεκλειδώσει τις δυνατότητες οπτικής κατανόησης. Το αποθετήριο δημιουργήθηκε στις 31 Αυγούστου 2026 και το αρχείο δείχνει μια μεταγενέστερη ενημέρωση την 1η Σεπτεμβρίου.

Η κάρτα μοντέλου αναφέρει βελτιώσεις σε σχέση με το DeepSeek-V4-Flash-0731 σε διάφορες αξιολογήσεις πολυτροπικών πρακτόρων. Αναφέρει βαθμολογία ApexBench Pass@1 36,5 έναντι 26,2 για το προηγούμενο μοντέλο, βαθμολογία Agents’ Last Exam 27,3 έναντι 25,2, βαθμολογία Chartography 64,3 και ZeroBench Pass@5 βαθμολογία 35,0. Η κάρτα συγκρίνει επίσης το νέο μοντέλο με το Opus-4.8, το οποίο αναφέρει στο 39,4 στο ApexBench, στο 25,7 στο Agents’ Last Exam, στο 65,0 στο Chartography και στο 34,0 στο ZeroBench.

Για εργασίες αντιπροσώπου κειμένου, η κάρτα μοντέλου αναφέρει το 83.9 στο Terminal Bench 2.1, το 57.7 στο NL2Repo, το 75.3 στο Cybergym, το 59.3 στο DeepSWE, το 75.9 στο Toolathlon-Verified, το 63.6 στο DSBench-Hard και το 25.Bench. Η κάρτα λέει ότι το νέο μοντέλο διατηρεί συγκρίσιμες επιδόσεις μέσω κειμένου μόνο με το DeepSeek-V4-Flash-0731, ενώ σημειώνει ότι το προηγούμενο μοντέλο αγνόησε στοιχεία πολλαπλών τρόπων στις εισόδους ApexBench και Agents' Last Exam.

Το αποθετήριο περιλαμβάνει αρχεία tokenizer, αναφορές κωδικοποίησης εντολών και μια ελάχιστη υλοποίηση συμπερασμάτων PyTorch που καλύπτει τον κωδικοποιητή όρασης και τον ευθυγραμμιστή, την προσοχή του DFlash, τα στοιχεία mix-of-experts, τις Hyper-Connections και την εμπρός διαδρομή DSpark. Η κάρτα μοντέλου παρέχει οδηγίες για Transformers, vLLM, Docker, SGLang και Docker Model Runner. Το παράδειγμά του SGLang προσδιορίζει τον παραλληλισμό τανυστών των τεσσάρων και την κερδοσκοπική αποκωδικοποίηση DSpark. Τα ορατά μεταδεδομένα απαριθμούν 305 δισεκατομμύρια παραμέτρους και το αποθετήριο έχει άδεια χρήσης από το MIT.

Στοιχεία πηγής: huggingface.co ↗

Γιατί έχει σημασία

Η έκδοση δίνει στους ερευνητές και τους προγραμματιστές πρόσβαση σε ένα μεγάλο μοντέλο με άδεια MIT σχεδιασμένο για αλληλεπίδραση εικόνας και κειμένου και ροές εργασίας αντιπροσώπων. Η πρακτική χρησιμότητά του παραμένει αβέβαιη επειδή οι αναφερόμενες αξιολογήσεις προέρχονται από την κάρτα μοντέλου, επισημαίνονται ως μη επαληθευμένες και το μοντέλο δεν αναπτύσσεται από πάροχο συμπερασμάτων.

Αυτή η έκδοση είναι σημαντική επειδή η όραση είναι ο άμεσος σκοπός του μοντέλου και όχι ένα τυχαίο χαρακτηριστικό. Η κάρτα μοντέλου τοποθετεί το DeepSeek-V4-Flash-Vision-Exp για δυνατότητες multimodal agent, δηλαδή εργασίες που απαιτούν ένα σύστημα AI να ερμηνεύει οπτικές εισόδους παράλληλα με τη γλώσσα και να ενεργεί εντός ενός πλαισίου αξιολόγησης. Αυτό επεκτείνει τον τύπο εισόδου που προορίζεται να χειριστεί η οικογένεια V4-Flash, αν και η πηγή δεν καθορίζει πόσο καλά αποδίδει το μοντέλο σε συνηθισμένα προϊόντα ή ρυθμίσεις υψηλού πονταρίσματος.

Το αποθετήριο καθιστά το μοντέλο δυνητικά χρήσιμο για προγραμματιστές που θέλουν να επιθεωρήσουν, να προσαρμόσουν ή να εκτελέσουν ένα πειραματικό πολυτροπικό σύστημα. Η άδεια MIT, οι αναφορές κωδικοποίησης εντολών, τα αρχεία του tokenizer, ο κώδικας συμπερασμάτων και τα παραδείγματα παρέχουν περισσότερο υλικό υλοποίησης παρά μόνο μια ανακοίνωση προϊόντος. Ταυτόχρονα, η πηγή λέει ότι τα μεγάλα θραύσματα του μοντέλου περιγράφονται από ένα ευρετήριο και δεν αναπαράγονται μέσα στο ταμείο της πηγής που χρησιμοποιείται για τη συναρμολόγηση του αποθετηρίου. Το μέγεθος του μοντέλου και η αναφερόμενη διαμόρφωση SGLang πολλαπλών GPU υποδεικνύουν ότι η ανάπτυξη μπορεί να είναι απαιτητική, αλλά η πηγή δεν παρέχει πραγματικό κόστος υλικού, καθυστέρηση ή απαιτήσεις μνήμης.

Τα αναφερόμενα αποτελέσματα υποδεικνύουν μια συγκεκριμένη αντιστάθμιση: η DeepSeek διεκδικεί σημαντικά κέρδη σε δείκτες αναφοράς πολυτροπικών πρακτόρων χωρίς να εγκαταλείπει συγκρίσιμες επιδόσεις πρακτόρων κειμένου. Αυτοί οι ισχυρισμοί θα πρέπει να αντιμετωπίζονται ως αποτελέσματα καρτών-μοντέλων και όχι ως ανεξάρτητα τεκμηριωμένα γεγονότα. Τα αρχεία αξιολόγησης προσδιορίζουν το μοντέλο κάρτας ως την πηγή τους και επισημαίνουν τα αποτελέσματα ως μη επαληθευμένα. Οι συγκρίσεις είναι επίσης ελλιπείς κατά τόπους: ορισμένες βαθμολογίες πολυτροπικών προηγούμενων μοντέλων επισημαίνονται με μια σημείωση που εξηγεί ότι το μοντέλο αγνόησε οπτικά στοιχεία, ενώ ορισμένα κελιά αναφοράς δεν περιέχουν αποτέλεσμα παλαιότερου μοντέλου.

Επομένως, ο δημόσιος αντίκτυπος εξαρτάται από την επαλήθευση και τη χρηστικότητα. Εάν οι ανεξάρτητες δοκιμές επιβεβαιώσουν τα αναφερόμενα κέρδη οπτικού παράγοντα και η υλοποίηση μπορεί να εκτελεστεί από περισσότερους ερευνητές, η έκδοση θα μπορούσε να διευρύνει την πρόσβαση σε ένα ικανό ανοιχτό μοντέλο για πειραματισμό εικόνας και κειμένου. Η πηγή δεν καθορίζει την προέλευση των δεδομένων εκπαίδευσης, τις αξιολογήσεις ασφάλειας, τη συμπεριφορά άρνησης, την προστασία του απορρήτου, την εμπορική υποστήριξη ή την καταλληλότητα για επακόλουθες αποφάσεις. Αυτές οι παραλείψεις περιορίζουν το συμπέρασμα που μπορεί να συναχθεί υπεύθυνα μόνο από την έκδοση.

Interactive Mechanism

Διαδραστικός Μηχανισμός: Πώς λειτουργεί στην πραγματικότητα

Εξερευνήστε την υποκείμενη τεχνολογία πίσω από αυτήν την εξέλιξη διαδραστικά.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Διαδραστικός Έλεγχος Έννοιας+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Τι να παρακολουθήσετε στη συνέχεια

Τα κύρια ερωτήματα είναι εάν οι ανεξάρτητες αξιολογήσεις αναπαράγουν τα αποτελέσματα του DeepSeek, πόσο υλικό και μηχανική απαιτεί το μοντέλο στην πράξη και εάν η πειραματική υλοποίηση του αποθετηρίου γίνεται πιο εύκολη στην ανάπτυξη. Οι χρήστες θα πρέπει επίσης να αναζητούν πληρέστερες πληροφορίες σχετικά με τα δεδομένα, τις δοκιμές ασφαλείας και την απόδοση εκτός των αναφερόμενων σημείων αναφοράς.

Η διαθεσιμότητα είναι μια άμεση πρακτική ερώτηση. Η σελίδα Hugging Face λέει ότι το μοντέλο δεν έχει αναπτυχθεί από κανέναν πάροχο συμπερασμάτων και το στιγμιότυπο της πηγής δείχνει μηδενικές λήψεις. Αντίθετα, οι χρήστες κατευθύνονται προς τοπικές ή αυτοδιαχειριζόμενες διαδρομές, όπως Transformers, vLLM, SGLang, Docker και Docker Model Runner. Οι μελλοντικές ενημερώσεις ενδέχεται να διευκρινίσουν εάν η φιλοξενούμενη πρόσβαση είναι διαθέσιμη, εάν η ελάχιστη διαδρομή συμπερασμάτων έχει ολοκληρωθεί και ποιες διαμορφώσεις υλικού είναι ρεαλιστικές πέρα ​​από το παράδειγμα tensor-parallel-four.

Η ανεξάρτητη αναπαραγωγή θα πρέπει να επικεντρωθεί στους πολυτροπικούς ισχυρισμούς και σε δίκαιες συγκρίσεις με το προηγούμενο μοντέλο. Οι αξιολογητές θα πρέπει να λάβουν υπόψη τη σημείωση της πηγής ότι το DeepSeek-V4-Flash-0731 αγνόησε οπτικά στοιχεία σε δύο δοκιμές που αναφέρονται. Θα πρέπει επίσης να εξετάσουν τη μη επαληθευμένη κατάσταση των αποτελεσμάτων της κάρτας μοντέλου, να αναφέρουν τις ακριβείς προτροπές και τις ρυθμίσεις πλαισίου και να ελέγξουν εάν η απόδοση ισχύει σε εικόνες, γλώσσες, εργασίες και περιπτώσεις αποτυχίας που δεν αντιπροσωπεύονται από τον δημοσιευμένο πίνακα.

Η πειραματική κατάσταση της κυκλοφορίας απαιτεί την προσοχή στις μηχανικές αλλαγές. Το αποθετήριο διαχωρίζει τη μορφοποίηση άμεσης από το συμπέρασμα PyTorch, υποστηρίζει τόσο μπλοκ περιεχομένου JSON τύπου OpenAI και συμπαγή σημειογραφία κειμένου, καθώς και μετατροπή σημείων ελέγχου εγγράφων. Οι ενημερώσεις σε αυτά τα στοιχεία θα μπορούσαν να επηρεάσουν την αναπαραγωγιμότητα και την ανάπτυξη. Η πηγή δεν αναφέρει πόσο σταθερές είναι οι διεπαφές, πόσο συχνά θα αλλάζουν τα βάρη ή ο κώδικας ή εάν όλες οι τεκμηριωμένες διαδρομές εξυπηρέτησης υποστηρίζουν εξίσου τις δυνατότητες όρασης.

Οι πληροφορίες ασφάλειας και διακυβέρνησης είναι ένα άλλο σημαντικό άγνωστο. Η πηγή περιγράφει την αρχιτεκτονική, τη χρήση, τα σημεία αναφοράς και την αδειοδότηση, αλλά δεν παρέχει δοκιμές ασφαλείας ή περιορισμούς για την κατανόηση της εικόνας. Προτού χρησιμοποιήσουν το μοντέλο με ευαίσθητες εικόνες ή επακόλουθες ροές εργασίας, οι οργανισμοί θα χρειάζονταν στοιχεία σχετικά με το χειρισμό δεδομένων, τα οπτικά λάθη, την ασφάλεια, την αντίσταση στην κακή χρήση και την ανθρώπινη επίβλεψη. Καμία από αυτές τις ιδιότητες δεν μπορεί να συναχθεί από τις βαθμολογίες αναφοράς ή την άδεια MIT.

Σχετικοί οδηγοί και κουίζ

Επεξήγηση μοντέλων AIΠράκτορες AIChatGPT και LLMΕκπαίδευση AIΔοκιμάστε τι γνωρίζετε — δοκιμάστε ένα δωρεάν κουίζ AIΑναζητήστε έναν όρο AI στο γλωσσάρι μαςΑκολουθήστε τον ιχνηλάτη έκδοσης μοντέλου AI
Βρήκατε αυτό χρήσιμο;