Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Ενημερώνεται καθημερινά1793 επαληθευμένες ιστορίες
Η κάλυψη της τεχνητής νοημοσύνης ελεγμένης πηγής για την κυκλοφορία προϊόντων, τις αλλαγές πολιτικής, την έρευνα για την ασφάλεια και τις κινήσεις της βιομηχανίας, που εξηγείται σε απλά αγγλικά από μια μη κερδοσκοπική εκπαιδευτική ομάδα.
Κάθε ιστορία συνδέεται με τα ισχυρότερα διαθέσιμα στοιχεία: αρχικές πηγές όταν είναι διαθέσιμες, διαφορετικά αποδίδονται σαφώς αναφορές.
What happened, why it matters, and what to watch — without the jargon.
Όταν το σήμα είναι λεπτό, δεν δημοσιεύουμε τίποτα αντί να συμπληρώνουμε τη ροή.
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Μια προεκτύπωση 24 συγγραφέων ζήτησε από πράκτορες συνοριακής τεχνητής νοημοσύνης να επιχειρήσουν τα κεντρικά ερευνητικά ερωτήματα δύο αδημοσίευτων υποβολών του NeurIPS 2026 και στη συνέχεια έβαλαν τους συγγραφείς των εργασιών να βαθμολογήσουν τα αποτελέσματα. Οι πράκτορες χειρίστηκαν τη μηχανική χωρίς βοήθεια για έξι ημέρες, αλλά απορρίφθηκαν κατηγορηματικά στην έρευνα.
Το Warp δέχεται αιτήματα έγκαιρης πρόσβασης για το Warp Factories, το οποίο ορίζει τους στόλους των πρακτόρων κωδικοποίησης ως κώδικα — repos, μοντέλα, δικαιώματα και ανθρώπινα σημεία ελέγχου σε ένα αρχείο YAML, που καθοδηγείται από CLI, API, SDK και MCP. Τα στοιχεία αυτοματοποίησης και κόστους είναι αξιώσεις πωλητών: χωρίς τιμολόγηση, ημερομηνία γενικής διαθεσιμότητας ή ανεξάρτητη δοκιμή.
Ένα νέο χαρτί arXiv εισάγει μια δοκιμή στην οποία τα μοντέλα πρέπει να συνάγουν μια γραπτή λέξη από ήχο με στυλό και βίντεο κίνησης με το χέρι, χωρίς να φαίνεται μελάνι. Οι συγγραφείς αναφέρουν ότι οι άνθρωποι με ακρίβεια διατεταγμένων γραμμάτων άνω του 80% και τα κορυφαία μοντέλα κάτω από 10% — και ότι η παροχή και των δύο τρόπων στα μοντέλα συχνά έκανε τα αποτελέσματα χειρότερα.
Μια νέα προεκτύπωση arXiv περιγράφει το CacheScout, ένα επίπεδο που έχει δημιουργηθεί στον διακομιστή vLLM ανοιχτού κώδικα που αποφασίζει τι θα κρατήσει στη μνήμη cache κλειδιού-τιμής ενός μοντέλου με βάση τον παράγοντα που είναι πιθανό να εκτελεστεί στη συνέχεια. Οι συγγραφείς αναφέρουν διψήφιο λανθάνοντα χρόνο και κέρδη απόδοσης. ο φόρτος εργασίας, τα μοντέλα και το υλικό δεν αναφέρονται περιληπτικά.
Δύο ερευνητές λένε ότι μια απόδειξη λήμματος στο Κεφάλαιο 6 του μαθηματικού εγγράφου του OpenAI έχει σφάλμα πολικότητας: μια δοκιμή από την άποψη της μέσης επιτυχίας όπου το επόμενο βήμα χρειάζεται μια μεγάλη αποτυχία υπό όρους. Δίνουν ένα αντιπαράδειγμα και μια διορθωμένη απόδειξη και προειδοποιούν ότι αυτό δεν είναι επαλήθευση του κύριου θεωρήματος του κεφαλαίου.
Μια προεκτύπωση από δύο ερευνητές αναπαράγει μια προηγούμενη μελέτη σχετικά με το γιατί ίσες μετρήσεις FLOP δεν σημαίνουν ίσο χρόνο εκτέλεσης. Επιβεβαιώνει τον υποκείμενο ισχυρισμό, αλλά αναφέρει ότι ο τύπος διόρθωσης α-FLOPs γενικά υποτιμά το χρόνο εκτέλεσης σε νεότερο υλικό, το οποίο εμφανίζει άλματα και ταλαντώσεις που ο τύπος δεν καταγράφει.
Μια νέα προεκτύπωση arXiv φέρνει τέσσερις αρχιτεκτονικές για αναζήτηση σε φυσική γλώσσα εταιρικών βάσεων δεδομένων μεταξύ τους σε ένα συνθετικό δίγλωσσο σημείο αναφοράς. Καμία δεν απάντησε σωστά πάνω από το ένα τέταρτο των περιπτώσεων και το σχέδιο που σημείωσε την υψηλότερη βαθμολογία δεν ήταν το ασφαλέστερο ή το φθηνότερο.
Μια νέα προεκτύπωση του arXiv υποστηρίζει ότι οι ομάδες ασφαλείας μπορούν να κρίνουν εάν ένας πράκτορας τεχνητής νοημοσύνης εξοπλισμένος με μνήμη ή ανάκτηση μαθαίνει μετρώντας πόσο κλείνει το χάσμα σε ένα ισχυρότερο μοντέλο «δασκάλου» και όχι σε επισημασμένα σημεία αναφοράς που είναι συχνά σπάνια ή μπαγιάτικα. Κρίνοντας από ένα μοντέλο παρόμοιας ισχύος δεν έδωσε κανένα χρησιμοποιήσιμο σήμα.
Μια τεχνική έκθεση 17 συντακτών που δημοσιεύτηκε στο arXiv παρουσιάζει το MobileMem, ένα σημείο αναφοράς και ένα πλαίσιο για τη μακροπρόθεσμη μνήμη στη συσκευή, που δημιουργήθηκε από μια συλλογή εμπειριών κινητής τηλεφωνίας σε κλίμακα έτους. Η περίληψη περιγράφει το σχέδιο, αλλά δεν αναφέρει βαθμολογίες και οι βασικές λεπτομέρειες σχετικά με τα υποκείμενα δεδομένα παραμένουν άγνωστες.
Μια νέα προεκτύπωση του arXiv λέει ότι τα μεγάλα γλωσσικά μοντέλα αναπτύσσουν λειτουργικά εξειδικευμένη εσωτερική δομή που ευθυγραμμίζεται με διαφορετικά δίκτυα ανθρώπινου εγκεφάλου, βασισμένα σε αναλύσεις κυκλωμάτων σε 46 εργασίες σε τέσσερις γνωστικούς τομείς. Η αφηρημένη σελίδα αφήνει άγνωστες βασικές μεθοδολογικές λεπτομέρειες.
Μια προεκτύπωση αναφέρει ότι η απενεργοποίηση των ειδικών χαμηλού μεγέθους στα τελευταία πέντε επίπεδα ενός μοντέλου Mixture-of-Experts 35 δισεκατομμυρίων παραμέτρων διατήρησε πολύ περισσότερα χρησιμοποιήσιμα αποτελέσματα μετάφρασης κώδικα από το να απλωθούν οι ίδιες περικοπές σε όλα τα επίπεδα. Καλύπτει ένα μοντέλο και ένα σημείο αναφοράς, και η περίληψη δεν αναφέρει ξεκάθαρη γραμμή βάσης.
Μία χρήσιμη ενημέρωση κάθε εβδομάδα
Λάβετε επαληθευμένες ειδήσεις τεχνητής νοημοσύνης της εβδομάδας, πρωτότυπα δεδομένα, χρήσιμα εργαλεία, επιλογές εκμάθησης και νέες θέσεις εργασίας AI.
Να προσλάβετε έναν επαγγελματία τεχνητής νοημοσύνης ή να λανσάρετε ένα χρήσιμο προϊόν τεχνητής νοημοσύνης; Βάλτε το μπροστά σε ανθρώπους που ήρθαν εδώ για να μάθουν και να δράσουν.
Δημοσιεύστε μια εργασία AI Υποβάλετε ένα εργαλείο AI