Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
Актуализира се ежедневно1793 проверени истории
Проверено от източници AI покритие на пускането на продукти, промените в политиките, изследванията на безопасността и индустриалните ходове, обяснено на ясен език от образователен екип на неправителствена организация.
Всяка история се свързва с най-силните налични доказателства: оригинални източници, когато са налични, иначе ясно приписани доклади.
What happened, why it matters, and what to watch — without the jargon.
Когато сигналът е слаб, ние не публикуваме нищо, вместо да допълваме емисията.
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
NVIDIA SkillEvaluator measures the impact of verified skills on AI agent performance through a three-tier evaluation process.
A 24-author preprint had frontier AI agents attempt the central research questions of two unpublished NeurIPS 2026 submissions, then had the papers' own authors grade the results. The agents handled the engineering unaided over six days but were unambiguously rejected on the research.
Warp приема заявки за ранен достъп за Warp Factories, които дефинират групи от кодиращи агенти като код — репо, модели, разрешения и човешки контролни точки в един YAML файл, управляван от CLI, API, SDK и MCP. Неговите данни за автоматизация и разходи са твърдения на доставчика: без ценообразуване, дата на обща наличност или независимо тестване.
Нов документ за arXiv въвежда тест, в който моделите трябва да изведат написана дума от звука на писалката и видеото на движението на ръката, без да се вижда мастило. Авторите съобщават, че хората имат над 80% подредена точност на буквите и водещи модели под 10% - и че предоставянето на модели и на двата модалности често влошава резултатите.
Нов предпечат на arXiv описва CacheScout, слой, изграден върху vLLM сървъра с отворен код, който решава какво да запази в кеша за ключ-стойност на модела въз основа на това кой агент е вероятно да се изпълни следващия. Авторите съобщават за двуцифрено забавяне и увеличаване на производителността; натоварванията, моделите и хардуерът не са посочени в резюмето.
Двама изследователи казват, че доказателство за лема в глава 6 от математическия документ на OpenAI има грешка в полярността: тест по отношение на средния успех, при който следващата стъпка се нуждае от голям условен неуспех. Те дават контрапример и коригирано доказателство и предупреждават, че това не е проверка на основната теорема на главата.
Препринт от двама изследователи възпроизвежда по-ранно проучване за това защо равният брой FLOP не означава еднакво време за изпълнение. Той потвърждава основното твърдение, но съобщава, че формулата за корекция на α-FLOP обикновено подценява времето за изпълнение на по-нов хардуер, което показва скокове и трептения, които формулата не улавя.
Нов предпечат на arXiv противопоставя четири архитектури за заявки на естествен език на корпоративни бази данни една срещу друга на синтетичен двуезичен бенчмарк. Никой не отговори правилно на повече от около една четвърт от случаите и дизайнът, който получи най-висок резултат, не беше най-безопасният или най-евтиният.
Нов предпечат на arXiv твърди, че екипите по сигурността могат да преценят дали AI агент, оборудван с памет или извличане, се учи, като измерва доколко затваря празнината спрямо по-силен модел на „учител“, а не по етикетирани бенчмаркове, които често са оскъдни или остарели. Съдейки по модел с подобно захранване не даде използваем сигнал.
Технически доклад от 17 автори, публикуван в arXiv, представя MobileMem, бенчмарк и рамка за дългосрочна памет на устройството, изградена от годишна колекция от мобилни преживявания. Резюмето описва дизайна, но не отчита резултати, а ключови подробности за основните данни остават неразкрити.
Нов препринт на arXiv казва, че големите езикови модели развиват функционално специализирана вътрешна структура, която се подрежда с отделни човешки мозъчни мрежи, въз основа на анализи на вериги в 46 задачи в четири когнитивни области. Страницата с резюмета оставя ключови методологични подробности непосочени.
Предварителен печат докладва, че дезактивирането на експерти с ниска величина в последните пет слоя на 35-милиарден параметърен модел Mixture of Experts запазва много по-използваеми изходи за превод на код, отколкото разпределянето на едни и същи съкращения във всички слоеве. Той обхваща един модел и един бенчмарк, а резюмето не съобщава за немаскирана базова линия.
Един полезен брифинг всяка седмица
Получете потвърдените новини за AI за седмицата, оригинални данни, полезни инструменти, учебни предложения и нови AI работни места.
Наемане на AI професионалист или пускане на полезен AI продукт? Представете го пред хора, които са дошли тук, за да учат и действат.
Публикувайте работа за AI Изпратете AI инструмент