Обновляется ежедневно2528 проверенные истории
Новости ИИ. Без шума.
Проверенные источники искусственного интеллекта освещают запуски продуктов, изменения в политике, исследования в области безопасности и отраслевые шаги, объясненные простым языком командой некоммерческого образования.
Проверенный источник
Каждая история связана с самыми убедительными имеющимися доказательствами: первоначальными источниками, если таковые имеются, или явно приписываемыми сообщениями.
Простой английский
Что произошло, почему это важно и что смотреть — без жаргона.
Без наполнителя
Когда сигнал слабый, мы ничего не публикуем, а лишь дополняем канал.
Больше историй
9 историиИнновации
Оценка эффективности навыков ИИ-агента с помощью NVIDIA SkillEvaluator
NVIDIA SkillEvaluator измеряет влияние проверенных навыков на производительность агента ИИ посредством трехуровневого процесса оценки.
developer.nvidia.comИнновации
В статье представлены «теневые оценки»: агенты ИИ выполнили проектирование, но не ответили на два исследовательских вопроса
В препринте с участием 24 авторов пограничные ИИ-агенты пытались ответить на основные исследовательские вопросы двух неопубликованных материалов NeurIPS 2026, а затем авторы статей оценивали результаты. Агенты самостоятельно занимались проектированием в течение шести дней, но им было однозначно отказано в исследовании.arxiv.orgПродукт
Warp открывает ранний доступ к «Фабрикам», системе конфигурации как кода для запуска групп агентов кодирования
Warp принимает запросы на ранний доступ к Warp Factory, которая определяет группу агентов кодирования как код — репозитории, модели, разрешения и человеческие контрольные точки в одном файле YAML, управляемом CLI, API, SDK и MCP. Показатели автоматизации и стоимости соответствуют заявлениям поставщиков: цены не указаны, дата общедоступной версии или независимое тестирование не указаны.warp.devИнновации
Benchmark сообщает, что лучшие мультимодальные модели набирают менее 10% при чтении слов по звукам ручки и движениям рук
В новой статье arXiv представлен тест, в котором модели должны определить написанное слово по звуку, написанному пером, и видео по движениям рук без видимых чернил. Авторы сообщают, что у людей точность упорядоченных букв превышает 80%, а у ведущих моделей — ниже 10%, а использование моделей обоих методов часто ухудшает результаты.arxiv.orgИнновации
Paper сообщает, что управление кэшем с учетом агентов сокращает задержку первого токена до 45% при многоагентном обслуживании
В новом препринте arXiv описывается CacheScout, уровень, построенный на сервере vLLM с открытым исходным кодом, который решает, что хранить в кеше «ключ-значение» модели на основе того, какой агент, скорее всего, запустится следующим. Авторы сообщают о двузначном увеличении задержки и пропускной способности; рабочие нагрузки, модели и оборудование не указаны в аннотации.arxiv.orgИнновации
Аудит OpenAI доказательства, сгенерированного искусственным интеллектом, обнаруживает обратное состояние и публикует исправление
Два исследователя говорят, что доказательство леммы в главе 6 математического документа OpenAI содержит ошибку полярности: тест с точки зрения среднего успеха, где следующий шаг требует большого условного провала. Они приводят контрпример и исправленное доказательство и предупреждают, что это не проверка основной теоремы главы.arxiv.orgИнновации
Исследование репликации показывает, что FLOP по-прежнему неверно прогнозирует время работы ИИ, а предлагаемое исправление не работает на новом оборудовании
Препринт двух исследователей воспроизводит более раннее исследование о том, почему одинаковое количество FLOP не означает равное время выполнения. Он подтверждает основное утверждение, но сообщает, что формула коррекции α-FLOPs обычно недооценивает время работы на новом оборудовании, которое показывает скачки и колебания, которые формула не фиксирует.arxiv.orgПредприятие
В сравнительном документе указаны четыре способа запроса корпоративных данных с помощью LLM. Все они набирают менее 26%
В новом препринте arXiv четыре архитектуры для запросов к корпоративным базам данных на естественном языке сравниваются друг с другом в синтетическом двуязычном тесте. Ни один из них не ответил правильно более чем на четверть случаев, а конструкция, получившая наибольшее количество баллов, не была самой безопасной или самой дешевой.arxiv.orgИнновации
В документе предлагается классифицировать агентов безопасности ИИ без ярлыков путем измерения сходимости к более сильной модели
В новом препринте arXiv утверждается, что команды безопасности могут судить о том, обучается ли ИИ-агент, оснащенный памятью или поиском, измеряя, насколько он сокращает разрыв с более сильной моделью «учителя», а не по обозначенным контрольным показателям, которые часто недостаточны или устарели. Судя по модели с аналогичным питанием, никакого полезного сигнала не подавалось.arxiv.org
Один полезный брифинг каждую неделю
Идите в ногу с ИИ, не живя в ленте.
Получайте проверенные новости об искусственном интеллекте за неделю, оригинальные данные, полезные инструменты, обучающие материалы и свежие вакансии в области искусственного интеллекта.
Охватите людей, которые изучают ИИ
Нанимаете специалиста по искусственному интеллекту или запускаете полезный продукт в области искусственного интеллекта? Покажите это людям, которые пришли сюда учиться и действовать.
Опубликовать вакансию ИИОтправить инструмент искусственного интеллекта