Оновлюється щодня2528 перевірені історії
Новини AI. Без шуму.
Перевірений джерелом штучний інтелект висвітлює випуск продуктів, зміни в політиці, дослідження безпеки та зміни в галузі, пояснені простою англійською мовою некомерційною освітньою командою.
Перевірене джерело
Кожна історія пов’язана з найвагомішими наявними доказами: оригінальними джерелами, якщо вони доступні, в іншому випадку чітко зазначеними повідомленнями.
Звичайна англійська
Що сталося, чому це важливо та що дивитися — без жаргону.
Без наповнювача
Коли сигнал слабкий, ми нічого не публікуємо, а лише доповнюємо канал.
Більше історій
9 історіїІнновація
Оцінка ефективності навичок агента AI за допомогою NVIDIA SkillEvaluator
NVIDIA SkillEvaluator вимірює вплив перевірених навичок на продуктивність агента ШІ за допомогою трирівневого процесу оцінювання.
developer.nvidia.comІнновація
Стаття представляє «тіньові оцінки»: агенти штучного інтелекту розробили, але провалили два дослідницькі питання
Препринт 24 авторів змусив агентів передового ШІ спробувати розглянути основні дослідницькі питання двох неопублікованих матеріалів NeurIPS 2026, а потім власних авторів документів оцінити результати. Агенти без сторонньої допомоги займалися розробкою протягом шести днів, але їм було однозначно відмовлено в дослідженні.arxiv.orgПродукт
Warp відкриває ранній доступ до «Factories», системи Config-as-Code для запуску групи кодуючих агентів
Warp приймає запити раннього доступу для Warp Factories, які визначають групи кодуючих агентів як код — сховища, моделі, дозволи та контрольні точки людини в одному файлі YAML, керованому CLI, API, SDK і MCP. Показники автоматизації та вартості є заявами постачальника: немає ціни, дати загальної доступності чи незалежного тестування.warp.devІнновація
Benchmark каже, що найкращі мультимодальні моделі набирають менше 10% результатів при читанні слів із звуків ручки та рухів руки
Нова стаття arXiv представляє тест, у якому моделі повинні вивести написане слово на основі аудіо, написаного ручкою, і відео рухів руки, без видимих чорнила. Автори повідомляють, що точність упорядкованих літер у людей перевищує 80%, а у провідних моделей – нижче 10%, і що використання моделей обох способів часто погіршує результати.arxiv.orgІнновація
Paper каже, що керування кеш-пам’яттю з урахуванням агентів скорочує затримку першого маркера до 45% у мультиагентному обслуговуванні
Новий препринт arXiv описує CacheScout, рівень, побудований на сервері vLLM з відкритим кодом, який вирішує, що зберігати в кеші ключ-значення моделі на основі того, який агент, імовірно, запуститься наступним. Автори повідомляють про двозначне збільшення затримки та пропускної здатності; робочі навантаження, моделі та обладнання не вказані в анотації.arxiv.orgІнновація
Аудит доказу, створеного штучним інтелектом OpenAI, знаходить зворотний стан і публікує ремонт
Два дослідники кажуть, що доказ леми в розділі 6 математичного документа OpenAI містить помилку полярності: тест з точки зору середнього успіху, де наступний крок потребує великої умовної невдачі. Вони наводять контрприклад і виправлений доказ і застерігають, що це не перевірка основної теореми розділу.arxiv.orgІнновація
Дослідження реплікації стверджує, що FLOP все ще неправильно передбачають час виконання ШІ, а запропоноване виправлення не працює на новішому обладнанні
Препринт двох дослідників відтворює попередні дослідження про те, чому однакова кількість FLOP не означає однаковий час виконання. Це підтверджує основне твердження, але повідомляє, що формула корекції α-FLOP загалом недооцінює час роботи на новішому обладнанні, що показує стрибки та коливання, які формула не враховує.arxiv.orgпідприємство
Порівняльний документ знаходить чотири способи запиту корпоративних даних за допомогою LLM. Усі оцінки нижче 26%
Новий препринт arXiv протиставляє чотири архітектури для запитів до корпоративних баз даних природною мовою на синтетичному двомовному тесті. Жоден не дав правильних відповідей більше ніж на чверть випадків, а конструкція, яка отримала найвищий бал, не була найбезпечнішою чи найдешевшою.arxiv.orgІнновація
Стаття пропонує класифікацію агентів безпеки ШІ без міток шляхом вимірювання конвергенції до більш сильної моделі
У новому препринті arXiv стверджується, що команди безпеки можуть судити про те, чи навчається агент штучного інтелекту, оснащений пам’яттю чи пошуком, вимірюючи, наскільки він заповнює розрив із сильнішою моделлю «вчителя», а не за позначеними тестами, які часто є дефіцитними або застарілими. Судячи з моделі з аналогічною потужністю, сигнал не давався.arxiv.org
Один корисний брифінг щотижня
Будьте в курсі ШІ, не живучи в стрічці.
Отримуйте перевірені новини про штучний інтелект, оригінальні дані, корисні інструменти, підбірки для навчання та нові вакансії зі штучного інтелекту.
Охопіть людей, які вивчають ШІ
Найняти професіонала ШІ чи запустити корисний продукт ШІ? Покажіть це людям, які прийшли сюди вчитися та діяти.
Опублікувати роботу ШІНадішліть інструмент ШІ