Оновлюється щодня2528 перевірені історії

Новини AI. Без шуму.

Перевірений джерелом штучний інтелект висвітлює випуск продуктів, зміни в політиці, дослідження безпеки та зміни в галузі, пояснені простою англійською мовою некомерційною освітньою командою.

Архів новин

Архів новин AI — Сторінка 209

Історії про штучний інтелект, перевірені джерелами, спочатку найновіші, для людей, яким потрібно розуміти штучний інтелект, не ганяючись за рекламою.

Перевірене джерело

Кожна історія пов’язана з найвагомішими наявними доказами: оригінальними джерелами, якщо вони доступні, в іншому випадку чітко зазначеними повідомленнями.

Звичайна англійська

Що сталося, чому це важливо та що дивитися — без жаргону.

Без наповнювача

Коли сигнал слабкий, ми нічого не публікуємо, а лише доповнюємо канал.

9 історії
  1. ІнноваціяІнновація6 min читати

    Стаття представляє «тіньові оцінки»: агенти штучного інтелекту розробили, але провалили два дослідницькі питання

    Препринт 24 авторів змусив агентів передового ШІ спробувати розглянути основні дослідницькі питання двох неопублікованих матеріалів NeurIPS 2026, а потім власних авторів документів оцінити результати. Агенти без сторонньої допомоги займалися розробкою протягом шести днів, але їм було однозначно відмовлено в дослідженні.arxiv.org
  2. ПродуктПродукт7 min читати

    Warp відкриває ранній доступ до «Factories», системи Config-as-Code для запуску групи кодуючих агентів

    Warp приймає запити раннього доступу для Warp Factories, які визначають групи кодуючих агентів як код — сховища, моделі, дозволи та контрольні точки людини в одному файлі YAML, керованому CLI, API, SDK і MCP. Показники автоматизації та вартості є заявами постачальника: немає ціни, дати загальної доступності чи незалежного тестування.warp.dev
  3. ІнноваціяІнновація7 min читати

    Benchmark каже, що найкращі мультимодальні моделі набирають менше 10% результатів при читанні слів із звуків ручки та рухів руки

    Нова стаття arXiv представляє тест, у якому моделі повинні вивести написане слово на основі аудіо, написаного ручкою, і відео рухів руки, без видимих чорнила. Автори повідомляють, що точність упорядкованих літер у людей перевищує 80%, а у провідних моделей – нижче 10%, і що використання моделей обох способів часто погіршує результати.arxiv.org
  4. ІнноваціяІнновація7 min читати

    Paper каже, що керування кеш-пам’яттю з урахуванням агентів скорочує затримку першого маркера до 45% у мультиагентному обслуговуванні

    Новий препринт arXiv описує CacheScout, рівень, побудований на сервері vLLM з відкритим кодом, який вирішує, що зберігати в кеші ключ-значення моделі на основі того, який агент, імовірно, запуститься наступним. Автори повідомляють про двозначне збільшення затримки та пропускної здатності; робочі навантаження, моделі та обладнання не вказані в анотації.arxiv.org
  5. ІнноваціяІнновація7 min читати

    Аудит доказу, створеного штучним інтелектом OpenAI, знаходить зворотний стан і публікує ремонт

    Два дослідники кажуть, що доказ леми в розділі 6 математичного документа OpenAI містить помилку полярності: тест з точки зору середнього успіху, де наступний крок потребує великої умовної невдачі. Вони наводять контрприклад і виправлений доказ і застерігають, що це не перевірка основної теореми розділу.arxiv.org
  6. ІнноваціяІнновація7 min читати

    Дослідження реплікації стверджує, що FLOP все ще неправильно передбачають час виконання ШІ, а запропоноване виправлення не працює на новішому обладнанні

    Препринт двох дослідників відтворює попередні дослідження про те, чому однакова кількість FLOP не означає однаковий час виконання. Це підтверджує основне твердження, але повідомляє, що формула корекції α-FLOP загалом недооцінює час роботи на новішому обладнанні, що показує стрибки та коливання, які формула не враховує.arxiv.org
  7. підприємствопідприємство6 min читати

    Порівняльний документ знаходить чотири способи запиту корпоративних даних за допомогою LLM. Усі оцінки нижче 26%

    Новий препринт arXiv протиставляє чотири архітектури для запитів до корпоративних баз даних природною мовою на синтетичному двомовному тесті. Жоден не дав правильних відповідей більше ніж на чверть випадків, а конструкція, яка отримала найвищий бал, не була найбезпечнішою чи найдешевшою.arxiv.org
  8. ІнноваціяІнновація7 min читати

    Стаття пропонує класифікацію агентів безпеки ШІ без міток шляхом вимірювання конвергенції до більш сильної моделі

    У новому препринті arXiv стверджується, що команди безпеки можуть судити про те, чи навчається агент штучного інтелекту, оснащений пам’яттю чи пошуком, вимірюючи, наскільки він заповнює розрив із сильнішою моделлю «вчителя», а не за позначеними тестами, які часто є дефіцитними або застарілими. Судячи з моделі з аналогічною потужністю, сигнал не давався.arxiv.org

Один корисний брифінг щотижня

Будьте в курсі ШІ, не живучи в стрічці.

Отримуйте перевірені новини про штучний інтелект, оригінальні дані, корисні інструменти, підбірки для навчання та нові вакансії зі штучного інтелекту.

Send me
One email a week. Switch any time.

Охопіть людей, які вивчають ШІ

Найняти професіонала ШІ чи запустити корисний продукт ШІ? Покажіть це людям, які прийшли сюди вчитися та діяти.

Опублікувати роботу ШІНадішліть інструмент ШІ