Що сталося
Anthropic представив Claude Sonnet 5.5, другу модель у сімействі Claude 5.5. У компанії кажуть, що нова модель працює більш ніж на 30% швидше, ніж її попередник, Claude Sonnet 5, і зазвичай коштує на 30% менше за виконання завдання, оскільки потребує менше токенів. Під час внутрішнього тестування Sonnet 5.5 набрав 70,6 % за тестом кодування Terminal-Bench 4.0 і лише на два бали відстає від Opus 5.5 за тестом GDPval-AA для професій. Вона також стала першою моделлю Sonnet, яка перемогла Pokémon Red, використовуючи лише знімки екрана, що вказує на покращене довгострокове мислення та розуміння зображень. Ціна залишається 2 дол. США за мільйон вхідних токенів, 10 дол. США за мільйон вихідних токенів і 0,20 дол. США за мільйон зчитувань кеш-пам’яті, але зменшення використання токенів означає нижчу ефективну вартість. Модель тепер доступна в AWS, Google Cloud і Azure, і до неї можна отримати доступ через платформу Claude за допомогою ідентифікатора «claude‑sonnet‑5-5».
В оголошенні Anthropic детально описано Claude Sonnet 5.5 як останнє доповнення до сімейства Claude 5.5, що позиціонується як швидша та дешевша альтернатива Claude Opus 5.5. Модель вдосконалює Sonnet 5 у багатьох вимірах: вона генерує результати більш ніж на 30% швидше, вимагає менше маркерів для порівнянних завдань і забезпечує вищі результати порівняльного тесту в оцінках, орієнтованих на кодування, таких як Terminal-Bench 4.0 (70,6% проти 10,3% для Sonnet 5).
Тестування продуктивності показує, що Sonnet 5.5 відстає від Opus 5.5 лише на два пункти за професійним тестом GDPval‑AA, що вказує на майже паритет у реальній роботі в 44 професіях. Модель також відмінно справляється з довгостроковими завданнями та розумінням зображень, ставши першим варіантом Sonnet, який успішно грає в Pokémon Red, використовуючи лише візуальні дані.
Ціноутворення не змінилося, ніж у Sonnet 5 (2 дол. США/млн вхідних токенів, 10 дол. США/млн вихідних токенів, 0,20 дол. США/млн зчитувань кешу), але зменшене споживання токенів означає до 30% зниження витрат на виконання завдання. Модель доступна серед основних хмарних провайдерів і доступна через платформу Claude за допомогою ідентифікатора «claude‑sonnet‑5‑5».
Удосконалення безпеки та узгодження включають засоби захисту кібербезпеки, які можна порівняти з Opus 5.5, нові класифікатори безпеки для пом’якшення атак дистиляції та незмінні заходи захисту біології. Автоматизований поведінковий аудит Anthropic повідомляє, що Sonnet 5.5 збігається або перевищує Sonnet 5 за більшістю показників вирівнювання, лише з незначними відмінностями від Opus 5.5 у поведінці виходу з пісочниці.
Деталі джерела: anthropic.com ↗
Чому це важливо
Claude Sonnet 5.5 являє собою суттєвий зсув на ринку ШІ, пропонуючи майже флагманські можливості за нижчою ціною, скорочуючи розрив між пропозиціями середнього та вищого рівня. Для підприємств і розробників підвищення швидкості та вартості означає швидшу ітерацію рутинного кодування, створення документів і завдань проектування, потенційно знижуючи загальну вартість володіння робочими процесами, доповненими штучним інтелектом. Оновлення узгодженості моделі, включаючи засоби захисту кібербезпеки та нові класифікатори безпеки, усувають зростаючі занепокоєння щодо неправильного використання та вилучення моделі, встановлюючи вищу базу для відповідального розгортання в комерційних умовах. Позиціонуючи Sonnet 5.5 як рентабельне доповнення до Opus 5.5, Anthropic розширює спектр економічно виправданих варіантів використання, від внутрішнього інструментарію до додатків, орієнтованих на клієнтів, і змушує конкурентів покращувати ціни та функції безпеки.
Запуск скорочує різницю між продуктивністю та вартістю між LLM середнього та флагманського рівня, роблячи розширені можливості штучного інтелекту більш доступними для широкого кола розробників і підприємств. Швидша генерація та менше використання токенів можуть прискорити цикли розробки для робочих процесів, що містять велику кількість коду чи документів, зменшуючи як час, так і витрати на обчислення.
Акцент Anthropic на безпеці — гарантії кібербезпеки, класифікатори дистиляційних атак і детальний аудит узгодження — усуває занепокоєння всієї галузі щодо неправильного використання моделі та вилучення даних. Вбудувавши ці елементи керування в модель середнього рівня, Anthropic підвищує базовий рівень для відповідального розгортання ШІ на ринку.
Доступність моделі на всіх основних хмарних платформах спрощує інтеграцію для існуючих хмарних конвеєрів, потенційно сприяючи вищому відсотку впровадження та заохочуючи конкуренцію між хмарними провайдерами щодо оптимізованих цін або спеціалізованих послуг для моделей Claude.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Which component of an AI application is the machine-learning model itself?
Що дивитися далі
У майбутніх оновленнях буде показано, як працює Sonnet 5.5 у реальному розгортанні, особливо в середовищах великого обсягу, де його перевага у швидкості є найбільш важливою. Слідкуйте за показниками впровадження на платформі Claude і будь-якими коригуваннями цін, які можуть ще більше скоротити розрив у вартості з Opus 5.5. Розгортання Anthropic Програми кіберперевірки та Програми перевірки наук про життя покаже, як компанія врівноважує розширені можливості з багаторівневим контролем безпеки. Нарешті, спостерігайте за відгуками конкурентів, зокрема OpenAI та інших постачальників LLM, щоб побачити, чи з’являються аналогічні моделі середнього рівня з порівнянним співвідношенням ціни та ефективності.
Показники впровадження: відстежуйте статистику використання на платформі Claude, щоб оцінити, як швидко розробники переходять від Sonnet 5 або інших моделей середнього рівня до Sonnet 5.5.
Динаміка ціноутворення: спостерігайте, чи коригує Anthropic ціну на токени чи запроваджує знижки на обсяг, які можуть ще більше знизити ефективну вартість виконання завдання.
Розгортання програми безпеки: відстежуйте реєстрацію та результати Програми кіберперевірки та Програми перевірки наук про життя, які покажуть, як нові гарантії застосовуються на практиці.
Конкурентна реакція: слідкуйте за оголошеннями від OpenAI, Google та інших постачальників LLM, які можуть представити порівнювані моделі середнього рівня з аналогічною швидкістю та перевагами в ціні.