Какво стана
The Cryptonomist съобщава, че изследователска статия от Arulnidhi Karunanidhi изследва как фалшивата информация, вмъкната в постоянната памет, може да повлияе на AI агентите в по-късни сесии. Докладваните тестове откриха значителни загуби на точност от малко количество отровени данни и слабости както в скрининга на съдържанието, така и в защитите за извличане, базирани на произхода. Документът предлага ограничени ограничения на заетостта като метод за ограничаване на времето за извличане. Констатациите не са независимо потвърдени от предоставения изходен материал.
The Cryptonomist съобщава, че документът е изследвал постоянната памет в AI агенти: информацията от по-ранни взаимодействия се съхранява и по-късно се извлича, когато нова заявка изглежда подходяща. Загрижеността за сигурността е, че невярно твърдение, поставено в това хранилище, може да остане достъпно през бъдещите сесии. Според доклада проблемът не се ограничава до видима еднократна халюцинация. Отровен спомен може да бъде представен по-късно като поддържащ контекст, потенциално насочващ агент към неправилен отговор, дори когато оригиналното вмъкване вече не е видимо за потребителя.
В доклада се казва, че изследователите са отровили 1,2% от корпуса на LongMemEval с ясно формулирани неверни твърдения. Cryptonomist описва твърденията като генерирани с едно преминаване, без специални задействания, изработени инструкции или настройка на ретривъра, предназначени да улеснят атаката. В отчетения тест точността на извличане спадна от 0,850 на 0,300. Тези цифри са съществени, защото описват голяма промяна от сравнително малка отровена част от корпуса, въпреки че източникът не предоставя достатъчно методологични подробности, за да определи колко представителен е тестът за разгърнати системи.
Cryptonomist също така съобщава, че четиристепенен канал за скрининг по време на запис е открил 0,832 непреки опита за бързо инжектиране и е маркирал 1,5% от доброкачествения текст с много тригерни думи като подозрителен. Това представяне не се прехвърли към фалшивите спомени: тръбопроводът отхвърли нула от 360 отровени спомени в отчетения тест. В статията се казва, че това отразява ограничението на проверката само на съдържанието, която може да идентифицира подозрителни инструкции по-лесно, отколкото може да определи дали едно спокойно, правдоподобно твърдение е вярно. Източникът не документира независимо кода на документа, конструкцията на набора от данни или протокола за оценка, освен че са публикувани тестови снопове, корпуси и обобщени отчети.
Детайли за източника: en.cryptonomist.ch ↗
Защо има значение
Постоянната памет се използва все повече, за да позволи на AI агентите да пренасят информация между сесиите. Ако правдоподобните фалшификати могат да оцелеят при обикновен скрининг и да повлияят на по-късно извличане, паметта става граница на сигурността, а не просто функция за удобство. Докладваните резултати предполагат, че системите може да се нуждаят от предпазни мерки, които ограничават влиянието на всеки един източник, наред с фактическата проверка, проследяването на произхода и човешкия преглед.
Докладваният проблем има значение, тъй като постоянната памет може да промени модела на доверие за AI агенти. Конвенционален чатбот може да даде неправилен отговор в един обмен; агент с трайна памет може да пренесе неправилна предпоставка в по-късна работа. Ако тази предпоставка бъде извлечена като контекст, тя може да повлияе на планирането, обобщаването, препоръките или използването на инструменти. Източникът не показва нито едно от тези последствия от реалния свят, но идентифицира механизъм, чрез който малко количество съхранена дезинформация може да стане трайна и многократно уместна.
Разказът на източника също предизвиква простото разчитане на етикетите за произход. Cryptonomist съобщава, че извличането по подразбиране, претеглено по произход, е било статистически неразличимо от липса на защита, с отчетена p-стойност от 0,80. По-силното претегляне подобри полезността само чрез директно изключване на ненадежден материал. В един тест за смесен произход, изключването на ненадеждно съдържание повиши точността от 0,3167 на 0,7000, когато този материал беше предимно доброкачествен. Когато обаче необходимите доказателства бяха обозначени като ненадеждни, в доклада се казва, че припомнянето на доказателства е паднало до нула и точността е спаднала до 0,0417.
Този компромис има практически последици за разработчиците и организациите, използващи агенти с активирана памет. Етикетът на източника може да бъде полезен, но не е същото като доказателство, че твърдението е вярно. Прекаленото разчитане на етикети може да позволи преминаването на отровена информация от надеждна категория, докато агресивното филтриране може да премахне правилната информация от източник, който е класифициран като ненадежден. Докладваното предложение, ограничени ограничения на заетостта, измества целта от идентифициране на всяка лъжа към ограничаване на това колко извлечени доказателства може да допринесе всеки един източник или категория. Източникът не установява, че този подход е по-добър в оперативни среди.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Какво да гледате след това
Основните въпроси са дали докладваните ефекти се възпроизвеждат извън настройката LongMemEval, как ограничените ограничения за заетост се представят срещу по-силни или адаптивни атаки и какви разходи за точност налагат. Източникът не установява, че внедрен търговски агент е бил компрометиран, не идентифицира жертва от реалния свят или не показва, че предложената защита работи в производството. The Cryptonomist също казва, че статията му е създадена с помощта на изкуствен интелект и е прегледана от редакционния екип.
Първият приоритет е независимото репликиране. The Cryptonomist приписва констатациите на документ от Arulnidhi Karunanidhi и казва, че са публикувани подкрепящи снопове, корпуси и обобщени доклади, но предоставената статия не идентифицира arXiv записа на хартията или предоставя директен технически преглед. Изследователите трябва да тестват дали степента на отравяне от 1,2% и докладваните промени в точността продължават да съществуват при различни архитектури на паметта, методи за извличане, размери на корпуса и задачи на агенти. Резултатите само от LongMemEval не трябва да се третират като мярка за риска на всеки внедрен агент.
Предложената ограничена защита от заетост също се нуждае от тестване срещу реалистично поведение при извличане. Ограничаването на дела на доказателства от един източник или категория може да намали щетите, причинени от кампания за концентрирано отравяне, но също така може да накара агент да пропусне отговор, когато най-подходящите доказателства идват от един източник. Следователно полезна оценка би измервала както устойчивостта на атаки, така и обикновеното изпълнение на задачите, включително случаи, в които надеждни и ненадеждни доказателства са смесени или етикетите са грешни. Източникът съобщава за предложението, но не дава производствени резултати, подробности за внедряването или сравнение със системи за външно заземяване.
И накрая, организациите трябва да следят за доказателства, че системите за памет записват откъде идва твърдението, позволяват на потребителите да проверяват или коригират съхранените спомени и отделят непотвърдените твърдения от установените факти. Това са практически предпазни мерки за разследване, а не резултати, демонстрирани от тази статия. Докладът не идентифицира пробив, компрометиран продукт, търговско внедряване или потвърден нападател. Също така не показва дали отровените спомени могат да бъдат вмъкнати в активна система без разрешение. Тъй като в статията се посочва, че е произведена с помощта на AI и прегледана редакционно, основният документ и освободените артефакти изискват директно изследване, преди числените констатации да се използват за определяне на политиката за сигурност.