Powrót do Wiadomości
BezpieczeństwoAI Understanding odprawa

Nowy benchmark ujawnia, że frameworki agentic AI są podatne na wielomodalne prompty

Naukowcy przedstawiają MMPIBench, powtarzalny benchmark pokazujący, że choć frameworki agentic AI często blokują wizualne prompty na etapie planowania, ataki oparte na dźwięku odnoszą sukces w niemal połowie testowanych scenariuszy, w których kanał jest wspierany.

4 min readRead the primary source
Source-provided image accompanying New benchmark reveals agentic AI frameworks vulnerable to multimodal prompt injection
Dokument źródłowyŹródło zapisane
Wydawca
arxiv.org
Link źródłowy
arxiv.orghttps://arxiv.org/abs/2609.09404
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

Szybki zastrzyk
Wzór ataku polegający na wstawianiu złośliwych instrukcji do danych wejściowych modelu lub pobranej treści.
Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
Podpowiedź
Instrukcje wejściowe i kontekst dostarczony do modelu generatywnego.
Sprawdź sięQuiz dotyczący agentów AI

Co się stało

Naukowcy opublikowali MMPIBench, oceniający wielomodalne ataki promptowe na frameworkach agentic AI. Badanie testowało sześć frameworków i pięć modeli podstawowych na kanałach wizualnych i audio, wykazując, że podczas gdy ataki wizualne są w dużej mierze blokowane podczas planowania, ataki audio mają znacznie wyższy wskaźnik realizacji, gdy infrastruktura je wspiera.

Naukowcy wprowadzili MMPIBench, powtarzalny zaprojektowany do mierzenia wpływu multimodalnych ataków na frameworki agentic AI. Te frameworki pozwalają modelom językowym planować, utrzymywać pamięć i wywoływać narzędzia wchodzące w interakcje z rzeczywistymi plikami, e-mailami i usługami. Benchmark dostarcza stały zestaw ataków za pośrednictwem sześciu nośników wizualnych, w tym tekstu OCR, nakładek, metadanych EXIF, kodów QR, fałszywych interfejsów i hybryd, śledząc, jak daleko wstrzykiwane instrukcje przemieszczają się od percepcji przez planowanie do wykonania narzędzi.

Badanie przeprowadziło 720 prób obejmujących sześć ram, pięć modeli fundamentowych, sześć nośników i cztery cele atakującego. Wyniki wykazały, że ataki były realizowane w około 1% prób, ale próby w 12,8%. Różnica między próbą a zakończoną atakiem została niemal całkowicie zamknięta na etapie planowania, kiedy model odczytywał wstrzykniętą instrukcję i odmawiał działania. Konkretny model podstawowy miał znacznie większe znaczenie niż ramy określające, czy instrukcja została wykonana; jeden model nigdy nie próbował ataku i rozpoznał wstrzyknięcie w 59,7% przebiegów, podczas gdy dwa inne próbowały ataku w 23,6% przebiegów.

Badacze rozszerzyli na audio, jedyny inny surowy kanał percepcyjny akceptowany przez obecne modele frontier. Tylko dwa z pięciu modeli pobierały dźwięk, a tylko trzy z sześciu frameworków dostarczały go. Jednak tam, gdzie sygnał dotarł, atak zakończył się w 49% komórek, co wzrosło do 75% dla jednego konkretnego modelu. Wskazuje to, że podczas gdy kanały wizualne są mocno chronione logiką planowania, kanały audio są węższe, ale znacznie mniej chronione, co prowadzi do wyższych wskaźników skuteczności złośliwych instrukcji.

Szczegóły źródła: arxiv.org ↗

Dlaczego to ma znaczenie

Badania te dostarczają konkretnych, powtarzalnych dowodów na to, że systemy agentycznej AI, które mogą uzyskać dostęp do rzeczywistych plików i usług, pozostają podatne na pośrednie wprowadzanie ów za pośrednictwem kanałów nietekstowych. Wyniki podkreślają istotną lukę w bezpieczeństwie: choć wizualne wstrzykiwania są często neutralizowane przez modelowe rozumowanie, kanały audio są mniej chronione i mogą prowadzić do skutecznych wywołań złośliwych narzędzi. Podkreśla to potrzebę solidnej sanitacji danych wejściowych i wielomodalnego szkolenia z bezpieczeństwa w wdrożeniach agenticznych.

Badanie pokazuje, że raportowanie jedynie wskaźników zakończenia ataku jest niższe niż faktyczne ryzyko bezpieczeństwa systemów AI agenticznej. Wysoki wskaźnik prób ataków (12,8%) w porównaniu do zakończonych (1%) sugeruje, że obecne modele często rozpoznają złe zamiary, ale ta obrona nie jest jednolita we wszystkich modelach lub modalnościach.

Szczególnie niepokojące jest to, że ataki oparte na dźwięku mają 49% skuteczność w obsługiwanych środowiskach, ponieważ dźwięk jest rzadziej spotykanym kanałem wejściowym w wielu wdrożeniach agentów, co oznacza, że może być mniej kontrolowany przez zabezpieczenia. Tworzy to potencjalną ślepą strefę, w której atakujący mogą omijać wizualne zabezpieczenia, wykorzystując sygnały audio do manipulowania agentami do wykonywania szkodliwych wywołań narzędzi.

Zmienność między modelami, gdzie jeden model rozpoznaje wstrzyki w prawie 60% przebiegów, a inny podejmuje ataki w ponad 20%, podkreśla, że wybór modelu jest kluczowym czynnikiem w zabezpieczeniach agenticznej AI. Organizacje nie mogą polegać wyłącznie na zabezpieczeniach na poziomie ramowym i muszą uwzględniać specyficzne cechy bezpieczeństwa podstawowych modeli.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktywna kontrola koncepcji+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Co obejrzeć dalej

Deweloperzy i przedsiębiorstwa wdrażające agenticzną sztuczną inteligencję powinni monitorować aktualizacje MMPIBench i powiązanych poprawek bezpieczeństwa. Branża może odnotować większe skupienie na oczyszczaniu wejścia audio i zaostrzeniu uprawnień dla wywołań narzędzi w odpowiedzi na te ustalenia.

Monitoruj aktualizacje MMPIBench oraz kolejne badania, które mogą testować dodatkowe kanały percepcyjne lub bardziej zaawansowane wektory ataku. Powtarzalność benchmarku umożliwia ciągłą weryfikację i ekspansję społeczności.

Obserwuj reakcje branży ze strony głównych twórców frameworków AI oraz dostawców modeli podstawowych, którzy mogą wydać poprawki bezpieczeństwa lub zaktualizowane szkolenia z zakresu bezpieczeństwa, aby rozwiązać konkretne luki zidentyfikowane w kanałach audio i wizualnych.

Obserwuj, jak przedsiębiorstwa wdrażające agenticzną AI dostosowują swoje protokoły bezpieczeństwa, potencjalnie wprowadzając rygorystyczne filtrowanie danych wejściowych dla danych nietekstowych oraz bardziej szczegółowe kontrole uprawnień do wywołań narzędzi, aby ograniczyć ryzyka wskazane w badaniu.

Powiązane przewodniki i quizy

Agenci AIEtyka AIWyjaśnienie modeli AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie ze ścieżką do śledzenia regulacji AI
Uznałeś to za przydatne?