Tilbake til Nyheter
SikkerhetAI Understanding orientering

Trend Micro sier at deres multimodellsystem ledet CyberGyms utnyttelsesreferanse

Trend Micro sier at deres TrendAI AESIR-system produserte verifiserte differensialkrasj for 97 % av CyberGym-oppgavene, men selskapets resultater og sammenligninger krever uavhengig bekreftelse.

6 min readRead the linked source
Primary-source image accompanying Trend Micro says its multi-model system led CyberGym’s exploit benchmark
KildereferanseKilde registrert
Utgiver
edge.prnewswire.com
Kilde lenke
edge.prnewswire.comhttps://edge.prnewswire.com/c/link/?t=0&l=en&o=4759697-1&h=3235159974&u=https%3A%2F%2Fwww.trendaisecurity.com%2Fen-us%2Fresources-insights%2Ftrendai-security-blog%2Ftrendai-first-on-cybergym-top-exploit-benchmark&a=https%3A%2F%2Fwww.trendaisecurity.com%2Fen-us%2Fresources-insights%2Ftrendai-security-blog%2Ftrendai-first-on-cybergym-top-exploit-benchmark
Kildetype
Koblet kilde – status for primærkilde er ikke etablert.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Test deg selvAI Agents Quiz

Hva skjedde

Trend Micro sier at deres TrendAI-agentiske utnyttelsesremedieringsmotor, kodenavnet AESIR, scoret 97 % på CyberGym- og rangert først på ledertavlen fra august 2026. Selskapet sier at systemet produserte omtrent 1460 byte-nivåbevis på tvers av 188 åpen kildekode-prosjekter og 1507 kjente sårbarheter.

Et Trend Micro-sikkerhetsblogginnlegg datert 26. august 2026 sier at deres TrendAI agent-utbedringsmotor, kodenavnet AESIR, oppnådde en poengsum på 97 % på CyberGym. Selskapet beskriver CyberGym som en for University of California, Berkeley som inneholder 1507 bekreftede sårbarheter fra 188 store åpen kildekode-prosjekter. Oppgavene krever å produsere en spesifikk fil eller bytesekvens som krasjer et sårbart program, men ikke dets patchede motstykke, uten tilgang til oppdateringen eller fast binær under løsning.

I følge kilden representerer AESIRs resultat rundt 1460 individuelt verifiserte differensialkrasj. Trend Micro sier at systemet ble evaluert over 60 utviklingsrunder, forbrukte omtrent 235 CPU-timer og pådro seg omtrent $6 000 i gebyrer for AI-applikasjonsprogrammering. Selskapet presenterer resultatet som fullstendig autonomt og sier at ingen mennesker var i løkken for -innleveringene. Disse tallene er krav i selskapets egen konto; kilden gir ikke en uavhengig revisjon eller en fullstendig innsendingslogg.

Systemet beskrives som en gradert rørledning. Den prøver først klassisk fuzzing, frømutasjon og deterministiske konstruksjonsmetoder, og eskalerer deretter til AI-veiledede agenter når disse tilnærmingene mislykkes. Trend Micro sier at omtrent 30 % av bevisene ikke brukte store språkmodellanrop, mens de klarte bedre enn utvidet AI-resonnement på omtrent en fjerdedel av oppgavene. Selskapet sier at en vellykket ikke-AI-kjøring kan ta omtrent 60 sekunder, sammenlignet med omtrent 18 minutter og $6 i API-kostnader for et forsøk på AI-agent.

Trend Micro tilskriver gjenværende ytelse til en intern sårbarhetsontologi som inneholder mer enn 12 500 episodiske minner og mer enn 15 500 utnyttelsesfrø på tvers av mer enn 180 prosjekter. Ontologien beskrives som et operativt kunnskapslag som kobler sammen sårbarhetsklasser, binære formater, krasjtyper og mutasjonsstrategier. AESIR bruker angivelig syv modeller fra Anthropic, Google, OpenAI og DeepSeek i forskjellige roller, inkludert kildekoderesonnement, binærformatkonstruksjon og protokollanalyse. Kilden avslører ikke nok implementeringsdetaljer til å fastslå hvor mye hver komponent bidro til den endelige poengsummen.

Kildedetaljer: edge.prnewswire.com ↗

Hvorfor det betyr noe

Resultatet, hvis uavhengig reproduserbart, antyder at systemdesign – inkludert vedvarende sårbarhetskunnskap, flere modeller, deterministisk fuzzing og kontradiktorisk vurdering – kan ha mer betydning enn å bruke en enkelt ledende modell. Den illustrerer også både potensialet og grensene for AI-assistert sårbarhetsforskning.

Den sentrale implikasjonen handler om arkitektur, ikke bare modellrangeringer. Trend Micro sier at de ledende systemene på CyberGym bruker mange av de samme frontier-modellene, mens poengsummen deres varierer på grunn av ruting, minne, verktøybruk og validering. Sammenligningen viser AESIR på 97 %, Sangfor AI på 93,2 %, Fudan Universitys Whitzard på 91,2 %, Microsofts MDASH på 91 % og Wiz Atlas på 90,9 %. Den viser GPT-5.6 Sol på 84,5 % og Claude Mythos 5 på 83,8 %. Disse rangeringene presenteres av Trend Micro som statusen til ledertavlen og bør behandles som kilderapportert inntil de er bekreftet av referanseoperatøren.

For sikkerhetsteam er den praktiske lærdommen å reservere dyre modellanrop for saker som billigere, mer forutsigbare verktøy ikke kan løse. Fuzzere og formatspesifikke generatorer kan håndtere enkelte sårbarhetsklasser raskt, mens språkmodeller kan hjelpe med kildekodeanalyse, kontroll-flyt-resonnement og flertrinns utnyttelseskonstruksjon. Et rutinglag kan også redusere avhengigheten av én leverandør. Men den påståtte økonomien er spesifikk for Trend Micros system, arbeidsmengde og private kunnskapsbase; de bør ikke generaliseres til et universelt kostnadsestimat.

Kilden legger også vekt på kontradiktorisk vurdering på tvers av modeller. I AESIRs beskrevne design foreslår en modell en utnyttelseshypotese, en annen modell fra en annen leverandør prøver å tilbakevise den og en tredje bedømmer. Roller roterer på tvers av runder. Den tiltenkte fordelen er å redusere falske positiver, for eksempel tilsynelatende feil som ikke er tilgjengelige, blokkert av inndatavalidering eller utenfor den angitte trusselmodellen. Dette er et potensielt nyttig mønster for AI-sikkerhetsverktøy, selv om kilden ikke gir falske positive rater, tapte sårbarhetsrater eller en kontrollert sammenligning med enkeltmodellgjennomgang.

Referansemålet er viktig fordi det tester en konkret artefakt i stedet for et samtalesvar: en input på bytenivå som oppfører seg annerledes på sårbar og lappet programvare. Det er en sterkere oppgave enn å bare generere en plausibel sårbarhetsbeskrivelse. Likevel tilsvarer ikke en differensialkrasj i en kontrollert en pålitelig utnyttelse i den virkelige verden. Den fastslår ikke at en angriper kan nå den sårbare koden eksternt, omgå forsvar, få nyttig tilgang eller operere i stor skala. Resultatet taler derfor om utnyttelseskonstruksjonsevne under benchmark-forhold, ikke til generell cyberrisiko eller autonom offensiv beredskap.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Hva du skal se neste

Nøkkelspørsmålene er om CyberGym eller uavhengige forskere bekrefter poengsummen, om evalueringen kan reproduseres, og hvor mye av resultatet avhenger av Trend Micros private sårbarhetskorpus. Referansen viser heller ikke at systemet finner aktive angrep, fungerer på tvers av ukjent programvare eller trygt kan operere uten menneskelig vurdering.

For det første er uavhengig bekreftelse avgjørende. Kilden sier at CyberGym har en offisiell ledertavle og et uavhengig innsendingssystem, men det inkluderer ikke en direkte -post, reproduserbar kode, det innsendte bevissettet eller en detaljert protokoll for å sjekke selskapets poengsum. Bekreftelsen bør etablere den eksakte versjonen av referansen, regler for oppgaveinkludering, maskinvare og tidsbegrensninger, modellversjoner, verktøytilgang og om alle systemene ble evaluert under sammenlignbare forhold.

For det andre bør forskere undersøke fordelen med private data. Trend Micro sier at deres ontologi omfatter mer enn to tiår med sårbarhetsforskning assosiert med Trend Micro Research og Zero Day Initiative, inkludert tusenvis av utnyttelsesfrø og engasjementsresultater. Den akkumulerte operasjonelle kunnskapen kan være verdifull, men den gjør også resultatet vanskelig å sammenligne med et system som kun bruker offentlig informasjon. Det viktige ukjente er om AESIRs metode overføres til nye prosjekter, sårbarhetsklasser og programvareformater fraværende i dets historiske korpus.

For det tredje krever distribusjonskrav separate bevis. Bloggen diskuterer en trusseljaktende komponent som kan undersøke honeypot-fangster og identifisere mulig utnyttelse av AI-infrastruktur, men det arbeidet er ikke det samme som CyberGym-score. Referansemålet måler ikke om AESIR oppdager aktive kampanjer, skiller ondsinnet aktivitet fra godartet testing eller evaluerer om en levert rettelse fjernet risikoen i den virkelige verden. Disse spørsmålene vil kreve operasjonelle data, avsløring av evalueringsmetoder og nøye sikkerhetstiltak.

Til slutt bør sikkerhetsteam se på hvordan systemet håndterer usikkerhet og menneskelig kontroll. Trend Micro sier at de vanskeligste gjenværende oppgavene involverer presise FFmpeg-dekodingssekvenser, Ghostscript-tilstandsmaskiner og smartkort ASN.1-strukturer. Den advarer også om at flermodellsystemer kan lide av kvotebruk, stille leverandørsvikt, kostnadsoverskridelser og skjulte regresjoner per modell. Før slike systemer brukes i produksjon, trenger teamene uavhengig logging, per-komponent-målinger, kontrollerte tillatelser, menneskelig vurdering for utnyttelsesbeslutninger og bevis på at kontradiktoriske kontroller reduserer skadelige falske positiver uten å undertrykke ekte funn.

Relaterte guider og quizer

AI-agenterAI-modeller forklartKI-etikkAI-sikkerhetTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-reguleringssporeren
Fant du dette nyttig?