Hva skjedde
Ifølge ChosunBiz sa Kim Tae-su at spesialiserte AI-agenter som jobber sammen kan forbedre sårbarhetsoppdagelse, verifisering, utnyttelsestesting og patchgenerering. Rapporten siterer Team Atlantas ytelse i DARPAs AI Cyber Challenge og beskriver Microsofts MDASH-system, som bruker mer enn 100 underagenter for å analysere programvare.
ChosunBiz rapporterte at Kim Tae-su, Microsofts konserndirektør for sikkerhet og en professor i datateknologi ved Georgia Institute of Technology, kom med kommentarene under en keynote på SMARTCLOUD SHOW 2026 i Seoul. Rapporten sa at foredraget hans dekket "hyperskala feilfunn", inkludert arbeid knyttet til DARPAs AI Cyber Challenge og Microsofts MDASH-sårbarhetsdeteksjonssystem. ChosunBiz presenterte Kims kommentarer som grunnlag for artikkelen; kilden gir ikke en uavhengig utskrift, teknisk papir eller ekstern vurdering av systemene som er beskrevet.
Rapporten sa at Kim ledet Team Atlanta, vinneren av fjorårets AI Cyber Challenge, en DARPA-konkurranse fokusert på å bruke AI til å analysere, oppdage og fikse programvaresårbarheter. ChosunBiz rapporterte at Team Atlanta scoret 392,76 poeng i finalen, mer enn 170 poeng foran nummer to. I kontoen analyserte teamets cyberresonneringssystem 28 åpen kildekode-prosjekter, fant 54 av 70 sårbarheter plassert av arrangører, fikset de fleste sårbarhetene i løpet av en time, og oppdaget 18 tidligere ukjente nulldagssårbarheter. ChosunBiz rapporterte også at mer enn 90 % av de oppdagede sårbarhetene ble bekreftet som reelle, selv om artikkelen ikke forklarer evalueringsmetodikken i detalj.
ChosunBiz rapporterte at systemet kostet rundt $152 per vellykket oppgave, siterer Kim, som sammenlignet dette tallet med de mye høyere kostnadene for menneskelig koderevisjoner eller penetrasjonstester. Rapporten sa at Team Atlanta inkluderte forskere fra Georgia Tech, KAIST, POSTECH og andre institusjoner, med 80 % til 90 % av teamet beskrevet som koreanske. Disse tallene og sammenligningene er rapporterte påstander fra Kim og ChosunBiz, ikke uavhengig verifiserte målinger i det leverte materialet.
Rapporten sa at Kim beskrev begrensninger ved bruk av ett AI-system for å analysere veldig store kodebaser. Som svar brukte teamet en multiagentarkitektur som tildelte forskjellige roller til spesialiserte agenter, inkludert sårbarhetsjakt, statisk analyse, verifisering og patchgenerering. ChosunBiz sa at Microsofts MDASH utvider denne ideen ved først å bygge en trusselmodell fra programvarearkitektur og tidligere sårbarheter, og deretter distribuere mer enn 100 underagenter. Agenter som fungerer som hackere, utviklere og forsvarere, sjekker etter sigende funn mot hverandre, genererer proof-of-concept-kode for å teste utnyttbarhet og produserer utbedringsoppdateringer.
ChosunBiz rapporterte at Kim sa at MDASH hadde identifisert høyrisikoproblemer som potensielt kan tillate en ekstern angriper å oppnå de høyeste systemprivilegiene ved å sende pakker. Kim sa også at MDASH presterte sammenlignbart med nyere frontier-modeller til tross for å kombinere modeller to generasjoner eldre, og at den ble brukt utenfor standarder i ekte programvareutviklingsmiljøer. Den medfølgende rapporten identifiserer ikke disse miljøene, avslører ikke modellene eller testsettene som er involvert, gir eksempler på sårbarhetene eller inkluderer uavhengig bekreftelse av den påståtte ytelsen.
Kildedetaljer: biz.chosun.com ↗
Hvorfor det betyr noe
Hvis den er uavhengig validert, kan tilnærmingen redusere kostnadene for sikkerhetsrevisjoner og hjelpe forsvarere å undersøke programvare raskere. Det kan også øke volumet av oppdagede sårbarheter, og skape press for programvarevedlikeholdere til å verifisere, prioritere og fikse funn raskere.
Den praktiske betydningen er muligheten for å flytte deler av sårbarhetsforskningen fra en arbeidskrevende, episodisk prosess mot kontinuerlig automatisert analyse. ChosunBiz rapporterte Kims anslag om at AI-basert arbeid kan redusere kostnadene ved vellykkede sikkerhetsoppgaver dramatisk sammenlignet med menneskelige revisjoner og penetrasjonstester. Lavere kostnader kan gjøre dypere gjennomgang mer tilgjengelig for organisasjoner som ikke rutinemessig kan ansette spesialiserte sikkerhetsteam, selv om kilden ikke fastslår at den rapporterte prissammenligningen gjelder på tvers av ulike programvaretyper eller driftsforhold.
Et design med flere agenter kan løse et kjent driftsproblem: en generell modell kan tenke godt på én oppgave, men utføre inkonsekvent på en annen. I ChosunBiz sin konto blir separate agenter tildelt smalere ansvar og deretter bedt om å verifisere hverandres funn. Denne strukturen kan gjøre feil lettere å oppdage, men den legger også til krav til koordinering, overvåking og evaluering. Kilden gir ikke nok informasjon til å avgjøre om de ekstra agentene forbedrer nøyaktigheten konsekvent eller bare øker beregnings- og driftskompleksiteten.
Den defensive verdien kan være betydelig hvis systemene pålitelig identifiserer sårbarheter før angripere gjør det. Raskere oppdagelse og generering av oppdateringer kan redusere tiden som feilene fortsatt kan utnyttes, spesielt i mye brukte åpen kildekode-komponenter. Samtidig kan de samme egenskapene være nyttige for angripere. Artikkelens beskrivelse av proof-of-concept generering og pakkeutløste rettighetseskaleringsfunn illustrerer hvorfor organisasjoner trenger strenge kontroller over tilgang, testmiljøer, avsløring og håndtering av utnyttelsesdetaljer.
Rapporten peker også på et bredere skifte i evaluering av cybersikkerhet. Kim sa at AI-modeller hadde overgått menneskelige hackere i en analyse i mars, ifølge ChosunBiz, og hevdet at bedre AI både kunne gjøre programvare tryggere og avsløre flere svakheter. Det er et viktig skille: Å finne flere sårbarheter betyr ikke i seg selv at sikkerheten har blitt bedre. Den offentlige innvirkningen avhenger av om vedlikeholdere kan reprodusere funn, prioritere reelle risikoer, distribuere trygge oppdateringer og forhindre at nygenerert utnyttelseskunnskap blir misbrukt.
Bevisene er fortsatt begrenset i den oppgitte kilden. ChosunBiz er et rapportert-sekundær utsalgssted, og selve artikkelen sier at den ble oversatt av AI. Ingen primær MDASH-dokumentasjon, konkurransedatautgivelse, kode, -protokoll eller uavhengig forskersvar er inkludert. De rapporterte resultatene fortjener derfor oppmerksomhet som en redegjørelse for Microsofts og Kims påstander, men de bør ennå ikke behandles som et generelt bevis på at multiagentsystemer utkonkurrerer menneskelige sikkerhetsteam eller enkeltmodellsystemer under virkelige forhold.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Hva du skal se neste
Nøkkelspørsmålene er om MDASHs resultater holder utenfor benchmarks, hvor ofte den går glipp av reelle sårbarheter eller produserer falske positiver, og hvor sikkert dens proof-of-concept og patch-genereringsevner kontrolleres. Offentlig teknisk dokumentasjon og uavhengig testing vil avklare påstandene.
Første prioritet er uavhengig replikering. Sikkerhetsforskere og programvarevedlikeholdere vil trenge tilgang til klare evalueringsprosedyrer, representative kodebaser, sårbarhetsetiketter og definisjoner på vellykket oppdagelse, bekreftelse og reparasjon. Spesiell oppmerksomhet bør gå til det rapporterte 54-av-70 funnresultatet, de 18 null-dagers funnene, bekreftelsesraten på mer enn 90 % og anslaget på $152 per oppgave. Uten metodiske detaljer kan disse tallene ikke sammenlignes pålitelig med menneskelige revisjoner, automatiserte skannere eller andre AI-systemer.
Det neste problemet er feilkvalitet snarere enn ubehandlet oppdagelsesvolum. Organisasjoner bør undersøke falske positiver, tapte sårbarheter, dupliserte funn, feil alvorlighetsvurderinger og patcher som kompilerer, men endrer tiltenkt atferd eller skaper nye feil. ChosunBiz rapporterte at agenter med forskjellige perspektiver når konsensus, men kilden viser ikke hvordan konsensus måles eller om den korrelerer med virkelighetens korrekthet. Uavhengig testing bør vurdere både sikker oppdatering og konsekvensene av en feil automatisert reparasjon.
Utplasseringssikring vil også ha betydning. Et system som genererer proof-of-concept utnyttelseskode trenger isolasjon, autorisasjonskontroller, revisjonslogger og klare regler for ansvarlig avsløring. Kilden rapporterer at MDASH brukes i ekte programvareutviklingsmiljøer, men spesifiserer ikke miljøene, brukertillatelsene, menneskelige gjennomgangsprosedyrer eller om genererte oppdateringer brukes automatisk. Disse detaljene vil avgjøre om systemet reduserer risiko eller introduserer nye veier for misbruk.
Forskere bør sammenligne multi-agent-tilnærmingen med enklere alternativer, inkludert en enkelt sterk modell, konvensjonelle statiske analyseverktøy, menneskestyrt penetrasjonstesting og kombinasjoner av disse metodene. ChosunBiz rapporterte at MDASH oppnådde ytelse sammenlignbar med nyere grensemodeller mens de brukte eldre modeller, men ga ikke referansedesignet eller forklarte om kostnad, latens, dekning eller pålitelighet var sammenligningens hovedmål. Disse forskjellene er viktige for anskaffelser og sikkerhetsplanlegging.
Til slutt bør vedlikeholdere og beslutningstakere se om AI-assistert sårbarhetsoppdagelse endrer arbeidsbelastningen for avsløring. Flere funn kan forbedre programvaresikkerheten hvis de er nøyaktige og ansvarlig rapporterte, men kan også overvelde åpen kildekode-prosjekter og mindre leverandører. Meningsfulle ukjente inkluderer systemets dekning på tvers av programmeringsspråk og applikasjonstyper, dets ytelse på tidligere usett kode, hyppigheten av farlige oppdateringsfeil og omfanget av menneskelig tilsyn som kreves før noe resultat blir utført.