Tilbake til Nyheter
SikkerhetAI Understanding orientering

ChosunBiz rapporterer Microsoft sikkerhetsleder sier multi-agent AI forbedrer sårbarhetsdeteksjon

ChosunBiz rapporterer at Microsoft konserndirektør Kim Tae-su sa at arbeidsflyter med flere agenter kan finne og verifisere programvaresårbarheter mer effektivt enn et enkelt AI-system. Rapporten beskriver resultater fra DARPAs AI Cyber ​​Challenge og Microsofts MDASH-system, men påstandene har ikke vært uavhengige...

6 min readRead the original reporting
Primary-source image accompanying ChosunBiz reports Microsoft security executive says multi-agent AI improves vulnerability detection
Tilskrevet rapporteringKilde registrert
Utgiver
biz.chosun.com
Kilde lenke
biz.chosun.comhttps://biz.chosun.com/en/en-it/2026/08/26/DNA3TDFF75HF5IFJD7IL6HJ6WE/?outputType=amp
Kildetype
Rapportering fra en nyhetskanal - ikke et førstepartsdokument.

Det vi ikke kunne bekrefte uavhengig: Dette kravet tilskrives det navngitte utsalgsstedet. Vi har ikke verifisert det mot et førstepartsdokument. (biz.chosun.com)

KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Beregn
Behandlingsressursene som kreves for å trene og kjøre modeller, ofte målt i FLOPS- eller GPU-timer.
Latens
Tiden mellom sending av en forespørsel og mottak av modellens utdata.
Test deg selvAI Agents Quiz

Hva skjedde

Ifølge ChosunBiz sa Kim Tae-su at spesialiserte AI-agenter som jobber sammen kan forbedre sårbarhetsoppdagelse, verifisering, utnyttelsestesting og patchgenerering. Rapporten siterer Team Atlantas ytelse i DARPAs AI Cyber ​​Challenge og beskriver Microsofts MDASH-system, som bruker mer enn 100 underagenter for å analysere programvare.

ChosunBiz rapporterte at Kim Tae-su, Microsofts konserndirektør for sikkerhet og en professor i datateknologi ved Georgia Institute of Technology, kom med kommentarene under en keynote på SMARTCLOUD SHOW 2026 i Seoul. Rapporten sa at foredraget hans dekket "hyperskala feilfunn", inkludert arbeid knyttet til DARPAs AI Cyber ​​Challenge og Microsofts MDASH-sårbarhetsdeteksjonssystem. ChosunBiz presenterte Kims kommentarer som grunnlag for artikkelen; kilden gir ikke en uavhengig utskrift, teknisk papir eller ekstern vurdering av systemene som er beskrevet.

Rapporten sa at Kim ledet Team Atlanta, vinneren av fjorårets AI Cyber ​​Challenge, en DARPA-konkurranse fokusert på å bruke AI til å analysere, oppdage og fikse programvaresårbarheter. ChosunBiz rapporterte at Team Atlanta scoret 392,76 poeng i finalen, mer enn 170 poeng foran nummer to. I kontoen analyserte teamets cyberresonneringssystem 28 åpen kildekode-prosjekter, fant 54 av 70 sårbarheter plassert av arrangører, fikset de fleste sårbarhetene i løpet av en time, og oppdaget 18 tidligere ukjente nulldagssårbarheter. ChosunBiz rapporterte også at mer enn 90 % av de oppdagede sårbarhetene ble bekreftet som reelle, selv om artikkelen ikke forklarer evalueringsmetodikken i detalj.

ChosunBiz rapporterte at systemet kostet rundt $152 per vellykket oppgave, siterer Kim, som sammenlignet dette tallet med de mye høyere kostnadene for menneskelig koderevisjoner eller penetrasjonstester. Rapporten sa at Team Atlanta inkluderte forskere fra Georgia Tech, KAIST, POSTECH og andre institusjoner, med 80 % til 90 % av teamet beskrevet som koreanske. Disse tallene og sammenligningene er rapporterte påstander fra Kim og ChosunBiz, ikke uavhengig verifiserte målinger i det leverte materialet.

Rapporten sa at Kim beskrev begrensninger ved bruk av ett AI-system for å analysere veldig store kodebaser. Som svar brukte teamet en multiagentarkitektur som tildelte forskjellige roller til spesialiserte agenter, inkludert sårbarhetsjakt, statisk analyse, verifisering og patchgenerering. ChosunBiz sa at Microsofts MDASH utvider denne ideen ved først å bygge en trusselmodell fra programvarearkitektur og tidligere sårbarheter, og deretter distribuere mer enn 100 underagenter. Agenter som fungerer som hackere, utviklere og forsvarere, sjekker etter sigende funn mot hverandre, genererer proof-of-concept-kode for å teste utnyttbarhet og produserer utbedringsoppdateringer.

ChosunBiz rapporterte at Kim sa at MDASH hadde identifisert høyrisikoproblemer som potensielt kan tillate en ekstern angriper å oppnå de høyeste systemprivilegiene ved å sende pakker. Kim sa også at MDASH presterte sammenlignbart med nyere frontier-modeller til tross for å kombinere modeller to generasjoner eldre, og at den ble brukt utenfor standarder i ekte programvareutviklingsmiljøer. Den medfølgende rapporten identifiserer ikke disse miljøene, avslører ikke modellene eller testsettene som er involvert, gir eksempler på sårbarhetene eller inkluderer uavhengig bekreftelse av den påståtte ytelsen.

Kildedetaljer: biz.chosun.com ↗

Hvorfor det betyr noe

Hvis den er uavhengig validert, kan tilnærmingen redusere kostnadene for sikkerhetsrevisjoner og hjelpe forsvarere å undersøke programvare raskere. Det kan også øke volumet av oppdagede sårbarheter, og skape press for programvarevedlikeholdere til å verifisere, prioritere og fikse funn raskere.

Den praktiske betydningen er muligheten for å flytte deler av sårbarhetsforskningen fra en arbeidskrevende, episodisk prosess mot kontinuerlig automatisert analyse. ChosunBiz rapporterte Kims anslag om at AI-basert arbeid kan redusere kostnadene ved vellykkede sikkerhetsoppgaver dramatisk sammenlignet med menneskelige revisjoner og penetrasjonstester. Lavere kostnader kan gjøre dypere gjennomgang mer tilgjengelig for organisasjoner som ikke rutinemessig kan ansette spesialiserte sikkerhetsteam, selv om kilden ikke fastslår at den rapporterte prissammenligningen gjelder på tvers av ulike programvaretyper eller driftsforhold.

Et design med flere agenter kan løse et kjent driftsproblem: en generell modell kan tenke godt på én oppgave, men utføre inkonsekvent på en annen. I ChosunBiz sin konto blir separate agenter tildelt smalere ansvar og deretter bedt om å verifisere hverandres funn. Denne strukturen kan gjøre feil lettere å oppdage, men den legger også til krav til koordinering, overvåking og evaluering. Kilden gir ikke nok informasjon til å avgjøre om de ekstra agentene forbedrer nøyaktigheten konsekvent eller bare øker beregnings- og driftskompleksiteten.

Den defensive verdien kan være betydelig hvis systemene pålitelig identifiserer sårbarheter før angripere gjør det. Raskere oppdagelse og generering av oppdateringer kan redusere tiden som feilene fortsatt kan utnyttes, spesielt i mye brukte åpen kildekode-komponenter. Samtidig kan de samme egenskapene være nyttige for angripere. Artikkelens beskrivelse av proof-of-concept generering og pakkeutløste rettighetseskaleringsfunn illustrerer hvorfor organisasjoner trenger strenge kontroller over tilgang, testmiljøer, avsløring og håndtering av utnyttelsesdetaljer.

Rapporten peker også på et bredere skifte i evaluering av cybersikkerhet. Kim sa at AI-modeller hadde overgått menneskelige hackere i en analyse i mars, ifølge ChosunBiz, og hevdet at bedre AI både kunne gjøre programvare tryggere og avsløre flere svakheter. Det er et viktig skille: Å finne flere sårbarheter betyr ikke i seg selv at sikkerheten har blitt bedre. Den offentlige innvirkningen avhenger av om vedlikeholdere kan reprodusere funn, prioritere reelle risikoer, distribuere trygge oppdateringer og forhindre at nygenerert utnyttelseskunnskap blir misbrukt.

Bevisene er fortsatt begrenset i den oppgitte kilden. ChosunBiz er et rapportert-sekundær utsalgssted, og selve artikkelen sier at den ble oversatt av AI. Ingen primær MDASH-dokumentasjon, konkurransedatautgivelse, kode, -protokoll eller uavhengig forskersvar er inkludert. De rapporterte resultatene fortjener derfor oppmerksomhet som en redegjørelse for Microsofts og Kims påstander, men de bør ennå ikke behandles som et generelt bevis på at multiagentsystemer utkonkurrerer menneskelige sikkerhetsteam eller enkeltmodellsystemer under virkelige forhold.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Hva du skal se neste

Nøkkelspørsmålene er om MDASHs resultater holder utenfor benchmarks, hvor ofte den går glipp av reelle sårbarheter eller produserer falske positiver, og hvor sikkert dens proof-of-concept og patch-genereringsevner kontrolleres. Offentlig teknisk dokumentasjon og uavhengig testing vil avklare påstandene.

Første prioritet er uavhengig replikering. Sikkerhetsforskere og programvarevedlikeholdere vil trenge tilgang til klare evalueringsprosedyrer, representative kodebaser, sårbarhetsetiketter og definisjoner på vellykket oppdagelse, bekreftelse og reparasjon. Spesiell oppmerksomhet bør gå til det rapporterte 54-av-70 funnresultatet, de 18 null-dagers funnene, bekreftelsesraten på mer enn 90 % og anslaget på $152 per oppgave. Uten metodiske detaljer kan disse tallene ikke sammenlignes pålitelig med menneskelige revisjoner, automatiserte skannere eller andre AI-systemer.

Det neste problemet er feilkvalitet snarere enn ubehandlet oppdagelsesvolum. Organisasjoner bør undersøke falske positiver, tapte sårbarheter, dupliserte funn, feil alvorlighetsvurderinger og patcher som kompilerer, men endrer tiltenkt atferd eller skaper nye feil. ChosunBiz rapporterte at agenter med forskjellige perspektiver når konsensus, men kilden viser ikke hvordan konsensus måles eller om den korrelerer med virkelighetens korrekthet. Uavhengig testing bør vurdere både sikker oppdatering og konsekvensene av en feil automatisert reparasjon.

Utplasseringssikring vil også ha betydning. Et system som genererer proof-of-concept utnyttelseskode trenger isolasjon, autorisasjonskontroller, revisjonslogger og klare regler for ansvarlig avsløring. Kilden rapporterer at MDASH brukes i ekte programvareutviklingsmiljøer, men spesifiserer ikke miljøene, brukertillatelsene, menneskelige gjennomgangsprosedyrer eller om genererte oppdateringer brukes automatisk. Disse detaljene vil avgjøre om systemet reduserer risiko eller introduserer nye veier for misbruk.

Forskere bør sammenligne multi-agent-tilnærmingen med enklere alternativer, inkludert en enkelt sterk modell, konvensjonelle statiske analyseverktøy, menneskestyrt penetrasjonstesting og kombinasjoner av disse metodene. ChosunBiz rapporterte at MDASH oppnådde ytelse sammenlignbar med nyere grensemodeller mens de brukte eldre modeller, men ga ikke referansedesignet eller forklarte om kostnad, latens, dekning eller pålitelighet var sammenligningens hovedmål. Disse forskjellene er viktige for anskaffelser og sikkerhetsplanlegging.

Til slutt bør vedlikeholdere og beslutningstakere se om AI-assistert sårbarhetsoppdagelse endrer arbeidsbelastningen for avsløring. Flere funn kan forbedre programvaresikkerheten hvis de er nøyaktige og ansvarlig rapporterte, men kan også overvelde åpen kildekode-prosjekter og mindre leverandører. Meningsfulle ukjente inkluderer systemets dekning på tvers av programmeringsspråk og applikasjonstyper, dets ytelse på tidligere usett kode, hyppigheten av farlige oppdateringsfeil og omfanget av menneskelig tilsyn som kreves før noe resultat blir utført.

Relaterte guider og quizer

AI-agenterAI-modeller forklartKI-etikkAI treningTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-reguleringssporeren
Fant du dette nyttig?