Kembali ke Berita
KeselamatanAI Understanding taklimat

Trend Micro berkata sistem berbilang modelnya mengetuai penanda aras eksploitasi CyberGym

Trend Micro mengatakan sistem TrendAI AESIRnya menghasilkan ranap pembezaan yang disahkan untuk 97% tugas CyberGym, tetapi keputusan dan perbandingan syarikat memerlukan pengesahan bebas.

6 min readRead the linked source
Primary-source image accompanying Trend Micro says its multi-model system led CyberGym’s exploit benchmark
Rujukan sumberSumber direkodkan
Penerbit
edge.prnewswire.com
Pautan sumber
edge.prnewswire.comhttps://edge.prnewswire.com/c/link/?t=0&l=en&o=4759697-1&h=3235159974&u=https%3A%2F%2Fwww.trendaisecurity.com%2Fen-us%2Fresources-insights%2Ftrendai-security-blog%2Ftrendai-first-on-cybergym-top-exploit-benchmark&a=https%3A%2F%2Fwww.trendaisecurity.com%2Fen-us%2Fresources-insights%2Ftrendai-security-blog%2Ftrendai-first-on-cybergym-top-exploit-benchmark
Jenis sumber
Sumber terpaut — status sumber primer belum ditetapkan.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Trend Micro berkata enjin pembaikan eksploitasi agen TrendAInya, bernama kod AESIR, mendapat 97% pada penanda aras CyberGym dan menduduki tempat pertama di papan pendahulu pada Ogos 2026. Syarikat itu berkata sistem itu menghasilkan kira-kira 1,460 pembuktian peringkat bait merentas 188 projek sumber terbuka dan 1,507 kelemahan yang diketahui.

Catatan blog keselamatan Trend Micro bertarikh 26 Ogos 2026 mengatakan enjin eksploitasi-pemulihan ejen TrendAI, bernama kod AESIR, mencapai skor 97% di CyberGym. Syarikat itu menerangkan CyberGym sebagai penanda aras Universiti California, Berkeley yang mengandungi 1,507 kelemahan yang disahkan daripada 188 projek sumber terbuka yang besar. Tugas-tugas tersebut memerlukan menghasilkan fail atau jujukan bait tertentu yang menyebabkan ranap program yang terdedah tetapi bukan rakan sejawatannya yang ditampal, tanpa akses kepada tampung atau binari tetap semasa penyelesaian.

Menurut sumber itu, keputusan AESIR mewakili kira-kira 1,460 ranap pembezaan yang disahkan secara individu. Trend Micro berkata sistem itu dinilai lebih 60 pusingan pembangunan, menggunakan kira-kira 235 jam CPU dan menanggung kira-kira $6,000 dalam yuran antara muka pengaturcaraan aplikasi AI. Syarikat itu membentangkan hasilnya sebagai autonomi sepenuhnya dan mengatakan tiada manusia berada dalam gelung untuk penyerahan penanda aras. Angka-angka ini adalah tuntutan dalam akaun syarikat sendiri; sumber tidak menyediakan audit bebas atau log penyerahan lengkap.

Sistem ini digambarkan sebagai saluran paip bergraduat. Ia mula-mula mencuba kaedah kabur klasik, mutasi benih dan kaedah pembinaan deterministik, kemudian meningkat kepada agen berpandukan AI apabila pendekatan tersebut gagal. Trend Micro mengatakan kira-kira 30% daripada buktinya tidak menggunakan panggilan model bahasa yang besar, manakala kabur mengatasi penaakulan AI lanjutan pada kira-kira satu perempat daripada tugasan. Syarikat itu berkata larian bukan AI yang berjaya boleh mengambil masa kira-kira 60 saat, berbanding dengan kira-kira 18 minit dan kos API $6 untuk percubaan ejen AI.

Trend Micro mengaitkan prestasi yang selebihnya kepada ontologi kerentanan dalaman yang mengandungi lebih daripada 12,500 kenangan episod dan lebih daripada 15,500 benih eksploitasi merentas lebih daripada 180 projek. Ontologi diterangkan sebagai lapisan pengetahuan operasi yang menghubungkan kelas kelemahan, format binari, jenis ranap dan strategi mutasi. AESIR dilaporkan menggunakan tujuh model daripada Anthropic, Google, OpenAI dan DeepSeek dalam peranan yang berbeza, termasuk penaakulan kod sumber, pembinaan format binari dan analisis protokol. Sumber tidak mendedahkan perincian pelaksanaan yang mencukupi untuk menentukan jumlah sumbangan setiap komponen kepada skor akhir.

Butiran sumber: edge.prnewswire.com ↗

Mengapa ia penting

Hasilnya, jika boleh diterbitkan secara bebas, akan mencadangkan bahawa reka bentuk sistem—termasuk pengetahuan kerentanan yang berterusan, berbilang model, kabur deterministik dan semakan permusuhan—boleh lebih penting daripada menggunakan satu model terkemuka. Ia juga menggambarkan kedua-dua potensi dan had penyelidikan kelemahan dibantu AI.

Implikasi utama adalah mengenai seni bina, bukan sekadar kedudukan model. Trend Micro berkata sistem terkemuka di CyberGym menggunakan banyak model sempadan yang sama, manakala markahnya berbeza kerana penghalaan, memori, penggunaan alat dan pengesahan. Perbandingannya menyenaraikan AESIR pada 97%, Sangfor AI pada 93.2%, Whitzard Universiti Fudan pada 91.2%, MDASH Microsoft pada 91% dan Wiz Atlas pada 90.9%. Ia menyenaraikan GPT-5.6 Sol pada 84.5% dan Claude Mythos 5 pada 83.8%. Kedudukan tersebut dibentangkan oleh Trend Micro sebagai keadaan papan pendahulu dan harus dianggap sebagai laporan sumber sehingga disahkan oleh pengendali penanda aras.

Untuk pasukan keselamatan, pengajaran praktikal adalah untuk menempah panggilan model yang mahal untuk kes yang tidak dapat diselesaikan oleh alat yang lebih murah dan lebih mudah dijangka. Fuzzer dan penjana khusus format boleh mengendalikan beberapa kelas kerentanan dengan cepat, manakala model bahasa boleh membantu dengan analisis kod sumber, penaakulan aliran kawalan dan pembinaan eksploitasi berbilang langkah. Lapisan penghalaan juga boleh mengurangkan pergantungan pada satu pembekal. Tetapi ekonomi yang didakwa adalah khusus untuk sistem Trend Micro, beban kerja dan pangkalan pengetahuan peribadi; ia tidak seharusnya digeneralisasikan ke dalam anggaran kos sejagat.

Sumber itu juga menekankan kajian permusuhan model silang. Dalam reka bentuk yang diterangkan AESIR, satu model mencadangkan hipotesis eksploitasi, model lain daripada pembekal yang berbeza cuba menafikannya dan yang ketiga mengadili. Peranan berputar merentasi pusingan. Faedah yang dimaksudkan ialah mengurangkan positif palsu, seperti pepijat jelas yang tidak dapat dicapai, disekat oleh pengesahan input atau di luar model ancaman yang dinyatakan. Ini adalah corak yang berpotensi berguna untuk alatan keselamatan AI, walaupun sumbernya tidak memberikan kadar positif palsu, kadar kelemahan terlepas atau perbandingan terkawal terhadap semakan model tunggal.

Penanda aras penting kerana ia menguji artifak konkrit dan bukannya jawapan perbualan: input peringkat bait yang berkelakuan berbeza pada perisian yang terdedah dan ditampal. Itu adalah tugas yang lebih kuat daripada sekadar menjana penerangan kerentanan yang munasabah. Walaupun begitu, ranap pembezaan dalam penanda aras terkawal tidak bersamaan dengan eksploitasi dunia sebenar yang boleh dipercayai. Ia tidak menetapkan bahawa penyerang boleh mencapai kod yang terdedah dari jauh, memintas pertahanan, mendapat akses berguna atau beroperasi pada skala. Oleh itu, hasilnya merujuk kepada keupayaan pembinaan eksploitasi di bawah keadaan penanda aras, bukan kepada risiko siber keseluruhan atau kesediaan serangan autonomi.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Soalan utama ialah sama ada CyberGym atau penyelidik bebas mengesahkan skor, sama ada penilaian boleh diterbitkan semula, dan berapa banyak keputusan bergantung pada korpus kerentanan persendirian Trend Micro. Penanda aras juga tidak menunjukkan bahawa sistem menemui serangan aktif, berfungsi merentasi perisian yang tidak diketahui atau boleh beroperasi dengan selamat tanpa semakan manusia.

Pertama, pengesahan bebas adalah penting. Sumber itu mengatakan CyberGym mempunyai papan pendahulu rasmi dan sistem penyerahan bebas, tetapi ia tidak termasuk rekod penanda aras langsung, kod boleh diterbitkan semula, set bukti yang diserahkan atau protokol terperinci untuk menyemak markah syarikat. Pengesahan harus menetapkan versi tepat penanda aras, peraturan pemasukan tugas, had perkakasan dan masa, versi model, akses alat dan sama ada semua sistem telah dinilai di bawah keadaan yang setanding.

Kedua, penyelidik harus mengkaji kelebihan data peribadi. Trend Micro berkata ontologinya menggabungkan lebih daripada dua dekad penyelidikan kerentanan yang dikaitkan dengan Trend Micro Research dan Zero Day Initiative, termasuk beribu-ribu benih eksploitasi dan hasil penglibatan. Pengetahuan operasi terkumpul itu mungkin berharga, tetapi ia juga menjadikan keputusan sukar untuk dibandingkan dengan sistem yang hanya menggunakan maklumat awam. Perkara penting yang tidak diketahui ialah sama ada kaedah AESIR dipindahkan ke projek baharu, kelas kerentanan dan format perisian tidak terdapat dalam korpus sejarahnya.

Ketiga, tuntutan penempatan memerlukan bukti yang berasingan. Blog ini membincangkan komponen memburu ancaman yang boleh memeriksa tangkapan honeypot dan mengenal pasti kemungkinan eksploitasi infrastruktur AI, tetapi kerja itu tidak sama dengan skor CyberGym. Penanda aras tidak mengukur sama ada AESIR mengesan kempen aktif, membezakan aktiviti berniat jahat daripada ujian jinak atau menilai sama ada pembetulan yang dihantar mengalih keluar risiko dunia sebenar. Soalan-soalan tersebut memerlukan data operasi, pendedahan kaedah penilaian dan perlindungan yang teliti.

Akhir sekali, pasukan keselamatan harus melihat bagaimana sistem mengendalikan ketidakpastian dan kawalan manusia. Trend Micro mengatakan tugas paling sukar yang tinggal melibatkan urutan penyahkodan FFmpeg yang tepat, mesin keadaan Ghostscript dan struktur ASN.1 kad pintar. Ia juga memberi amaran bahawa sistem berbilang model boleh mengalami kehabisan kuota, kegagalan pembekal senyap, lebihan kos dan regresi setiap model tersembunyi. Sebelum sistem sedemikian digunakan dalam pengeluaran, pasukan memerlukan pengelogan bebas, metrik setiap komponen, kebenaran terkawal, semakan manusia untuk keputusan eksploitasi dan bukti bahawa semakan lawan mengurangkan positif palsu yang berbahaya tanpa menyekat penemuan tulen.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanEtika AIKeselamatan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak peraturan AI
Adakah ini berguna?