Înapoi la Știri
InovațieAI Understanding briefing

SWE-bench Benchmark Science constată că agenții de codificare se luptă cu software-ul științific

O nouă imprimare preliminară arXiv introduce un etalon de 119 sarcini pentru testarea agenților de codare pe software științific și raportează că agentul cu cele mai bune performanțe a obținut un scor sub 50% la pass@1.

5 min readRead the primary source
Source-provided image accompanying SWE-bench Science benchmark finds coding agents struggle with scientific software
Document sursă primarăSursa înregistrată
Editor
arxiv.org
Link sursă
arxiv.orghttps://arxiv.org/abs/2608.19799
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Jeton
O bucată de text procesată de modele de limbaj, cum ar fi un cuvânt sau un simbol.
Testează-teTest pentru agenții AI

Ce sa întâmplat

Un preprint arXiv introduce SWE-bench Science, un la nivel de depozit care acoperă 119 sarcini din 98 de depozite GitHub din 20 de domenii științifice. Autorii raportează că agentul cu cele mai bune performanțe în evaluarea lor, Claude Code cu Opus-5 (max), a obținut un scor pass@1 sub 50%.

Lucrarea identifică patru mecanisme de eșec recurente în analiza sa. Acestea sunt deficite de cunoștințe științifice sau de abstractizare; explorare greșită sau reparare la nivel de suprafață; acoperire incompletă a reparațiilor sau integrare în sistem; și eșecurile de a generaliza cunoștințele științifice dincolo de cazurile observate. Luată împreună, această listă descrie patru moduri distincte în care o reparație poate fi insuficientă: un agent poate să nu aibă cunoștințele științifice relevante, să urmeze o cale inadecvată sau superficială, să nu reușească să abordeze întreaga reparație sau integrarea acesteia sau să nu reușească să transmită cunoștințele din cazurile pe care le-a văzut în cazurile dincolo de acestea. Sursa le prezintă ca mecanisme recurente în analiza sa, deci fac parte din relatarea eșecului a lucrării, mai degrabă decât o afirmație că fiecare sarcină prezintă fiecare mecanism.

Autorii efectuează, de asemenea, o ablație asociată care elimină îndrumările științifice explicite, păstrând în același timp depozitul și contextul de inginerie executabil. Prin urmare, comparația menține depozitul și contextul de inginerie executabil în loc, schimbând în același timp prezența îndrumărilor științifice explicite. Această configurare este utilizată pentru a examina ce se întâmplă atunci când componenta de ghidare este eliminată dintr-un context de activitate reținut altfel. Izolează rolul atribuit ghidului în comparația raportată, fără a modifica descrierea sarcinilor de referință sau a adăuga un rezultat separat de agent. Punctul cheie în relatarea lucrării este contrastul dintre păstrarea contextului ingineresc și eliminarea îndrumării științifice explicite.

Ei raportează că ghidarea bine fundamentată poate limita reparațiile și poate îmbunătăți performanța medie și eficiența tokenului, în timp ce ghidarea prost aliniată poate provoca ancorarea și nu îmbunătățește neapărat succesul exact al reparației. Astfel, efectul raportat este mai degrabă condiționat decât uniform pozitiv: ghidarea poate fi utilă atunci când este bine bazată, dar ghidarea care este prost aliniată poate conduce reparația prin ancorare fără a produce un succes mai bun al reparației exacte. Rezultatul se referă la performanța medie și eficiența -ului, precum și la succesul reparațiilor exacte, iar sursa distinge aceste rezultate în loc să le trateze ca interschimbabile. Aceasta este calificarea completă atașată rezultatului îndrumării în textul furnizat.

Detalii sursa: arxiv.org

De ce contează

Software-ul științific poate funcționa ca parte a instrumentului utilizat pentru a produce dovezi. -ul sugerează că agenții de codificare se confruntă cu provocări dincolo de repararea codului obișnuit, inclusiv raționamentul științific, acoperirea extinsă a reparațiilor, integrarea sistemului și aplicarea cunoștințelor în cazuri nefamiliare.

Ablația de ghidare complică, de asemenea, presupunerea că adăugarea mai multor informații științifice va face automat un agent mai sigur sau mai precis. Potrivit sursei, îndrumările utile au îmbunătățit performanța medie și eficiența tokenului, dar ghidarea prost aliniată ar putea ancora procesul de reparare și nu poate îmbunătăți succesul exact al reparației. Implicația nu este că informația științifică nu are valoare; este că valoarea sa depinde de cât de bine se potrivește ghidajul reparației care se încearcă. Prin urmare, sursa lasă cititorului un rezultat condiționat: aceeași practică generală de furnizare de îndrumare poate fi asociată cu îmbunătățirea în unele circumstanțe și cu ancorarea fără îmbunătățire exactă a reparației în altele.

Această constatare are implicații practice pentru persoanele care furnizează note de domeniu, descrieri ale problemelor sau explicații generate agenților de codare. Acele materiale sunt forme de îndrumare științifică în sensul larg folosit de discuție, astfel încât ablația face ca calitatea și potrivirea lor să fie relevante pentru procesul de reparație. O notă, o descriere sau o explicație poate fi menită să ajute la constrângerea unei reparații, dar rezultatul raportat înseamnă că prezența unui astfel de material nu este suficientă pentru a stabili un succes mai bun al reparației exacte. Distincția relevantă este între îndrumarea utilă care se potrivește bine cu sarcina și îndrumarea care este slab aliniată cu aceasta. Această distincție urmează raportul sursei privind performanța, eficiența simbolului, ancorarea și succesul exact al reparației.

Îndrumarea poate ajuta atunci când este precisă și se potrivește bine cu sarcina, în timp ce contextul suplimentar poate îndruma un agent către reparația greșită. Lucrarea nu arată din rezumat cât de des a avut loc fiecare rezultat. În consecință, textul furnizat susține o interpretare calificată mai degrabă decât o regulă generală cu privire la contextul adăugat: înregistrează posibile îmbunătățiri și posibile ancorari, lăsând în același timp nespecificată frecvența acestor rezultate. Importanța rezultatului constă în acea condiție nerezolvată. Discuția identifică ca fiind relevantă pentru comportamentul raportat alinierea îndrumării și nu doar existența mai multor cuvinte în jurul sarcinii.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Ce să urmărești în continuare

Lucrarea completă este necesară pentru a evalua combinația de sarcini, compararea agenților, protocolul de evaluare și scorurile exacte. Întrebările deschise importante includ cât de reprezentative sunt depozitele, dacă rezultatele se transferă în fluxuri de lucru științifice în direct și cât de fiabil îndrumarea științifică îmbunătățește reparațiile fără a provoca ancorarea.

Rezultatul ghidului merită o analiză atentă în evaluările viitoare. Sursa raportează performanța medie și efectele eficienței -ului, dar rezumatul nu cuantifică îmbunătățirea, definește ceea ce a considerat drept ghid bine fundamentat sau prost aliniat sau arată dacă efectul a variat în funcție de domeniul științific sau paradigma sarcinii. Aceste omisiuni identifică informațiile specifice încă necesare pentru interpretarea rezultatului: dimensiunea modificării raportate, criteriile pentru cele două descrieri de ghid și măsura în care efectul diferă în funcție de domenii sau paradigme. Până când aceste puncte sunt disponibile, concluzia de orientare rămâne un rezultat calificat din contul furnizat, mai degrabă decât o măsurare complet specificată.

De asemenea, nu se știe dacă performanța de referință mai ridicată duce la concluzii științifice mai fiabile în practică. Prin urmare, un rezultat mai bun la nivelul de referință și o concluzie mai fiabilă nu sunt prezentate ca rezultate echivalente în textul furnizat. Întrebarea deschisă se referă la transferul de la performanța măsurată a bancului de testare la munca științifică în practică, inclusiv dacă rezultatul de referință spune ceva despre fiabilitatea concluziilor. Proiectul nu oferă dovezi care să rezolve această întrebare, așa că rămâne un element de urmărit alături de detaliile ablației de ghidare și evaluarea acesteia.

Preprintul prezintă un banc de testare pentru studierea capabilităților și eșecurilor agentului de codare; nu demonstrează, din textul furnizat, desfășurare sigură, descoperire științifică autonomă sau îmbunătățiri validate ale cercetării publicate. Aceste limite definesc ceea ce poate și nu poate fi dedus din preprint, așa cum este descris aici. Patul de testare poate fi urmărit pentru ceea ce dezvăluie despre capabilități și eșecuri, în timp ce afirmațiile mai puternice enumerate în propoziție rămân nedovedite în textul furnizat. Prin urmare, atenția viitoare ar trebui să rămână asupra rezultatelor de referință și a ghidurilor declarate, fără a le trata ca o dovadă a siguranței implementării, a descoperirii autonome sau a îmbunătățirii cercetării publicate.

Ghiduri și chestionare conexe

Agenți AIModelele AI explicateAntrenament AITestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostru
Ai găsit asta util?