Tilbake til Nyheter
InnovasjonAI Understanding orientering

JIT-Agent foreslår on-the-fly selegenerering for AI-agenter

Et nytt arXiv preprint presenterer JIT-Agent, en modell designet for å generere, reparere og forbedre programvareselene som veileder AI-agenter. Forfatterne rapporterer betydelige benchmarkgevinster på tvers av flere språkmodellfamilier, men verket forblir et ugjennomgått forhåndstrykk uten uavhengig validering i kilden.

5 min readRead the primary source
Primary-source image accompanying JIT-Agent proposes on-the-fly harness generation for AI agents
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.25593
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Minne (agentminne)
Lagret kontekst en AI-agent bruker på tvers av trinn eller økter for å forbedre kontinuiteten.
Fundamentmodell
En stor ferdigtrent modell som kan tilpasses mange nedstrømsoppgaver.
Test deg selvAI Agents Quiz

Hva skjedde

Forskere introduserte JIT-Agent, en modell beregnet på å lage oppgavespesifikke seler for eksisterende AI-agenter. Selen styrer funksjoner som minnehåndtering, planlegging, handlingsprotokoller og verktøyorkestrering.

arXiv-artikkelen, sendt inn 26. august, beskriver JIT-Agent som en «sele-intelligensmodell». Formålet er å generere en fungerende agentsele for en oppgave som er for hånden ved å bruke en off-the-sokkel agentisk storspråklig modell. Forfatterne definerer en sele som det omgivende systemet som styrer hukommelse, planlegging, handlinger, verktøy og ferdigheter, snarere enn selve grunnmodellen. I den innrammingen er modellen og selen separate deler av det totale agentsystemet. Forslaget fokuserer derfor på å generere det operative laget rundt en eksisterende modell, med oppgaven som bestemmer hva dette laget skal gjøre.

Det foreslåtte systemet representerer en sele som en komponerbar artefakt styrt av en fast fire-moduls protokoll. I følge papiret kan JIT-Agent tilpasse artefakten for en bestemt oppgave, reparere den når utførelsen er ustabil, og forbedre fremtidige seler ved å destillere ytelsessignaler fra et ekspanderende arkiv med tidligere konfigurasjoner. Dette gjør selve selen til et objekt som kan genereres og foredles av en modell. Beskrivelsen behandler disse konfigurasjonene som gjenbrukbare programvarestrukturer i stedet for som engangsinstruksjoner. Den plasserer også generasjons-, reparasjons- og forbedringstrinn innenfor den samme generelle sele-sentrerte tilnærmingen.

Forfatterne rapporterer resultater på DeepSearchQA og OdysseyBench, blant andre kontrollerte evalueringer. Med JIT-Agent som gir selehjelp, sier de at DeepSeek-V4-Flash overgikk GPT-5.6 med 9,1 poeng på DeepSearchQA og 4,3 poeng på OdysseyBench. De rapporterer også gevinster på opptil 20,2 poeng for GLM-5.2, sammen med konsekvente forbedringer på tvers av DeepSeek V4, Mimo-V2.5 og Qwen3.6 modellfamilier. Avisen sier at de genererte selene var konkurransedyktige med kjøretider for eldre agenter, inkludert OpenCode og Claude Code. Samlet presenteres disse resultatene som bevis for rollen til genererte seler i de evaluerte innstillingene, mens kilden forblir grunnlaget for de rapporterte sammenligningene.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Papiret argumenterer for at agentytelse avhenger av mer enn den underliggende språkmodellen. Hvis de rapporterte resultatene holder stand, kan forbedring av den omkringliggende selen bli en annen måte å skalere agentkapasiteten på uten å endre selve fundamentmodellen.

Avisens sentrale påstand er at agentevnen ikke bestemmes av modellen alene. I praktiske systemer avhenger en agents oppførsel også av hvordan den lagrer informasjon, dekomponerer oppgaver, velger verktøy og omsetter beslutninger til handlinger. Det flytter oppmerksomheten fra en enkelt modell leaderboard mot hele programvarelaget som får en modell til å fungere som en agent. Under denne visningen kan endringer i den omkringliggende arbeidsflyten påvirke hvordan den samme underliggende modellen håndterer en oppgave. Selen blir en del av det som må undersøkes når man vurderer en agents oppførsel og resultater.

Hvis den reproduseres uavhengig, kan tilnærmingen gi utviklere en ny måte å forbedre agenter uten å omskolere eller erstatte grunnmodellene deres. En oppgavetilpasset sele kan hjelpe den samme modellen til å oppføre seg annerledes for forskning, koding eller andre arbeidsflyter. De rapporterte resultatene tyder også på at relativt sterke modeller fortsatt kan ha vesentlig nytte av bedre orkestrering. Denne muligheten utvider settet med tekniske valg tilgjengelig for team som bygger agentsystemer. Det gjør også design av minne, planlegging, handlinger og verktøy til en mer synlig del av utviklingsprosessen.

Ideen har implikasjoner for hvordan AI-systemer sammenlignes. Et referanseresultat kan gjenspeile ikke bare modellen, men også rammeverket for minne, planlegging og bruk av verktøy som er pakket rundt den. Automatisk genererte seler kan akselerere eksperimentering, men de kan også gjøre sammenligninger vanskeligere hvis forskjellige systemer bruker vesentlig forskjellige kjøretidsstillaser. Kilden fastslår ikke at JIT-Agent er billigere, sikrere eller mer pålitelig enn eksisterende tilnærminger. Som et resultat avhenger betydningen av de rapporterte gevinstene av hvordan selebidraget skilles fra egenskapene til modellene og kjøretidene som sammenlignes.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Hva du skal se neste

Hovedspørsmålene er om gevinstene gjentar seg utenfor forfatternes evalueringer, hvor mye beregning og ingeniørarbeid JIT-Agent krever, og om automatisk genererte seler forblir pålitelige og trygge på ukjente oppgaver.

Papiret er et arXiv forhåndstrykk, og kilden gir ingen fagfellevurderingsstatus, uavhengig replikering eller ekstern evaluering. De rapporterte punktforbedringene bør derfor behandles som påstander av forfatterne i stedet for avgjort bevis. Kilden gir heller ikke nok detaljer til å vurdere statistisk signifikans, evalueringsvarians eller hvordan sammenligningen med GPT-5.6 ble kontrollert. Disse grensene gjelder for tolkningen av referanseresultatene og åpner for hvordan de vil se ut under gransking utenfor de rapporterte evalueringene. Bekreftelse vil kreve de manglende formene for gjennomgang og sammenligning identifisert i kilden.

Viktige implementeringsdetaljer forblir ukjent fra kildeteksten. Den oppgir ikke beregningen som kreves for å trene eller kjøre JIT-Agent, tiden som trengs for å generere en sele, størrelsen eller sammensetningen av arkivet som brukes til selvevolusjon, eller om koden og evalueringsmaterialet er offentlig tilgjengelig. Disse faktorene vil avgjøre om metoden er praktisk for mindre forskerteam og produksjonsbrukere. De påvirker også hvordan tilnærmingen bør evalueres sammen med eksisterende seler og agentdriftstider. Uten disse detaljene kan ikke den rapporterte ytelsen i seg selv vise hvilke ressurser eller ingeniørarbeid som kreves for å oppnå den.

Pålitelighet og sikkerhet er også åpne spørsmål. En sele som endrer sin egen planlegging, minne eller verktøy-orkestreringsatferd kan introdusere nye feilmoduser, spesielt på oppgaver som ikke er representert i det tidligere arkivet. Videre arbeid bør teste om genererte seler bevarer begrensninger, viser endringene deres for gjennomgang og forblir robuste når verktøy svikter eller inndata er motstridende. Kilden rapporterer ytelsesresultater, men rapporterer ikke sikkerhetstesting, implementering i den virkelige verden eller kommersiell tilgjengelighet. Disse ubesvarte spørsmålene gjelder både oppførselen til den genererte programvaren og forholdene under hvilke brukere kan stole på den. De er fortsatt en del av gapet mellom de rapporterte evalueringene og bredere bruk.

Relaterte guider og quizer

AI-agenterAI-modeller forklartAI treningPrompt EngineeringTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?