Nini kilitokea
HackerNoon inaripoti kwamba mhandisi wa programu Prajwal S. Venkateshmurthy aliunda TeXFix-Bench, alama ya kupima ikiwa mifumo ya AI inarekebisha hati za LaTeX, Typst na Markdown zilizovunjika bila kubadilisha maana yake. Ripoti inasema mafanikio ya kukusanya pekee yalizalisha viwango vya kupotosha.
HackerNoon inaripoti kwamba Venkateshmurthy aliunda TeXFix-Bench baada ya kuhitimisha kuwa "tengeneza mkusanyiko huu" ni kipimo kisichotosheleza cha ukarabati wa hati. Alama huuliza miundo kurudisha faili kamili ya chanzo iliyosahihishwa, bila kubainisha hitilafu au kutoa zana, na kisha kutathmini matokeo ndani ya nchi. Lengo lililoripotiwa ni kutofautisha hati ambayo huunda tu kutoka kwa ile inayohifadhi yaliyomo kwenye hati asili.
Kulingana na HackerNoon, alama hiyo ina kazi 10,437 za kurekebisha zinazodhibitiwa kote LaTeX, Typst na Markdown. Majukumu yalitolewa kutoka kwa mfumo wa ushuru kulingana na hitilafu 168 zilizothibitishwa za ajali za LaTeX zilizokusanywa kutoka TeX Stack Exchange, ahadi za GitHub na uhifadhi wa hati za kifurushi. Ripoti hiyo inasema maktaba inayotokana na mabadiliko ya DocMut ina waendeshaji 48 wanaofahamu sintaksia katika miundo yote mitatu na hutumia mbegu za kubainisha, milango ya injini na ukaguzi wa utofautishaji.
HackerNoon inaripoti kuwa ulinganisho wa kimsingi ulitumia miundo saba kwenye matrix ya matukio 6,613 iliyosawazishwa, na kuzalisha majaribio ya msingi 46,291. Ikiwa ni pamoja na majaribio ya ziada yaliyorekodiwa, kifurushi cha utafiti kilikuwa na maombi 48,651. Tathmini ilihesabu majibu matupu, matokeo yaliyopunguzwa, muda wa kuisha, hitilafu za usafiri na viwango vya viwango kama mapungufu. Matokeo yalikaguliwa tena ndani ya nchi kwa kutumia Tectonic 0.17.0 ya LaTeX, Typst 0.15.1 na Pandoc 3.10.1 ya Markdown, na maandishi ya PDF yaliyotolewa yaliyotumika kwa urejeshaji wa bao.
Ripoti inasema modeli iliyo na kiwango cha juu zaidi cha ujumuishaji cha masharti, Qwen3.7-Max kwa 94.4%, ilikuwa na kiwango cha mwisho hadi mwisho cha 56.7% kwa sababu ilirejesha jibu linaloweza kutumika tu 60.1% ya wakati huo. Grok-4.3 iliripotiwa kukusanya 84.2% ya majaribio yote, wakati GLM-5.2 ilikusanya 64.9% mwisho hadi mwisho licha ya kiwango cha masharti cha 93.8%. HackerNoon pia inaripoti kuwa 13.6% hadi 18.5% ya utayarishaji wa utayarishaji ilibadilisha hati hiyo, na kwamba Qwen3.7-Max ilikuwa na alama ya juu zaidi ya urejeshaji iliyoripotiwa huku Llama-4 Maverick ilikuwa na rekodi dhaifu zaidi ya urejeshaji.
Maelezo ya chanzo: hackernoon.com ↗
Kwa nini ni muhimu
Kigezo kinashughulikia hali ya kutofaulu kwa vitendo katika uandishi wa AI na zana za usimbaji: hati inaweza kukusanywa kwa mafanikio baada ya kuandika upya kwa ukali ambayo huondoa au kubadilisha maudhui kimyakimya. Mbinu yake inaweza kusaidia timu za bidhaa kutathmini mifumo ya urekebishaji hati kwa kutumia uaminifu na uhifadhi unaoonekana na mtumiaji, badala ya alama moja ya tiki ya kijani.
Utaftaji mkuu wa HackerNoon ni kwamba mkusanyiko na ukarabati wa uaminifu ni kazi tofauti. Mfumo unaweza kurudisha hati ndogo ambayo hukusanywa kila wakati unapotupa karatasi ya mtumiaji, au unaweza kuandika upya dibaji, mtindo wa biblia, jedwali au aya kwa njia ambazo si dhahiri kutoka kwa PDF inayotokana. Ripoti hiyo inasema 3.7% ya watahiniwa waliokubaliwa walikuwa wamebadilishwa kabisa, ikimaanisha kuwa mfumo ulisuluhisha mfano huo kwa kutengua kosa lililodungwa badala ya kuonyesha urekebishaji wa jumla zaidi.
Matokeo ni muhimu kwa zana za uandishi za AI kwa sababu watumiaji hupata uzoefu wa kutowasilisha kama kutofaulu. HackerNoon inaripoti kuenea kwa pointi 27.5 kati ya viwango bora na mbaya zaidi vya mkusanyo wa mwisho hadi mwisho na inabisha kuwa tofauti kubwa ilitokana na kuegemea badala ya uwezo wa kielelezo. Tofauti hiyo ni muhimu kiutendaji: kuboresha upatikanaji wa watoa huduma, vikomo vya kukamilisha na uelekezaji kunaweza kusaidia watumiaji zaidi ya kubadilisha muundo wa msingi, huku usahihi wa mkusanyiko pekee unaweza kuficha hitilafu hizo za huduma.
Ripoti hiyo pia inapendekeza kwamba umbizo la hati na aina ya makosa huathiri sana utendakazi. HackerNoon inasema mafanikio ya mkusanyo wa mwisho hadi mwisho yalikuwa takriban 74.2% kwa LaTeX, 60.3% kwa Typst na 90.2% kwa Markdown. Matatizo yanayohusiana na kimuundo na utegemezi, ikiwa ni pamoja na matone ya kuagiza ya Typst, mahitaji ya kutoroka kwa ganda la LaTeX na hesabu ambayo haijafungwa, imeripotiwa kuwa ngumu zaidi kuliko chapa za amri za ndani. Matokeo haya yanaweza kusaidia wasanidi kubuni uchunguzi lengwa na kukagua mtiririko wa kazi.
HackerNoon inaripoti kuwa hitilafu za syntetisk zilizozingatia kanuni za kodi zilikuwa ngumu kwa asilimia 5.6 hadi 9.2 kuliko mabadiliko yanayotegemea muundo katika familia tatu za miundo. Katika utafiti wa kifani tofauti, muundo thabiti zaidi unaopatikana uliripotiwa kukarabati 67.0% ya ajali 88 halisi za binadamu zinazoweza kutathminiwa, ikilinganishwa na 81.3% kwenye seti ngumu ya sintetiki na 90.5% kwenye mabadiliko yanayotegemea muundo. Makala yanawasilisha hili kama ushahidi kwamba majaribio ya sintetiki ya msingi yanaweza kuwa ya kweli zaidi kuliko uhariri wa dharula, si kama makadirio ya idadi ya watu ya utendaji wa ulimwengu halisi.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Ripoti hiyo inasema kazi ya siku zijazo itajaribu urekebishaji katika injini nyingi za TeX, kuongeza miundo na uchunguzi wa hali ya juu, na kuunda wimbo wa makosa ya ulimwengu halisi ulio na leseni, unaoweza kuzalishwa tena. Matokeo ya yanabaki kuwa yale yaliyoripotiwa na mwandishi wa HackerNoon na hayakuthibitishwa kivyake hapa.
Ufuatiliaji muhimu zaidi ni kama viwango vilivyoripotiwa vitadumu katika majaribio mapana zaidi. HackerNoon inasema kazi ya sasa haianzilishi nafasi ya kielelezo cha wote kwa LaTeX yote, na ukaguzi wake wa kuona ni mdogo kwa sababu urejeshaji ulipimwa kupitia maandishi yaliyotolewa badala ya usawa kamili wa mwonekano au mpangilio. Kwa hivyo urekebishaji unaweza kuhifadhi maandishi wakati bado unabadilisha muundo wa ukurasa, umbizo au uwasilishaji kwa njia zinazofaa.
Ripoti hiyo inasema upimaji wa siku zijazo utachunguza ikiwa marekebisho yanayofanya kazi chini ya Tectonic pia yanafanya kazi chini ya pdfLaTeX, XeLaTeX na LuaLaTeX. Hiyo ni muhimu kwa sababu tofauti za injini zinaweza kuathiri kubebeka. HackerNoon pia hutambua miundo iliyofungwa mipaka na hali ya uchunguzi wa haraka kama haipo kwenye kidirisha cha sasa, kwa hivyo matokeo yaliyoripotiwa ya picha sifuri haipaswi kuchukuliwa kama kipimo kamili cha kile zana za kibiashara zinazosaidiwa zinaweza kufanya.
Swali lililo wazi zaidi ni ikiwa kigezo kinaweza kutengeneza wimbo wa ulimwengu halisi unaoweza kuzalishwa tena. HackerNoon inasema wimbo wake wa ulimwengu halisi uliosimamishwa kwa sasa hauna matukio sufuri yanayokubalika kwa sababu mwandishi alihitaji leseni iliyothibitishwa, asili na kunakili. Kizuizi hicho kina maana: seti ya syntetisk ina oracle wazi, lakini bado haionyeshi ni mara ngapi makosa ya uandishi yanayotokea kiasili yanaonekana au jinsi hati za watumiaji zinavyofanya kazi katika mtiririko wa moja kwa moja wa kazi.
Kiwango cha kiutendaji kilichopendekezwa na ripoti ni kuchapisha uwasilishaji, mkusanyo, urejeshaji, kuhariri uchache na uzalishaji tena kando, na madhehebu yamebainishwa. Hatua hizo zinaweza kuwa za kuelimisha zaidi kuliko kiwango kimoja cha kufaulu, lakini HackerNoon haiainishi kwa kujitegemea ni viwango vipi vinapaswa kudhibiti utumaji. Kifungu kinasema haswa hakuna kizingiti kimoja cha kufanana kwa maandishi kinaweza kuthibitisha urekebishaji sahihi, kwa hivyo ukaguzi wa kibinadamu na ukaguzi mpana wa kisemantiki haujatatuliwa.