Komawa Labarai
TsaroAI Understanding takaitaccen bayani

Bincike ya gano masu sa ido kan AI na iya rasa kuskuren tunani

Wani rahoto da aka buga ya ba da rahoton cewa ba wa masu sa ido kan AI amintaccen amsa ya inganta ikon su na gano yanke shawara ba daidai ba amma ya rage ikon su na gano kurakuran da ke ɓoye cikin ingantattun mafita.

5 min readRead the primary source
Source-provided image accompanying Study finds answer-aware AI monitors can miss flawed reasoning
Takardun tushe na farkoAn rubuta tushen tushe
Mawallafi
arxiv.org
Tushen hanyar haɗin gwiwa
arxiv.orghttps://arxiv.org/abs/2609.00264
Nau'in tushe
Takardun farko - sanarwar hukuma, takarda, yin rajista, ko shafi na farko da muka karanta kai tsaye.
MaganaFahimtar wannan a cikin daƙiƙa 60

Fara a nan

Mabuɗin sharuddan

Babban Samfurin Harshe (LLM)
Samfurin harshe da aka horar akan babban haɗin gwiwar rubutu don samarwa da tantance rubutu.
Tazarar Amincewa
Ƙididdigar kewayon ƙididdiga wanda wataƙila ya ƙunshi ainihin ƙimar ma'aunin ƙididdiga.
Sarkar-Tunani
Salon tunani inda ƙirar AI ke lalata matsala zuwa matakan tsaka-tsaki.
Gwada kankaAI Ethics Quiz

Me ya faru

Ƙungiya ta kimanta ko samun damar samun amintaccen amsa yana taimakawa tsarin AI don tabbatar da dalilin da wasu samfuran AI suka samar. Ta hanyar amfani da hanyoyin matakai 237 masu lamba 237 zuwa tambayoyin kimiyyar lissafi 79, masu binciken sun gano cewa amsa samun damar inganta ƙaddamar da bincike fiye da bincike mai zaman kansa na hujjar goyan baya.

Preprint, wanda aka ƙaddamar zuwa arXiv a ranar 31 ga Agusta, yayi nazarin tsarin sa ido na tunani, tsarin da tsarin AI ɗaya ke kimanta alamar tunani da wani ya samar. Marubutan sun tattara mafita masu lamba 237 zuwa tambayoyi 79 na Jarrabawar Ƙarshe na Ƙarshe na Bil Adama daga ƙirar iyaka guda uku. Alamomin ba su ƙunshi kurakurai da aka saka ba; masu binciken sun yi wa kansu lakabi ko kowace amsa ta ƙarshe daidai da kuma inda matakin ƙarya na farko ya faru.

Ma'auni na tunani ya haɗa bayanan masana kimiyyar lissafi, muhawarar ƙirar babban harshe mai zaman kanta da hukunci mai rufe fuska. Wannan tsari ya gano alamomi 24 masu mahimmanci: mafita waɗanda amsoshinsu na ƙarshe daidai ne duk da cewa dalilin ya haɗa da kuskure na gaske. Takardar ta bayyana waɗannan kurakurai a matsayin talakawa kuma galibi marasa ɗaukar nauyi maimakon adawa da gangan, wanda ke iyakance yadda za a iya haɗa sakamakon kai tsaye zuwa halaye masu ƙiyayya.

Masu sa ido na AI guda takwas sun kimanta alamun a ƙarƙashin sharuɗɗa uku: tare da amsa da ba a tantance ba, tare da tabbataccen amsa, ko kuma bayan yin alƙawarin makaho kafin su ga amsar. Tare da takaddun shaida, daidaitattun daidaito ya karu daga 0.637 zuwa 0.796, yayin da ainihin kuskuren farko ya karu daga 0.261 zuwa 0.379. Wadancan nasarorin ba su nufin masu sa ido sun zama mafi kyau iri ɗaya a tabbatar da zaman kanta ba.

Bambancin ya fi bayyana a cikin tunawa. Takaddun shaida ya ƙãra rabon alamun amsa ba daidai ba wanda aka nuna a matsayin kuskure daga 0.653 zuwa 0.951, amma an rage tunawa kan mahimman alamun daga 0.521 zuwa 0.438. Bayan alƙawarin makaho, masu sa ido sun nuna sabon alamar da aka ba da alamar kashi 93.8% na alamun amsa ba daidai ba, idan aka kwatanta da kawai 18.0% na mahimman alamun. Mawallafa sun ba da rahoton cewa duk masu saka idanu guda takwas sun nuna irin wannan shugabanci na bambanci, tare da tambaya-bootstrap 95% tazarar amincewa na [+0.256, +0.506].

Bayanan tushe: arxiv.org ↗

Me ya sa yake da mahimmanci

Sakamakon binciken ya ƙalubalanci zato gama gari a cikin sa ido kan sarkar tunani: cewa madaidaiciyar amsa ta ƙarshe shaida ce mai fa'ida cewa tsarin tunani ya yi kyau. Don sa ido kan AI, binciken ya nuna kimantawa na iya wuce gona da iri yayin da aka ba masu sa ido damar dogaro da ingantaccen sakamako.

Ma'anar ta tsakiya ita ce mai saka idanu na AI na iya bincika ko alamar tunani ta yarda da amsa maimakon tantance ko dalilin yana da inganci. Amsar da ba daidai ba ta haifar da rashin daidaituwa a fili wanda damar amsa zai iya fallasa. Amsa daidai, akasin haka, na iya sa alamar da ba ta dace ba ta zama abin dogaro ko da matakin farko na ƙarya ne. Taken takarda ya ɗauki wannan bambance-bambance: amsar ba ita ce hujja ba.

Wannan yana da mahimmanci don ƙimar aminci da aka gina a kusa da abubuwan da aka yarda da su. Idan an bai wa masu saka idanu amintaccen amsar magana, aikin da aka auna su na iya yin nuni da tabbatar da daidaito maimakon bincike mai zaman kansa na tsarin. Marubutan sun bayyana tsarin a matsayin misali mai kyau na satar lada: fitarwa na iya gamsar da mai kimantawa yayin da tsarin da ya samar ya kasance mara kyau. Wannan da'awar ce daga preprint, ba shaida cewa tsarin da aka tura a halin yanzu suna amfani da rarrabuwar hankali a cikin wani wuri mai tasiri ba.

Damuwar da ta dace ba ta iyakance ga ilimin kimiyyar lissafi ko warware matsala na yau da kullun ba. Duk wani tsari na sa ido wanda ke ɗaukar sakamako mai nasara a matsayin shaida na tsari mai aminci zai iya fuskantar makamancin makaho, musamman lokacin da tsaka-tsakin tunani ke da wuya a inganta kai tsaye. Madogararsa ba ta tabbatar da cewa tasirin yana canjawa zuwa wasu yankuna ba, amma yana ba da takamaiman gwajin gwaji don raba tabbacin sakamako daga tabbatarwa.

Ga ƙungiyoyin da ke kimanta tsarin AI, abubuwan da aka gano suna nuni zuwa ga samun damar amsawa a matsayin muhimmin yanayin gwaji. Mai saka idanu wanda ke aiki da kyau lokacin da zai iya kwatanta shi da tabbataccen sakamako na iya kasancewa mai rauni a gano kurakurai a cikin alamun da suka ƙare daidai. Wannan bambance-bambance na iya shafar yadda masu haɓaka ke fassara ma'aunin aminci, zaɓi hanyoyin sa ido da yanke shawarar ƙarin bincike da ake buƙata kafin dogaro da aikin da aka ƙirƙira.

Interactive Mechanism

Ingantacciyar hanyar sadarwa: Yadda A zahiri yake Aiki

Bincika fasahar da ke bayan wannan ci gaban ta hanyar mu'amala.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Duba ra'ayi na hulɗa+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Abin kallo na gaba

Aikin wani shiri ne wanda ya dogara da hanyoyin kimiyyar lissafi daga nau'ikan kan iyaka guda uku, na'urori takwas da kuma alamomi 24 masu mahimmanci inda amsar ta kasance daidai amma dalilin ya ƙunshi kuskure. Ana buƙatar ƙarin gwaji akan batutuwa daban-daban, samfuri, nau'ikan kuskure da saitunan gaba.

Mafi mahimmancin da ba a sani ba shine gaba ɗaya. Nazarin yana amfani da tambayoyin kimiyyar lissafi, mafita daga ƙirar iyaka guda uku da masu saka idanu na LLM guda takwas. Majiyar ba ta faɗi ko an nuna irin wannan tsari a cikin lissafi, ƙididdigewa ba, nazarin shari'a, ayyukan kimiyya ko ayyuka na ainihi na duniya. Hakanan baya tabbatar da yadda aikin ya canza tare da iyalai daban-daban na ƙira, sa ido kan faɗakarwa ko tsarin ganowa.

Hanyoyi 24 masu mahimmanci suna da tasiri ga hujjar takarda, amma su ne ƙananan ƙananan hanyoyin da aka tattara. Madogararsa baya bayar da isasshen bayani don tantance yadda waɗancan burbushin ke wakiltar duk hanyoyin amsa daidai ko yadda sakamakon zai canza tare da mafi girma da samfuri daban-daban. Don haka yakamata masu karatu su ɗauki adadin da aka ruwaito a matsayin shaida daga wannan kimantawa, ba azaman ƙimar duniya don masu sa ido na AI ba.

Masu binciken a sarari sun ce kurakuran da aka yi nazari sun kasance na yau da kullun, galibi ba masu ɗaukar nauyi ba kuma ba masu adawa ba. Wannan yana buɗewa ko ƙoƙarin ɓoye kuskure da gangan zai sa saka idanu akan amsa ko žasa tasiri. Majiyar kuma ba ta bayar da rahoton sakamakon turawa, kwatancen mutum-mutumi ko sakamako a cikin tsarin aiki ba.

Ya kamata aikin gaba ya gwada yanayin sa ido wanda mai kimantawa bai sami amintacciyar amsa ba, dole ne ya aikata kafin ya ga sakamako, ko yayi amfani da bincike mai zaman kansa na da'awar tsaka-tsaki. Hakanan ya kamata a bincika ko masu sa ido za su iya dogaro da gaske bambance madaidaicin ƙarshe da aka cimma ta hanyar ingantaccen dalili daga wanda aka kai ta hanya mara kyau. Har sai an amsa waɗannan tambayoyin, babban maki akan saka idanu na amsawa bai kamata a karanta shi azaman hujja cewa tsarin tunanin tsarin AI yana da kyau ba.

Jagorori masu alaƙa & tambayoyin tambayoyi

Ɗa'a ta AIAI Model ya bayyanaWakilan AIGwada abin da kuka sani - gwada gwajin AI kyautaNemo kalmar AI a cikin ƙamus ɗin muBi tsarin tsarin AI
An sami wannan yana da amfani?