Co się stało
Badacze wprowadzili AI Historian, system agentów AI zaprojektowany, aby pomóc historykom organizować dowody dotyczące ludzi, działań, relacji i czasu w ramach fragmentarycznych narracji historycznych. System traktuje zdania źródłowe jako jednostki dowodowe, identyfikuje osoby i wskazówki czasowe, sprawdza możliwe powiązania międzytekstowe i wnioskuje o porównywalnych zakresach czasowych, zachowując jednocześnie powiązania z tekstem źródłowym.
W artykule przedstawiono AI Historyn, czyli AIH, jako system agenta AI służący do organizowania dowodów osobistych w badaniach historycznych. Jego wyznaczonym zadaniem jest zajęcie się problemem strukturalnym w źródłach historycznych: opisy działań danej osoby, relacji i otaczającego kontekstu mogą być rozproszone w tekstach, rozdziałach i perspektywach narracyjnych, a nie zachowywane jako jedna ciągła relacja. AIH wykorzystuje zdania źródłowe jako jednostki dowodowe, identyfikuje ludzi i wskazówki czasowe, weryfikuje potencjalne skojarzenia w tekstach i wnioskuje porównywalne zakresy czasowe. Źródło twierdzi, że przechowuje możliwe do prześledzenia dowody w postaci tekstu źródłowego, umożliwiając sprawdzenie i korektę powstałych powiązań.
Naukowcy ocenili AIH w sześciu przypadkach z Shiji, w których uczestniczyli Liu Bang, Xiang Yu i Xiao He. Zgodnie ze streszczeniem artykułu, AIH Agent osiągnął wynik MicroIoU lokalizacji czasowej na poziomie 86,2%. Streszczenie podaje 81,3% w przypadku adnotacji wykonywanych wyłącznie przez człowieka i 17,1% w przypadku bezpośredniego podpowiedzi w modelu wielkojęzykowym. MicroIoU to miara podana przez źródło w celu porównania przewidywanych i referencyjnych zakresów czasowych; źródło nie podaje podstawowych adnotacji, punktacji dla poszczególnych przypadków ani szczegółów analizy statystycznej w dostarczonym materiale.
W artykule przedstawiono również porównanie czasu oceny: AIH wymagało około 14 minut, podczas gdy adnotacja wykonywana wyłącznie przez człowieka wymagała 1 godziny i 32 minut. Liczby te opisują raportowaną konfigurację ewaluacji, a nie ogólną gwarancję produktywności dla historyków. Źródło nie podaje, ilu badaczy wzięło udział w porównaniu z udziałem ludzi, ile przeszli szkolenia, jaki sprzęt lub modele językowe zasilały AIH ani czy harmonogram obejmował przygotowanie, przegląd i korektę. Szczegóły te mają znaczenie przy interpretacji deklarowanej wydajności.
Poza sześcioma przypadkami Shiji badacze twierdzą, że zastosowali AIH do Dwudziestu Czterech Historii i innych starożytnych historii Chin, starożytnych historii Japonii i Korei, a także współczesnych i współczesnych materiałów historycznych. Wyniki opublikowano za pośrednictwem Westlake Historian. Źródło opisuje te wyniki jako sposób na przekształcenie powiązań zasłoniętych narracją opartą na rozdziałach w możliwe do prześledzenia i sprawdzenia pytania badawcze do wspólnego testowania. Nie ustala, czy każde zgłoszone powiązanie jest historycznie poprawne, czy szersze materiały zostały niezależnie sprawdzone lub czy system jest dostępny w dojrzałej formie produkcyjnej.
Dlaczego to ma znaczenie
Zgłoszone wyniki sugerują, że system sztucznej inteligencji mógłby ograniczyć pracę związaną z gromadzeniem dowodów historycznych bez usuwania podstawowych źródeł z procesu badawczego. Podejście to jest potencjalnie przydatne w przypadku dużych zbiorów, w których istotne informacje są rozmieszczone w rozdziałach, perspektywach lub oddzielnych pracach, chociaż źródło opisuje ograniczoną ocenę i nie stwierdza, że system może niezależnie weryfikować prawdę historyczną.
Badania historyczne często polegają na znajdowaniu powiązań między fragmentami, które zostały napisane osobno lub zorganizowane wokół różnych narracji. System, który może gromadzić wskazówki czasowe skupione na osobie, mógłby pomóc badaczom w stworzeniu wstępnej mapy miejsc, w których pojawia się dana osoba, jakie wskazówki czasowe otaczają te odniesienia i które fragmenty mogą opisywać powiązane wydarzenia. Praktyczna wartość, o której twierdzi artykuł, polega na obniżeniu kosztów porządkowania dowodów przy jednoczesnym zachowaniu linków do zdań źródłowych, co daje badaczom coś, co mogą sprawdzić, a nie nieuzasadnione streszczenie.
Przedstawione porównanie jest godne uwagi, ponieważ umieszcza bezpośrednie podpowiedzi w modelu wielkojęzykowym znacznie poniżej zarówno AIH, jak i adnotacji przeznaczonych wyłącznie dla ludzi na podstawie miary lokalizacji czasowej zawartej w artykule. Wynik ten, jeśli zostanie odtworzony, potwierdzi argument autorów, że przepływ pracy ustrukturyzowanego agenta może mieć większe znaczenie niż proszenie modelu językowego o nieustrukturyzowaną odpowiedź. Źródło nie podaje jednak modelu bazowego, procedury podpowiedzi, liczby prób ani kontroli ewaluacyjnych, dlatego wynik należy traktować jako twierdzenie z tego wydruku wstępnego, a nie niezależnie ustalony benchmark wydajności.
Zgłoszona różnica czasu może mieć wartość publiczną dla archiwów, bibliotek i grup badawczych, które nie mogą ręcznie szczegółowo przetwarzać dużych zbiorów historycznych. Szybsza organizacja może pomóc naukowcom w identyfikowaniu fragmentów do dokładniejszej lektury, porównywaniu tradycji między regionami i formułowaniu pytań dotyczących chronologii lub powiązań. Wymóg systemu dotyczący identyfikowalności źródła jest w tym przypadku szczególnie ważny: wnioski historyczne muszą pozostać powiązane z materiałami, z których zostały wyprowadzone, a narzędzie udostępniające dowody może ułatwić przeglądanie i poprawianie.
Jednocześnie uporządkowanie materiału dowodowego nie jest równoznaczne z ustaleniem, co się wydarzyło. Język temporalny może być niejednoznaczny, źródła mogą być sprzeczne, a imię i nazwisko lub rola osoby mogą być różnie interpretowane w różnych okresach i językach. AIH może pomóc w wykryciu potencjalnych powiązań, ale dostarczone źródło nie wskazuje, że rozwiązuje sprzeczne relacje, rozpoznaje wszystkie istotne niuanse historyczne lub odróżnia wiarygodne dowody od późniejszej interpretacji. Sam artykuł przedstawia wyniki jako pytania badawcze do wspólnych testów, co ogranicza siłę ich prezentacji.
Źródło pozostawia kilka znaczących niewiadomych. Nie określa architektury modelu systemu, danych szkoleniowych, poziomu błędów w poszczególnych przypadkach, wydajności na niewidzianym materiale, sposobu postępowania z błędami OCR lub tłumaczeń ani stopnia weryfikacji przez człowieka opublikowanych wyników. Nie dostarcza również dowodów na przyjęcie przez historyków, niezależnej replikacji ani porównania z uznanymi narzędziami historii cyfrowej. Luki te mają kluczowe znaczenie dla oceny, czy system jest użytecznym asystentem badawczym na dużą skalę, czy też głównie obiecującą demonstracją.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Co obejrzeć dalej
Główne pytania dotyczą tego, czy AI Historian działa niezawodnie poza sześcioma przypadkami Shiji, jak często jego powiązania i wywnioskowane zakresy czasowe wymagają korekty oraz jak historycy wykorzystują opublikowane wyniki w praktyce. Dalsza analiza powinna również zbadać działanie systemu w różnych językach, okresach i typach materiałów historycznych, a także kompletność i dostępność jego kodów i śladów dowodowych.
Pierwszym testem jest replikacja poza sześcioma przypadkami Shiji. Przedstawiona ocena dotyczy sześciu przypadków, w których biorą udział trzy wymienione postacie historyczne, natomiast szersze zastosowanie obejmuje kilka tradycji historycznych i materiały współczesne. W przyszłych pracach należy raportować wyniki oddzielnie według okresu, języka, rodzaju źródła i struktury narracji, zamiast przedstawiać większy zbiór wyników jako dowód, że wszędzie obowiązuje ta sama dokładność.
Badacze i historycy powinni zbadać fałszywe powiązania systemu i nieprawidłowe zakresy czasowe, a nie tylko jego łączny wynik MicroIoU. Przydatne raporty obejmują przykłady, w których AIH połączył fragmenty odnoszące się do różnych osób lub wydarzeń, pominął istotne dowody, błędnie zrozumiał wskazówki czasowe lub stworzył zakres, który wyglądał precyzyjnie pomimo niepewności. Źródło twierdzi, że dowody można prześledzić i poddać przeglądowi, zatem jakość procesu przeglądu będzie ważnym miernikiem praktycznej wartości systemu.
Na uwagę zasługuje także rola nadzoru ludzkiego. Opisuje się, że AIH pomaga historykom organizować i weryfikować stowarzyszenia kandydatów, ale dostarczone streszczenie nie określa, które decyzje pozostają w gestii ludzi ani w jaki sposób rozwiązywane są nieporozumienia. Użytkownicy będą musieli wiedzieć, czy system przedstawia wiele interpretacji, wykazuje niepewność, zachowuje oryginalne sformułowania i rejestruje poprawki. Zabezpieczenia te mogą określić, czy narzędzie wspiera naukę, czy tworzy nową warstwę niezbadanej interpretacji generowanej maszynowo.
Publikacja za pośrednictwem Westlake Historian daje możliwość oceny, czy wyniki są dostępne i przydatne dla badaczy nie tylko samych autorów. Do ważnych szczegółów uzupełniających należy informacja, czy kod jest dostępny zgodnie z informacją na stronie arXiv, jakie dane i modele są wymagane, w jaki sposób system obsługuje materiały chronione prawem autorskim lub zastrzeżone oraz czy inni badacze mogą odtworzyć zgłoszony czas i dokładność. Żaden z tych szczegółów dotyczących wdrażania i zarządzania nie jest ustalony w tekście źródłowym podanym tutaj.
Wreszcie pole powinno odróżniać odkrywanie od weryfikacji. AIH może pomóc historykom zlokalizować fragmenty i zaproponować powiązania zasługujące na zbadanie, ale źródło nie wskazuje, że może zastąpić krytykę źródła, czytanie kontekstowe lub ocenę naukową. Najbardziej konsekwentnym osiągnięciem byłoby udowodnienie, że system konsekwentnie usprawnia pracę badaczy nad nieznanymi zbiorami, jednocześnie wyjaśniając niepewność i dowody potwierdzające. Do tego czasu raportowane wyniki potwierdzają raczej ostrożne zainteresowanie niż twierdzenia o zautomatyzowanym zrozumieniu historii.