AI trong giải mã ngôn ngữ cổ
AI giúp các học giả đọc các chữ viết bị mất và văn bản bị hỏng bằng cách phát hiện các mẫu thống kê trong các ký hiệu, khôi phục các ký tự bị thiếu và đề xuất bản dịch.
Tổng quan
It turns decipherment from decades of manual guesswork into a faster, data-driven collaboration.
Lặn sâu
Giải mã một ngôn ngữ cổ có nghĩa là tìm ra cách các ký hiệu của nó ánh xạ tới âm thanh và ý nghĩa, thường có rất ít văn bản còn tồn tại và không có khóa song ngữ. Học máy hỗ trợ theo nhiều cách. Mạng lưới thần kinh có thể phân cụm các ký hiệu lặp đi lặp lại để xác định các từ, hậu tố và ngữ pháp có thể xảy ra. Khi một văn bản bị hỏng hoặc bị mòn, các mô hình trình tự được huấn luyện trên kho văn bản có thể dự đoán các ký tự bị thiếu có khả năng xảy ra nhất, giống như điện thoại tự động hoàn thành các từ. Mô hình Ithaca của DeepMind, được đào tạo trên hàng chục nghìn chữ khắc bằng tiếng Hy Lạp, khôi phục văn bản bị hỏng, ước tính vị trí và thời điểm một chữ khắc được viết, đồng thời đưa ra các đề xuất được xếp hạng cho các nhà sử học để đánh giá. Các dự án khác đã sử dụng căn chỉnh thống kê để liên kết các tập lệnh chưa biết, chẳng hạn như Linear B và Ugaritic, với các ngôn ngữ liên quan đã biết và đẩy nhanh quá trình dịch thuật.
Hiểu biết kỹ thuật
Các mô hình xử lý các tập lệnh dưới dạng chuỗi mã thông báo và tìm hiểu xác suất của ký hiệu nào theo sau ký hiệu khác. Để khôi phục, mạng máy biến áp hoặc mạng tái phát được huấn luyện trên các đoạn còn nguyên vẹn, sau đó được yêu cầu lấp đầy các khoảng trống bị che, xuất ra các ký tự ứng cử viên được xếp hạng với điểm tin cậy. Căn chỉnh liên ngôn ngữ hoạt động bằng cách ánh xạ các mẫu ký hiệu của ngôn ngữ chưa biết lên cấu trúc đã biết của họ hàng giả định, cho điểm mức độ ánh xạ tạo ra các từ thực.
Tác động chiến lược
Xây dựng lựa chọn
Thiết kế cấp ứng dụng xác định liệu AI có cải thiện kết quả thực tế hay không.
Nhóm và quy trình làm việc
Tích hợp quy trình làm việc tốt sẽ giúp tăng năng suất mà người dùng có thể tin tưởng.
Rủi ro và an toàn
Các trường hợp sử dụng có phạm vi phù hợp giúp giảm bớt sự mệt mỏi khi thay đổi và rủi ro triển khai.
Tương lai của AI trong việc giải mã ngôn ngữ cổ đại
Các mục tiêu khó khăn nhất còn lại là các tập lệnh chưa được giải mã với kho dữ liệu nhỏ và không có họ hàng nào được biết đến, chẳng hạn như tập lệnh Indus Valley và Linear A, nơi sự khan hiếm dữ liệu hạn chế những gì số liệu thống kê có thể chứng minh. Các hệ thống trong tương lai sẽ kết hợp các mô hình ngôn ngữ với phân tích hình ảnh để đọc các tấm bảng và con dấu bị xói mòn trực tiếp từ các bức ảnh. Các nhà nghiên cứu nhấn mạnh rằng AI sẽ vẫn là một trợ lý đắc lực chứ không phải là sự thay thế, tạo ra các giả thuyết mà các nhà viết văn con người phải kiểm tra dựa trên lịch sử và bối cảnh.
Triển khai trong thế giới thực
Mô hình Ithaca của DeepMind khôi phục các từ còn thiếu trong các dòng chữ Hy Lạp cổ bị hư hỏng và ước tính ngày và nơi xuất xứ của chúng, nâng cao độ chính xác của các nhà sử học khi sử dụng cùng nhau.
Học máy đã được áp dụng cho Tuyến tính B và Tuyến tính A có liên quan để kiểm tra ánh xạ ngữ âm và từ vựng đối với tiếng Hy Lạp Mycenaean đã biết.
Các phương pháp giải mã thống kê đã được sử dụng để dịch tiếng Ugaritic bằng cách tự động căn chỉnh nó với họ hàng gần của nó là tiếng Do Thái.
Các nhà nghiên cứu sử dụng AI để tái tạo và đọc các bảng chữ hình nêm rời rạc, dự đoán các dấu hiệu bị hỏng trong văn bản tiếng Akkad và tiếng Sumer.
Rủi ro & lan can
Tự động hóa một quy trình bị hỏng có thể khuếch đại các vấn đề hiện có.
Các nhóm có thể tự động hóa quá mức và loại bỏ sự phán xét cần thiết của con người.
Chất lượng có thể thay đổi nếu kết quả đầu ra không được đánh giá liên tục.
Lộ trình thực hiện
Lập sơ đồ quy trình làm việc hiện tại và xác định bước có mức độ ma sát cao nhất.
Xác định các điểm kiểm tra của con người trước khi tự động hóa hoàn toàn.
Đào tạo người dùng về lời nhắc, đường dẫn leo thang và tiêu chuẩn chất lượng.
Theo dõi kết quả ở cấp độ nhiệm vụ để xác nhận giá trị bền vững.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI in Ancient Language Decipherment quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
AI trong dịch thuật ngôn ngữ ký hiệu
Câu hỏi thường gặp
What is AI in Ancient Language Decipherment?
AI giúp các học giả đọc các chữ viết bị mất và văn bản bị hỏng bằng cách phát hiện các mẫu thống kê trong các ký hiệu, khôi phục các ký tự bị thiếu và đề xuất bản dịch. Nó biến việc giải mã từ hàng thập kỷ phỏng đoán thủ công thành một sự cộng tác dựa trên dữ liệu nhanh hơn.
Mô hình Ithaca của DeepMind làm gì đối với các dòng chữ Hy Lạp cổ đại?
Ithaca đã được đào tạo về hàng chục nghìn chữ khắc Hy Lạp để khôi phục những đoạn văn bị hư hỏng và dự đoán thời gian và địa điểm chúng được viết ra, hỗ trợ các nhà sử học.
Các mô hình trình tự giúp ích như thế nào khi một văn bản cổ bị hỏng hoặc bị mòn?
Được đào tạo trên văn bản nguyên vẹn, mô hình sẽ lấp đầy những khoảng trống bị che giấu bằng cách dự đoán các ký tự có khả năng xảy ra, tương tự như tính năng tự động hoàn thành và đưa ra các ứng cử viên được xếp hạng.
Tại sao các tập lệnh như Linear A và Indus Valley lại khó giải mã đến vậy đối với AI?
Các phương pháp thống kê cần dữ liệu và lý tưởng nhất là một người họ hàng đã biết; tập lệnh nhỏ và tập lệnh biệt lập để lại quá ít tín hiệu để xác nhận việc giải mã.
Căn chỉnh đa ngôn ngữ trong bối cảnh giải mã là gì?
Bằng cách ánh xạ ngôn ngữ chưa biết vào một họ hàng được giả định và cho điểm xem các từ thực có xuất hiện hay không, các nhà nghiên cứu có thể kiểm tra các mối quan hệ, như đã làm với tiếng Ugaritic và tiếng Do Thái.
Các mô hình này thường thể hiện một tập lệnh nội bộ như thế nào?
Các tập lệnh được xử lý giống như các chuỗi văn bản; mô hình tìm hiểu những biểu tượng nào có xu hướng tuân theo biểu tượng nào, cho phép khôi phục và khám phá mẫu.