应用指南

人工智能在古代语言破译中的应用

人工智能通过发现符号中的统计模式、恢复丢失的字符并提出翻译建议,帮助学者阅读丢失的文字和损坏的文本。

阅读时间:2分钟最后更新

概述

It turns decipherment from decades of manual guesswork into a faster, data-driven collaboration.

深入探讨

破译一种古老的语言意味着弄清楚它的符号如何映射到声音和含义,通常几乎没有幸存的文本,也没有双语密钥。机器学习可以通过多种方式提供帮助。神经网络可以对重复的符号进行聚类,以识别可能的单词、后缀和语法。当文本损坏或磨损时,在语料库上训练的序列模型可以预测最可能丢失的字符,就像手机自动完成单词一样。 DeepMind 的伊萨卡模型经过数万个希腊铭文的训练,可以恢复损坏的文本,估计铭文的书写地点和时间,并为历史学家提供排名建议以进行评估。其他项目已使用统计对齐将未知文字(例如 Linear B 和 Ugaritic)链接到已知的相关语言并加速翻译。

技术洞察

模型将脚本视为标记序列,并学习哪些符号跟随其他符号的概率。为了恢复,变压器或循环网络在完整的段落上进行训练,然后要求填充掩盖的间隙,输出带有置信度分数的排名候选字符。跨语言对齐的工作原理是将未知语言的符号模式映射到假设的亲戚的已知结构上,并对映射产生真实单词的程度进行评分。

战略影响

构建选择

应用级设计决定了人工智能是否能改善实际结果。

团队与工作流程

良好的工作流程集成可以创造用户值得信赖的生产力收益。

风险与安全

范围明确的用例可以减少变更疲劳和实施风险。

人工智能在古代语言破译中的未来

剩下的最难的目标是语料库很小且没有已知亲缘关系的未破译文字,例如印度河流域文字和线性 A,其中数据稀缺限制了统计数据可以证明的内容。未来的系统将把语言模型与图像分析结合起来,直接从照片中读取被侵蚀的石板和印章。研究人员强调,人工智能仍将是一个强大的助手,而不是替代品,从而产生了人类金石学家必须根据历史和背景进行检验的假设。

现实世界的实施

DeepMind 的伊萨卡模型可以恢复受损的古希腊铭文中缺失的单词,并估计它们的日期和起源地,一起使用时可以提高历史学家的准确性。

机器学习已应用于 Linear B 和相关的 Linear A,以根据已知的迈锡尼希腊语测试语音和词汇映射。

统计破译方法已被用来翻译乌加里特语,自动将其与其近亲希伯来语对齐。

研究人员使用人工智能来重建和阅读碎片化的楔形文字板,预测阿卡德语和苏美尔文本中损坏的符号。

风险与防护栏

将损坏的流程自动化可能会加剧现有问题。

团队可能会过度自动化并消除所需的人工判断。

如果不持续评估输出,质量可能会出现偏差。

实施路线图

1

绘制当前工作流程并确定摩擦最大的步骤。

2

在完全自动化之前定义人工检查点。

3

对用户进行提示、升级路径和质量标准方面的培训。

4

跟踪任务级结果以确认持续价值。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI in Ancient Language Decipherment quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

人工智能手语翻译

常见问题

What is AI in Ancient Language Decipherment?

人工智能通过发现符号中的统计模式、恢复丢失的字符并提出翻译建议,帮助学者阅读丢失的文字和损坏的文本。它将数十年的手动猜测的破译转变为更快的数据驱动的协作。

DeepMind 的伊萨卡模型对古希腊铭文有何作用?

伊萨卡接受了数以万计的希腊铭文的训练,以修复受损的段落并预测它们的书写时间和地点,从而为历史学家提供帮助。

当古代文本破损或磨损时,序列模型有何帮助?

该模型在完整文本上进行训练,通过预测可能的字符(类似于自动完成)来填补掩盖的空白,并提供排名的候选者。

为什么像 Linear A 和印度河流域文字这样的文字对于人工智能来说如此难以破译?

统计方法需要数据,最好是已知的亲属;微小的语料库和孤立的文字留下的信号太少,无法确认破译。

什么是破译上下文中的跨语言对齐?

通过将未知语言映射到假设的亲属上,并对是否出现真实单词进行评分,研究人员可以测试关系,就像乌加里特语和希伯来语所做的那样。

这些模型通常如何在内部表示脚本?

脚本被视为文本序列;该模型了解哪些符号倾向于遵循哪些符号,从而实现恢复和模式发现。