Que s'est-il passé
BBC Future rapporte que les chercheurs utilisent l'apprentissage automatique pour accélérer la transcription et le décodage des chiffres historiques manuscrits. Une équipe associée à l'Université de Stockholm a aidé à décoder le chiffre Borg de 408 pages, tandis que les chercheurs du projet Descrypt développent des systèmes capables de traiter des symboles inhabituels, une écriture manuscrite historique et des scripts inconnus.
BBC Future rapporte que le chiffre Borg, un manuscrit de 408 pages détenu par la Bibliothèque du Vatican, était composé de 34 symboles inhabituels, de quelques lettres romaines et d'une page de titre en arabe. Selon le rapport, les chercheurs ont utilisé l'apprentissage automatique pour aider à identifier le chiffre de substitution sous-jacent et ont découvert des milliers de prétendus traitements, notamment des remèdes à base de vin rouge et de muscade fermentée.
Le manuscrit est disponible en ligne via la Bibliothèque du Vatican sous la référence Borg.lat.898, selon la BBC. Le rapport n’établit pas de manière indépendante l’exactitude historique ou la valeur médicale de ces traitements. La BBC décrit le travail comme une combinaison de plusieurs tâches qui nécessitent traditionnellement un effort humain important.
Les chercheurs transcrivent d’abord les symboles manuscrits sous une forme lisible par machine, puis utilisent la cryptanalyse pour déduire comment les symboles correspondent aux lettres ou aux mots. Les systèmes d'écriture manuscrite existants peuvent gérer certaines langues et styles d'écriture historiques, mais le rapport indique qu'ils ont souvent des difficultés avec les symboles inventés, les signes astrologiques, les nombres inhabituels, l'encre fanée et une mauvaise écriture. Une lettre envoyée en 1637 par Sigismund Heusner von Wandersleben a été transcrite avec l'aide de la plateforme d'IA Transkribus, même si les chercheurs ont encore dû apporter des corrections manuelles.
Les chercheurs impliqués dans le projet Descrypt développent un système destiné à combiner transcription et déchiffrement en un seul processus. BBC Future rapporte avoir testé une approche sur le chiffre Copiale de 105 pages, un manuscrit allemand décodé décrivant les rituels et les règles d'une société secrète du XVIIIe siècle. Le système a été formé à l’aide d’une écriture manuscrite générique, d’images de lignes chiffrées et du texte allemand décodé correspondant, puis a décodé avec précision des parties qu’il n’avait pas vues auparavant, selon le rapport. L’équipe a également construit un outil de type chatbot combinant des algorithmes de chiffrement, des modèles de langage historiques et des systèmes de reconnaissance d’images. Dans un test rapporté sur un extrait de 500 symboles du chiffre Borg, l’outil a traduit et décodé le passage en un peu plus de 29 minutes et a documenté pourquoi la solution proposée semblait plausible.
Détails de la source: bbc.com ↗
Pourquoi c'est important
Ce travail pourrait rendre plus facile l’étude de documents d’archives auparavant inaccessibles pour les historiens et le public. La BBC affirme que ces systèmes pourraient aider à enquêter sur les messages diplomatiques, les connaissances médicales, les pratiques religieuses et la correspondance personnelle qui n'ont pas été lus en raison d'une écriture manuscrite difficile, de pages endommagées ou d'un cryptage inconnu.
La signification pratique est que les archives contiennent de grandes quantités de documents que les historiens ne peuvent pas facilement rechercher ou interpréter. BBC Future cite des estimations selon lesquelles environ 1 % du matériel contenu dans les bibliothèques et les archives du monde entier est partiellement ou totalement crypté. Même si cette estimation est incertaine, le problème sous-jacent est concret : les documents peuvent utiliser des systèmes de substitution, des symboles multiples pour une lettre, des leurres délibérés ou des langages qui ne sont plus compris. Le travail manuel peut être lent ; la BBC rapporte que le déchiffrement d'une lettre de trois pages de l'empereur romain germanique Charles Quint a pris six mois car elle utilisait 120 symboles chiffrés différents.
Le décodage assisté par l’IA pourrait élargir l’éventail des preuves historiques disponibles pour la recherche. La BBC affirme que les documents cryptés peuvent contenir de la correspondance diplomatique, des pratiques médicales, des rituels, des romances et des détails quotidiens omis des récits historiques établis. Il fait référence à des lettres écrites par Mary, reine d'Écosse, dont le contenu décodé aurait fait la lumière sur de prétendus complots visant à regagner son trône et sur sa relation avec son fils. Le rapport décrit également une lettre de la guerre de Trente Ans dont le texte décodé contenait des avertissements concernant des complots présumés entre alliés protestants suédois.
Ces exemples montrent pourquoi le décodage n’est pas qu’un simple exercice technique : le résultat peut affecter l’interprétation des personnes et des époques. L’approche rapportée peut également être importante là où les hypothèses linguistiques conventionnelles échouent. Les grands modèles de langage sont généralement formés sur d’énormes collections de textes lisibles, tandis que les ensembles de données de chiffrement historiques sont beaucoup plus petits et plus difficiles à assembler. Les chercheurs de Descrypt compilent donc des documents d'archives cryptés, dont 400 cartes postales codées de la fin du 19e et du début du 20e siècle. BBC Future rapporte que certains fragments décodés semblent être des lettres d'amour allemandes.
Un système capable d’apprendre à partir de symboles chiffrés appariés et de leurs formes décodées, tout en utilisant les connaissances linguistiques historiques comme source d’indices, pourrait aider à prioriser le travail d’archivage. Mais la source n’établit pas que l’outil est largement disponible, évalué par des pairs ou prêt pour une interprétation historique non supervisée.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Que regarder ensuite
Les tests importants seront de savoir si ces systèmes fonctionnent de manière fiable sur des documents dont les réponses sont inconnues, s'ils peuvent distinguer les lectures plausibles des lectures fabriquées, et si les chercheurs peuvent rassembler suffisamment de données historiques représentatives pour la formation. Les résultats rapportés par la BBC n’ont pas été confirmés de manière indépendante à partir des principaux documents de recherche présentés ici.
La question centrale est la vérification. Un chiffre peut produire une lecture grammaticalement convaincante mais incorrecte, en particulier lorsque la langue sous-jacente, le système symbolique ou le contexte historique sont incertains. La BBC rapporte que l'outil Descrypt enregistre son raisonnement et explique pourquoi une solution est plausible, ce que les chercheurs voient comme un moyen de réduire les interprétations hallucinées. Cette documentation est utile, mais la source ne fournit pas de taux de précision indépendants, de seuils de confiance, de résultats de référence sur des chiffres inconnus ou d'exemples dans lesquels le système a rejeté une solution attrayante mais erronée.
Les futures évaluations devraient tester des documents dont le contenu reste inconnu plutôt que uniquement des manuscrits que les chercheurs ont déjà déchiffrés. Les expériences Copiale et Borg rapportées bénéficient du matériel de référence existant, ce qui en fait des démonstrations utiles mais ne prouve pas en soi que le système peut résoudre des textes véritablement non résolus. On ne sait pas non plus comment les performances changent avec des pages endommagées, des systèmes d'écriture rares, de multiples couches de cryptage, des symboles leurres délibérés ou une langue absente des données de formation.
La BBC affirme que l'équipe espère relever certains de ces défis en élargissant la formation aux écritures, aux alphabets et aux répertoires symboliques. La disponibilité et la gouvernance sont des inconnues supplémentaires. BBC Future décrit un outil de recherche que les chercheurs ou les membres du public pourraient éventuellement utiliser, mais il ne dit pas que le chatbot combiné est rendu public ni ne précise ses conditions d'accès. Une utilisation plus large pourrait aider les bibliothèques et les chercheurs indépendants, tandis que des lectures erronées des machines pourraient entrer dans les bases de données ou les histoires populaires avant que les experts ne les examinent.
Cette évaluation s'appuie uniquement sur le rapport de la BBC ; les découvertes techniques citées, les affirmations temporelles et les interprétations historiques n’ont pas été confirmées ici de manière indépendante. Le prochain développement significatif serait un système public ou un document de recherche rapportant des tests reproductibles, une analyse des erreurs et une validation par des experts sur du matériel auparavant non déchiffré.